数据库
首页 > 数据库> > SparkSQL 和 RDD

SparkSQL 和 RDD

作者:互联网

不同的主要点是在于其所操作的数据是结构化的, 提供了对数据更强的感知和分析能力, 能够对代码进行更深层的优化, 而这种能力是由一个叫做 Catalyst 的优化器所提供的

Catalyst 的主要运作原理是分为三步, 先对 SQL 或者 Dataset 的代码解析, 生成逻辑计划, 后对逻辑计划进行优化, 再生成物理计划, 最后生成代码到集群中以 RDD 的形式运行

标签:代码,生成,RDD,计划,SparkSQL,优化,Catalyst
来源: https://www.cnblogs.com/lyang4-09/p/15618592.html