MaxCompute - ODPS重装上阵　第四弹 - CTE，VALUES，SEMIJOIN

摘要： MaxCompute（原ODPS）是阿里云自主研发的具有业界领先水平的分布式大数据处理平台, 尤其在集团内部得到广泛应用，支撑了多个BU的核心业务。 MaxCompute除了持续优化性能外，也致力于提升SQL语言的用户体验和表达能力，提高广大ODPS开发者的生产力。

MaxCompute（原ODPS）是阿里云自主研发的具有业界领先水平的分布式大数据处理平台, 尤其在集团内部得到广泛应用，支撑了多个BU的核心业务。 MaxCompute除了持续优化性能外，也致力于提升SQL语言的用户体验和表达能力，提高广大ODPS开发者的生产力。

MaxCompute基于ODPS2.0新一代的SQL引擎，显著提升了SQL语言编译过程的易用性与语言的表达能力。我们在此推出MaxCompute(ODPS2.0)重装上阵系列文章

第一弹 - 善用MaxCompute编译器的错误和警告

第二弹 - 新的基本数据类型与内建函数

第三弹 - 复杂类型

第四弹 - CTE，VALUES，SEMIJOIN

上次向您介绍了复杂类型，从本篇开始，向您介绍MaxCompute在SQL语言DML方面的改进

场景1

_需要写一个复现的SQL，从多个表中读取数据，有些之间做Join，有些之间做Union，生成中间数据又要Join，最后需要输出多张表，最后写成了n层嵌套的子查询，自己都看不懂了。而且同样的查询，在不同的子查询中有重复。为了维护方便，把复杂的语句拆成多个语句，但是发现每个语句都需要单独提交，排队，并且要将中间结果写到本来不需要的临时表，在后面的语句中再读出来，慢了好多。。。

场景2

正在开发新项目，需要给一个小数据表准备些基本数据，但是没有INSERT ... VALUES 语句，没办法把数据和创建表的DDL放在一起维护，只好另用一些脚本，调用ODPS命令行准备数据。。。

场景3

想测试一个新写的UDF，只写SELECT myudf('123');会报错，还必须创建一个dual表，里面加一行数据，好麻烦。如果测试UDAF，还要在测试表里面准备多行数据，每次测试不同的输入都要修改表内容或者创建新表，如果有个办法不用创建表也能不同的数据组合测试我的UDF就好了。。。

场景4

迁移一个原来在Oracle上面的ETL系统，发现用了 WHERE EXISTS( SELECT ...) 和 WHERE IN (SELECT ...) 这类的语句，可是发现ODPS在这方面支持不完整，还要手工将这些半连接的语句转换为普通JOIN，再过滤。。。

MaxCompute采用基于ODPS2.0的SQL引擎，对DML进行了大幅扩充，提高了易用性和兼容性，基本解决了上述问题。

Common Table Expression (CTE)

MaxCompute支持SQL标准的CTE。能够提高SQL语句的可读性与执行效率。

此文中采用MaxCompute Studio作展示，首先，安装MaxCompute Studio，导入测试MaxCompute项目，创建工程，建立一个新的MaxCompute脚本文件,　如下

可以看到，顶层的union两侧各为一个join，join的左表是相同的查询。通过写子查询的方式，只能重复这段代码。

使用CTE的方式重写以上语句

可以看到，a对应的子查询只需要写一次，在后面重用，CTE的WITH字句中可以指定多个子查询，像使用变量一样在整个语句中反复重用。除了重用外，也不必再反复嵌套了。

编译此脚本，可以观察执行计划如下

其中M1, M2, M4三个分布式任务分别对应对应三个输入表，双击M2可以看到中具体执行的DAG（在DAG中再次双击可以返回），如下

可以看到对src读后进行过滤的DAG。对src的读取与过滤在整个执行计划中只需要一次 ( 注1 )。

VALUES

创建一个新的文件，如下：

执行后在，MaxCompute Project Explorer中可以找到新创建的表，并看到values中的数据已经插入到表中，如下：

有的时候表的列很多，准备数据的时候希望只插入部分列的数据，此时可以用插入列表功能

执行后，MaxCompute Project Explorer中找到目标表，并看到values中的数据已经插入，如下：

对于在values中没有制定的列，可以看到取缺省值为NULL。插入列表功能不一定和VALUES一起用，对于INSERT INTO ... SELECT..., 同样可以使用。

INSERT... VALUES... 有一个限制，values必须是常量，但是有的时候希望在插入的数据中进行一些简单的运算，这个时候可以使用MaxCompute的VALUES TABLE功能，如下：

其中的VALUES (...), (...) t (a, b), 相当于定义了一个名为t，列为a, b的表，类型为(a string, b string)，其中的类型从VALUES列表中推导。这样在不准备任何物理表的时候，可以模拟一个有任意数据的，多行的表，并进行任意运算。

实际上，VALUES表并不限于在INSERT语句中使用，任何DML语句都可以使用。

还有一种VALUES表的特殊形式

selectabs(-1),length('abc'),getdate();

也就是可以不写from语句，直接执行SELECT，只要SELECT的表达式列表不用任何上游表数据就可以。其底层实现为从一个1行，0列的匿名VALUES表选取。这样，在希望测试一些函数，比如自己的UDF等，就再也不用手工创建DUAL表了。

SEMI JOIN

MaxCompute支持SEMI JOIN（半连接）。SEMI JOIN中，右表只用来过滤左表的数据而不出现在结果集中。支持的语法包括LEFT SEMI JOIN，LEFT ANTI JOIN，(NOT) IN SUBQUERY，(NOT) EXISTS

LEFT SEMI JOIN

返回左表中的数据，当join条件成立，也就是mytable1中某行的id在mytable2的所有id中出现过，此行就保留在结果集中

例如:

SELECT * from mytable1 a LEFT SEMI JOIN mytable2 b on a.id=b.id;

只会返回mytable1中的数据，只要mytable1的id在mytable2的id中出现过

LEFT ANTI JOIN

返回左表中的数据，当join条件不成立，也就是mytable1中某行的id在mytable2的所有id中没有出现过，此行就保留在结果集中

例如:

SELECT*frommytable1 aLEFTANTIJOINmytable2 bona.id=b.id;

只会返回mytable1中的数据，只要mytable1的id在mytable2的id没有出现过

IN SUBQUERY/NOT IN SUBQUERY

IN SUBQUERY与LEFT SEMI JOIN类似。

例如:

SELECT*frommytable1whereidin(selectidfrommytable2);

等效于

SELECT*frommytable1 aLEFTSEMIJOINmytable2 bona.id=b.id;

原有ODPS也支持IN SUBQUERY，但是不支持correlated条件，MaxCompute支持

例如:

SELECT*frommytable1whereidin(selectidfrommytable2wherevalue= mytable1.value);

其中子查询中的where value = mytable1.value就是一个correlated条件，原有ODPS对于这种既引用了子查询中源表，由引用了外层查询源表的表达式时，会报告错误。MaxCompute支持这种用法，这样的过滤条件事实上构成了SEMI JOIN中的ON条件的一部分。

对于NOT IN SUBQUERY，类似于LEFT ANTI JOIN，但是有一点显著不同

例如:

SELECT*frommytable1whereidnotin(selectidfrommytable2);

如果mytable2中的所有id都不为NULL，则等效于

SELECT*frommytable1 aLEFTANTIJOINmytable2 bona.id=b.id;

但是，如果mytable2中有任何为NULL的列，则 not in表达式会为NULL，导致where条件不成立，无数据返回，此时与LEFT ANTI JOIN不同。

原有ODPS也支持[NOT] IN SUBQUERY不作为JOIN条件，例如出现在非WHERE语句中，或者虽然在WHERE语句中，但无法转换为JOIN条件。MaxCompute仍然支持这种用法，但是此时因为无法转换为SEMI JOIN而必须实现启动一个单独的作业来运行SUBQUERY，所以不支持correlated条件。

例如:

SELECT*frommytable1whereidin(selectidfrommytable2)ORvalue>0;

因为WHERE中包含了OR，导致无法转换为SEMI JOIN，会单独启动作业执行子查询

另外在处理分区表的时候，也会有特殊处理

SELECT*fromsales_detailwheredsin(selectdtfromsales_date);

其中的ds如果是分区列，则select dt from sales_date 会单独启动作业执行子查询，而不会转化为SEMIJOIN，执行后的结果会逐个与ds比较，sales_detail中ds值不在返回结果中的分区不会读取，保证分区裁剪仍然有效。

EXISTS SUBQUERY/NOT EXISTS SUBQUERY

当SUBQUERY中有至少一行数据时候，返回TRUE，否则FALSE。NOT EXISTS的时候则相反。目前只支持含有correlated WHERE条件的子查询。EXISTS SUBQUERY/NOT EXISTS SUBQUERY实现的方式是转换为LEFT SEMI JOIN或者LEFT ANTI JOIN

例如:

SELECT*frommytable1whereexists(select*frommytable2whereid= mytable1.id);`

等效于

SELECT*frommytable1 aLEFTSEMIJOINmytable2 bona.id=b.id;

而

SELECT*frommytable1wherenotexists(select*frommytable2whereid= mytable1.id);`

则等效于

SELECT*frommytable1 aLEFTANTIJOINmytable2 bona.id=b.id;

其他改进

MaxCompute支持UNION [DISTINCT] - 其中DISTINCT为忽略

SELECT*FROMsrc1UNIONSELECT*FROMsrc2;

执行的效果相当于

SELECTDISTINCT*FROM(SELECT*FROMsrc1UNIONALLSELECT*FROMsrc2) t;

支持IMPLICIT JOIN

SELECT*FROMtable1, table2WHEREtable1.id = table2.id;

执行的效果相当于

SELECT*FROMtable1JOINtable2ONtable1.id = table2.id;

此功能主要是方便从其他数据库系统迁移，对于信贷买，我们还是推荐您使用JOIN，明确表示意图

支持新的SELECT语序

在一个完整的查询语句中，例如

SELECTkey,max(value)FROMsrc tWHEREvalue>0GROUPBYkeyHAVINGsum(value) >100ORDERBYkeyLIMIT100;

实际上的逻辑执行顺序是 FROM->WHERE->GROUY BY->HAVING->SELECT->ORDER BY->LIMIT，前一个是后一个的输入，与标准的书写语序实际并不相同。很多容易混淆的问题，都是由此引起的。例如order by中只能引用select列表中生成的列，而不是访问FROM的源表中的列。HAVING可以访问的是 group by key和聚合函数。SELECT的时候，如果有GROUP BY，就只能访问group key和聚合函数，而不是FROM中源表中的列。

MaxCompute支持以执行顺序书写查询语句，例如上面的语句可以写为

FROMsrc tWHEREvalue >0GROUPBYkeyHAVING sum(value) >100SELECTkey, max(value)ORDERBYkeyLIMIT100;

书写顺序和执行顺序一致，就不容易混淆了。这样有一个额外的好处，在MaxCompute Studio中写SQL语句的时候，会有智能提示的功能，如果是SELECT在前，书写select列表的表达式的时候，因为FROM还没有写，MaxCompute Studio没办法知道可能访问那些列，也就不能做提示。如下

需要先写好FROM，再回头写SELECT列表，才能提示。如下

如果使用上述以FROM起始的方式书写，则可以自然而然的根据上下文进行提示。如下

支持顶层UNION

ODPS1.0不支持顶层UNION。ODPS2.0可以支持，例如

SELECT*FROMsrcUNIONALLSELECT*FROMsrc;

UNION后LIMIT的语义变化。

大部分DBMS系统中，如MySQL，Hive等，UNION后如果有CLUSTER BY, DISTRIBUTE BY, SORT BY, ORDER BY或者LIMIT子句，其作用于与前面所有UNION的结果，而不是UNION的最后一路。ODPS2.0在set odps.sql.type.system.odps2=true;的时候，也采用此行为。例如:

setodps.sql.type.system.odps2=true;SELECTexplode(array(1,3))AS(a)UNIONALLSELECTexplode(array(0,2,4))AS(a)ORDERBYaLIMIT3;

小节

MaxCompute大大扩充了DML语句的支持，在易用性，兼容性和性能方面，可以更好的满足您的需求。对于SQL比较熟悉的专家会发现，上述功能大部分是标准的SQL支持的功能。MaxCompute会持续提升与标准SQL和业界常用产品的兼容性。

除此之外，针对MaxCompute用户的特点，也就是需要在非常复杂的业务场景下，支持对己大量数据的处理，MaxCompute提供了特有的脚本模式和参数化视图，将在下一次为您介绍。

标注

注1

是否合并或者分裂子查询，是由ODPS2.0的基于代价的优化器 (CBO)做出决定的，SQL本身的书写方式，不管是CTE还是子查询，并不能确保物理执行计划的合并或者分裂。

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 199,830评论 5赞 468
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 83,992评论 2赞 376
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 146,875评论 0赞 331
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 53,837评论 1赞 271
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 62,734评论 5赞 360
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,091评论 1赞 277
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 37,550评论 3赞 390
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,217评论 0赞 254
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 40,368评论 1赞 294
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,298评论 2赞 317
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,350评论 1赞 329
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,027评论 3赞 315
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 38,623评论 3赞 303
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,706评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 30,940评论 1赞 255
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 42,349评论 2赞 346
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 41,936评论 2赞 341

MaxCompute - ODPS重装上阵 第四弹 - CTE，VALUES，SEMIJOIN

推荐阅读更多精彩内容

MaxCompute - ODPS重装上阵　第四弹 - CTE，VALUES，SEMIJOIN