了解TensorFlow框架

2015年9月,Google于TensorFlow开源之际,发布了TensorFlow白皮书,介绍了TensorFlow的设计理念和实现方式。现在流行的大部分深度学习框架,都基于所谓的“数据流图”编程模型(又称“计算图”),为我们今后的编程提供了一种可选的编程范式。在本文中,我将以问答的形式解释关于TensorFlow的种种疑问。

Qustion 1:“数据流图”编程模型与传统编程模型的区别?

首先,“数据流图”的核心是一个有向图,图中的节点表示运算操作,边表示数据,整个图展现了数据的流动,因此称为数据流图。下图是一个示例。

在传统编程中,虽然我们也是对数据进行操作,但基本的三种控制逻辑“顺序、选择、循环”导致我们只能按照单一的流程处理数据,相当于数据流图只是一条线,而不是真正的图。换句话说,传统编程模型解决的是顺序操作流程,而数据流图则提供了并行计算的解决方案。其次,数据流图是数据驱动的,而不是指令驱动的。程序只规定数据的流向,而不能规定每一个操作何时执行,这就在另一个层面上提高了并行计算能力。最后,数据流图(我们这里只探讨静态数据流图)的定义和执行是分开的,用户不能像往常一样在某个操作处打断点查看输出内容,这削弱了该模型的调试能力,是为性能优化而付出的代价。

Qustion 2:TensorFlow的系统架构什么样?

TensorFlow框架包含三个模块,分别是client、master和worker,它们之间的逻辑关系如下图所示。

左侧为单机模式,右侧为分布式模式。client提供用户使用的编程接口,比如Python、C++ API等。master负责接受client的请求,构造数据流图,并分配任务给worker。在单机模式中,只有一个worker,负责计算数据流图中的所有计算任务。在分布式模式中,master需要为不同的worker分配不同的任务,以使总用时最小。

Question 3:分布式模式中,master如何合理地为多个worker分配任务?

master需要预先估算数据流图中各个节点的数据量和计算时长,估计数据量是为了保证各个设备的内存占用相差不大,估计计算时长是为了使总用时最短。这一步的算法在TensorFlow中称为Node Placement,即为每个节点寻找一个放置的位置。该算法会根据输入输出数据的规模、运算符种类来估算。此外,也可以根据实际运行过程中的实测结果来决定。

Question 4:分布式设备间的数据传输怎么实现?

当master为各个设备划分好任务后,这些设备间不可避免地要进行数据传输。TensorFlow的做法如下图所示。

首先,对跨机器的数据传输做了一层隔离,A设备中增加Send节点,用来对外发送数据,B设备中增加Receive节点,用来接收数据。这样,Send和Receive之间的通信与设备内部的通信可以使用完全不同的两套方案,简化了内部逻辑。实际实现中,Send和Receive之间通过TCP或RDMA的方式进行通信。

Question 5:如何scheduling?

当用户喂入数据,启动数据流图后,TensorFlow如何决定各个节点的执行顺序呢?朴素的想法是,每个节点执行完后通知与之相连的下一个节点,但如果下个节点有多个输入,它仍然无法启动,必须等到所有输入都到位后才能开始。因此TensorFlow使用了依赖计数的机制,每个节点记录其尚未满足的依赖的个数,当个数降为0时,启动该节点。这一方案完美体现了数据驱动的设计理念。

Question 6:反向传播的数据依赖怎么处理?

一旦考虑反向传播,数据流图就没那么简单了。虽然用户不必手动构造反向数据流,但TensorFlow会自动为我们构造,就像下图这个样子。

仔细观察上图,可以发现很多跨越数层的依赖,比如从MatMul到dAdd的灰色连线。这会导致GPU的内存占用急剧增大,因为几乎每个阶段计算的中间结果都不能丢弃。TensorFlow针对这种情况采取了若干种优化措施:(1)用更复杂的启发式算法调整图的执行顺序;(2)反向传播时重新计算前向传播的中间结果;(3)把中间结果保存到CPU内存中。

结语

Tensorflow开源至今,已经有了长足的发展。最新版本的实现可能与本文所述不再一致,但设计者的初衷不变,都是为了提供一个高扩展性、快速、高效的机器学习计算平台。

参考资料

TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems Google Research

©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 194,319评论 5 459
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 81,801评论 2 371
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 141,567评论 0 319
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 52,156评论 1 263
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 61,019评论 4 355
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 46,090评论 1 272
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 36,500评论 3 381
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 35,192评论 0 253
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 39,474评论 1 290
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 34,566评论 2 309
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 36,338评论 1 326
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 32,212评论 3 312
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 37,572评论 3 298
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 28,890评论 0 17
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 30,169评论 1 250
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 41,478评论 2 341
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 40,661评论 2 335

推荐阅读更多精彩内容