《计算系统与同步算术》中推崇的苏式暴力美学吗?
用一个统一的控制器,发出一条指令,让成百上千个微型算术单元在同一时刻,同步执行一模一样的乘加操作!
为了验证自己的想法,漆昊在网络上开始找文献来验证。
遇上没什麽用文献,漆昊基本上看个重点就把它关了,然後继续看下一篇,这时一篇顶会论文进入了他的视线。
那是发表於2009年ICML(国际机器学习大会)上的一篇经典之作,而一作和通讯作者的署名里,赫然写着史丹福大学教授机器学习领域大牛吴恩达的名字。
漆昊眼睛一亮,迅速点开文档,开始看这篇在当下还略显冷门的学术文献。
论文里详尽的数据和严谨的实验,正如一块完美的拼图,严丝合缝地印证了他刚才的所有数学推导。
按照吴恩达团队在论文中的阐述,CPU复杂的架构注定了其电晶体的大头被分配给了缓存和分支预测,这使得它用於实际计算的物理核心极少,在面对海量矩阵运算时并行的上限极低。
而GPU则是另一条完全不同的进化路线,它内部塞满了成百上千个轻量级的计算单元,这些单元可以在统一的时钟信号下,以同步算术的模式同时执行一模一样的矩阵乘加操作,在同等功耗下,其提供的单精度浮点算力对CPU堪称是碾压级别的。
论文里给出了一个重要的实验数据:
在训练一个拥有四层结构,上亿参数规模的深度网络时,如果老老实实地使用CPU组成的计算集群,整个训练周期长达数周,耗费的电费和时间成本令人窒息,然而当他们将代码重构,移植到单张英伟达GTX280显卡上後,GPU直接将这几周的训练时间,暴力压缩到了区区1天以内!整整实现了近70倍的效率跃升!
「70倍的提速啊————」
在当下,学术界为了把算法的精确度提升个百分之一,都能敲键盘把键盘敲出火星子,而这种直接在物理效率上拉开70倍差距的物理开挂,简直让人兴奋。
漆昊高兴过後,随之而来的却是一个巨大的疑惑。
既然吴恩达教授早在2009年就用这篇顶会论文向全世界展示了GPU的威力,那为什麽时至今日,陈工他们这些一线的工程技术人员,依然把用CPU训练神经网络当成约定俗成的标准答案?
为什麽这项能让效率起飞的技术,如今依然只是停留在少数顶尖高校的实验室里,并没有在工业界
本章未完,请点击下一页继续阅读!