第333章 挖人(1/2)

我们马上记住本站网址,www.ri4.net,若被浏/览/器/转/码,可退出转/码继续阅读,感谢支持.

第二天上午。

棕榈滩国际机场。

按照原定安排,陈默和陆静怡将从这里直接返回香港。

车队刚刚驶进机场,陈默便接到了伊利亚的电话。

“陈,你还没有离开美国吧?”

“正在机场。”

“先别走。”

伊利亚的声音沙哑。

陈默看了一眼时间。

“出什么事了?”

“下一代语言模型的第一次扩大训练失败了。”

“模型结构有问题?”

“不是模型。”

电话另一端传来键盘敲击声。

“昨天晚上,我们按照原方案将训练规模扩大到五百一十二张GPU。”

“单机测试正常,接入的机器越多,训练效率反而越低。”

“显存里堆满重复数据,大量GPU都在等待其他节点完成计算,机器之间传输参数的时间,甚至超过了真正用于训练的时间。”

伊利亚停顿片刻。

“最后系统在第七个小时失去同步,训练结果全部作废。”

陈默没有立即说话。

一台机器工作很快,不代表将几百台机器放在一起,速度便能增加几百倍。

模型需要被拆分到不同GPU上。

每一块GPU计算完自己的部分,还要与其他节点交换结果。

数据如何分配。

显存如何利用。

什么时候通信。

任何一个环节出现堵塞,价值数百万美元的GPU集群都会陷入等待。

纸面算力再大,也无法转化成真正的训练能力。

“现在的利用率多少?”

“平均百分之三十二。”

伊利亚回答。

“最差的时候不到百分之二十。”

OpenAI目前拥有两千多张GPU。

如果始终保持这种效率,真正发挥作用的算力甚至不到账面规模的一半。

未来将集群扩大四倍,问题只会更加严重。

“上次会议结束以前,你说只剩下一个办法。”

陈默想起马斯克推门时被打断的谈话。

“就是这个?”

“对。”

伊利亚说道。

“谷歌拥有比我们更多的机器、工程师和数据中心。”

“只靠采购GPU,我们永远追不上他们。”

“OpenAI必须建立自己的计算系统,让每一张GPU完成更多工作。”

“我们需要真正理解CUDA、显存、通信与分布式系统的人。”

“我已经让Sam在硅谷寻找合适的人选。”

“不用找了。”陈默说道。

伊利亚安静了两秒。

“你有推荐?”

“知道一个。”

陈默挂断电话,看向坐在身旁的陆静怡。

“让机组更改飞行计划。”

“先去旧金山。”

陆静怡显然已经从刚才的通话里听出了原因。

“林启航?”

本章节未完,点击这里继续阅读下一页(1/2)