全球播报:GPT-4参数最新爆料!1.76万亿参数,8个2200亿MoE模型,PyTorch创始人深信不疑
GPT-4远不止1万亿,甚至,还是8个2200亿参数组成的混合专家模型。
(相关资料图)
家人们,GPT-4的参数可能还真不止1万亿!
近来,美国知名骇客George Hotz在接受采访时透露,GPT-4由8个220B模型组成。
这么算来,8 x 220B = 1.76万亿。
就连PyTorch的创建者Soumith Chintala对此也深信不疑。
GPT-4:8 x 220B专家模型用不同的数据/任务分布和16-iter推理进行训练。
如果真是这样的话,GPT-4的训练可能更加有效。
1.76万亿「八头蛇」?
在GPT-4还未放出之前,GPT-3有1750亿个参数,一众网友猜测GPT-4岂不是要逆天,最起码1万亿。
而George在接受Latent Space的采访时,对GPT4架构的描述着实让人震惊。
他的部分原话如下:
GPT-4每个head都有2200亿参数,是一个8路的混合模型。所以,混合模型是当你想不出办法的时候才会做的。OpenAI训练了相同模型8次,他们有一些小技巧。他们实际上进行了16次推断。
他特别强调,OpenAI做了8个混合专家模型,任何人可以花8倍资金都能训练出来。
也就是说,人们能够训练更小模型更长时间,微调后,就能找到这些技巧。
OpenAI曾经发表类似关于让计算量不变的情况下,让训练更好的算法,比较像BatchNorm和NoBatchNorm。
网友热评
就像George所说,这是8个较小的模型,如果有足够资金训练8个混合模型,这是一个微不足道的解决方案。
所以,GPT-4是GPT-3的10倍,而1月份的所有小圈圈大圈圈的meme实际上是……真的?!
网友得知秘诀后,打算自己也要训练一个LLaMA集合体与GPT-4竞争。
还有网友称,这有点像LLM-Blender。
我早就听到了稍微可信的传言,说GPT-4将是MoE,但从未得到证实。MoE和大约1万亿个参数不会让我感到惊讶,这听起来极为合理。
还有网友进行深度分析:
老实说,我预计这将是人工智能架构的下一阶段。我们已经看到特定任务模型在任务中的表现比一般模型好得多。
因此,将许多特定任务模型组合在一起将是下一个合乎逻辑的步骤。这几乎使升级系统变得容易得多,一次只能处理一个模型。
话虽如此,OpenAI以一种未来可能会,也可能不会的方式做到了这一点。显然,组合系统可能会有更多的小模型,而不是几个更大的模型。
如果这是真的,这是否意味着每个220B模型也有32K的上下文长度?
网友下了功夫,给它命名为「九头蛇」。
关键词:
您可能也感兴趣:
为您推荐
各种输入法的切换快捷方式是 各种中文输入法切换的键盘命令是
天下秀(600556)6月21日主力资金净卖出2.11亿元
我国最大海上油田累产原油突破5亿吨
排行
最近更新
今日要闻
- 炎亚纶事件再升级!警方介入、代言终止,最高可能面临7年刑期 全球播资讯
- 各种输入法的切换快捷方式是 各种中文输入法切换的键盘命令是
- 天下秀(600556)6月21日主力资金净卖出2.11亿元
- 我国最大海上油田累产原油突破5亿吨
- 全球视点!win7不是正版桌面变黑怎么办图标不显示 win7不是正版桌面变黑怎么办
- 湖北不动产登记迈入“房地农林”一体化新阶段
- 山东分公司组织召开德州博物馆项目开工策划会|快讯
- 早安,地球村丨点赞!江西10人当选“中国好人” 全球热文
- 北向资金净卖出6.41亿元,宁德时代、立讯精密等获加仓_环球热资讯
- 天天最资讯丨现代牙科(03600)6月21日斥资约28.19万港元回购10万股