您的位置：首页>栏目首页 > 供应 >

GPT-4参数最新爆料！1.76万亿参数，8个2200亿MoE模型，PyTorch创始人深信不疑-速递

2023-06-21 16:34:32 来源：清一色财经

GPT-4远不止1万亿，甚至，还是8个2200亿参数组成的混合专家模型。

【资料图】

家人们，GPT-4的参数可能还真不止1万亿！

近来，美国知名骇客George Hotz在接受采访时透露，GPT-4由8个220B模型组成。

这么算来，8 x 220B = 1.76万亿。

就连PyTorch的创建者Soumith Chintala对此也深信不疑。

GPT-4：8 x 220B专家模型用不同的数据/任务分布和16-iter推理进行训练。

如果真是这样的话，GPT-4的训练可能更加有效。

1.76万亿「八头蛇」？

在GPT-4还未放出之前，GPT-3有1750亿个参数，一众网友猜测GPT-4岂不是要逆天，最起码1万亿。

而George在接受Latent Space的采访时，对GPT4架构的描述着实让人震惊。

他的部分原话如下：

GPT-4每个head都有2200亿参数，是一个8路的混合模型。所以，混合模型是当你想不出办法的时候才会做的。OpenAI训练了相同模型8次，他们有一些小技巧。他们实际上进行了16次推断。

他特别强调，OpenAI做了8个混合专家模型，任何人可以花8倍资金都能训练出来。

也就是说，人们能够训练更小模型更长时间，微调后，就能找到这些技巧。

OpenAI曾经发表类似关于让计算量不变的情况下，让训练更好的算法，比较像BatchNorm和NoBatchNorm。

网友热评

就像George所说，这是8个较小的模型，如果有足够资金训练8个混合模型，这是一个微不足道的解决方案。

所以，GPT-4是GPT-3的10倍，而1月份的所有小圈圈大圈圈的meme实际上是……真的？！

网友得知秘诀后，打算自己也要训练一个LLaMA集合体与GPT-4竞争。

还有网友称，这有点像LLM-Blender。

我早就听到了稍微可信的传言，说GPT-4将是MoE，但从未得到证实。MoE和大约1万亿个参数不会让我感到惊讶，这听起来极为合理。

还有网友进行深度分析：

老实说，我预计这将是人工智能架构的下一阶段。我们已经看到特定任务模型在任务中的表现比一般模型好得多。

因此，将许多特定任务模型组合在一起将是下一个合乎逻辑的步骤。这几乎使升级系统变得容易得多，一次只能处理一个模型。

话虽如此，OpenAI以一种未来可能会，也可能不会的方式做到了这一点。显然，组合系统可能会有更多的小模型，而不是几个更大的模型。

如果这是真的，这是否意味着每个220B模型也有32K的上下文长度？

网友下了功夫，给它命名为「九头蛇」。

关键词：

GPT-4参数最新爆料！1.76万亿参数，8个2200亿MoE模型，PyTorch创始人深信不疑-速递

1.76万亿「八头蛇」？

网友热评

相关阅读

GPT-4参数最新爆料！1.76万亿参数，8个2...

新迎第三幼儿园开展“浓情端午，粽享欢...

甘肃临泽：寻味端午传承文明

速看：收盘丨沪指跌1.31%失守3200点；AI...

清宫收藏究竟牛到何种程度？_焦点播报

第十九届西博会发布会④｜市民参观更方...

广信区茶亭镇：党建引领齐聚力禁毒宣...

【消费教育】图说：电信网络诈骗十大高...

与粽不同你粽意吗|今日快讯

唐山全力营造一流营商环境|全球新视野

“四季‘焉’火燃情‘耆’航”红酒烧...

英联股份（002846）6月21日主力资金净买...

首部现代设施农业建设规划发布——加快...

京城头号绯闻百度云txt 京城头号绯闻百...

环球微速讯：小诺霉素_关于小诺霉素的介绍

大小S回应黄子佼：你孩子还小，老婆还年...

安徽省歙县市场监管局开展端午食品安全...

行政决策在行政管理中的重要作用有哪些

端午“粽”头戏！海口秀英区推出3条旅游...

3元早餐、5元咖啡、10元吃面，血拼价格...

要闻

GPT-4参数最新爆料！1.76万亿参数，8个2200亿MoE模型，PyTorch创始人深信不疑-速递

1.76万亿「八头蛇」？

网友热评

相关阅读

要闻

创投