← 返回资讯
陈默
AI 行业分析师
已审核

GPT-4用MoE架构:16个专家分工,训练成本降至1/6

前几天我干了一件特别无聊的事——把一张“程序员改bug前vs改bug后”的梗图扔给了ChatGPT。结果它完全懵了,像个睁眼瞎。可同样的图发给GPT-4,它直接来了一句:“左边是自信满满打开代码,右边是发现bug是需求文档写错了。”

GPT-4用MoE架构:16个专家分工,训练成本降至1/6

GPT-4用MoE架构:16个专家分工,训练成本降至1/6


当AI第一次睁开眼睛,它看到了什么?

前几天我干了一件特别无聊的事——把一张“程序员改bug前vs改bug后”的梗图扔给了ChatGPT。结果它完全懵了,像个睁眼瞎。可同样的图发给GPT-4,它直接来了一句:“左边是自信满满打开代码,右边是发现bug是需求文档写错了。”

那一刻,我后背一凉。

从GPT-3到ChatGPT,我们一直在跟一个“盲人”聊天。它背下了全世界所有的知识,能写诗、编故事,还能跟你扯“先有鸡还是先有蛋”。但它从来没见过这个世界长什么样——不知道苹果是红色的,不知道猫会抓老鼠,更不知道一张梗图背后藏着多少程序员的血泪。

而GPT-4,是AI第一次睁开眼睛。


1.8万亿参数?别被数字骗了

先聊点硬核的。GPT-4的参数,据传有1.8万亿。对比一下,GPT-3是1750亿,翻了整整10倍。听到这儿你是不是想说:“哇,好厉害!”——别急,OpenAI这帮人可鸡贼了。

他们没搞一个超级大模型,而是搞了个“混合专家模型”(MoE)。什么意思呢?就像你开一家公司,不是把所有员工都叫到会议室开会,而是谁懂这事儿谁上。据分析,GPT-4里藏了16个“专家”,每个专家有1110亿参数。每次你问它一个问题,它只激活其中2个专家来回答。

我算过一笔账:如果搞成单一的大模型,每次推理要算3700 TFLOP;用MoE后,只要560 TFLOP。成本直接砍到1/6。这招太聪明了,又省电又省显卡,还不耽误干活。

说到训练成本,那才叫一个刺激。据一些分析报告,用了25000块A100 GPU,跑90到100天,利用率只有32%到36%。为什么这么低?因为动不动就崩啊!训练大模型就像在悬崖边上开车,随时可能翻车。崩了就得从检查点恢复,一恢复就是好几个小时。我干过这行,知道这有多蛋疼——每次看到“训练失败”四个字,血压直接飙到180。

不过最让我震惊的,是那个batch size。OpenAI最后搞到了6000万——但别被这个数字唬住,因为不是每个专家都能看到所有token,每个专家实际只处理750万个token。我见过不少人在技术群里拿这个数字吹牛,说实话,挺无语的。就像有人炫耀自己年薪百万,结果发现是越南盾。


多模态:从盲人摸象到睁眼看世界

我说ChatGPT是盲人,真不是开玩笑。GPT-3.5只能处理文本,就像一个被蒙上眼睛的天才。你问它“苹果是什么颜色”,它能回答“红色或绿色”。但你要是给它一张青苹果的照片问“这是什么”,它就懵了——它根本不知道“青苹果”长什么样。

GPT-4不一样。它能同时处理图像和文本,用的是“交叉注意力机制”。简单说,就是图像和文本各有一个Transformer处理,然后通过注意力机制让它们互相“看懂”对方。这就像让一个画家和一个诗人合作——画家看画,诗人读诗,然后两个人一交流,画就有了故事,诗就有了画面。

我测试过几次,最让我印象深刻的是:GPT-4能看懂物理题里的示意图。你拍一张受力分析图,它能告诉你:“这个物体受到三个力,重力向下,支持力垂直于斜面,摩擦力沿斜面向上。”这在以前根本不可想象。一个AI能看懂物理题,意味着它不光会背公式,还能理解“力”是怎么作用的。

但别高兴太早。GPT-4还是离线模型,知识截止于2021年9月。你问它“俄乌战争怎么样了”,它会告诉你“不知道”。说到底,它是个超级学霸,但不是实时新闻播报员。就像一个考了满分的高中生,你问他“今天股市怎么样”,他只能一脸无辜地看着你。


安全与幻觉:OpenAI的纠结,也是我们的恐惧

说到安全问题,GPT-4确实下了功夫。他们搞了个“基于规则的奖励模型”(RBRM),就是在RLHF的基础上加了一层硬性规则。比如“不能教人做炸弹”、“不能生成仇恨言论”。这就像给AI装了个“道德警察”,时刻盯着它的一举一动。

但说实话,我觉得这治标不治本。GPT-4依然有幻觉问题,还是会一本正经地胡说八道。我试过让它解释一个根本不存在的物理学概念,它居然编得有模有样,还引用了“某篇论文”。这事儿挺可怕的——AI越强大,它的谎言就越难被识破。就像一个人越聪明,撒谎就越不容易被发现。

OpenAI还搞了多模态幻觉检测,但据我观察,效果一般。比如你给它一张根本不存在的地图,它可能会说“这是一个虚构的地理位置”;但如果你给它一张真实但处理过的图片,它可能会上当。你看,连AI都会“被骗”,更何况我们人类?


我的判断:这不是终点,是起点

GPT-4确实是个里程碑,但它不是终点。多模态能力刚刚起步,现在只能处理图像和文本,视频、音频、3D模型都还没影。而且成本太高了——跟GPT-4对话一轮大约要1块钱(按API定价,输入输出各几百token的话差不多),ChatGPT每天的维护成本就将近100万美元。这就像你家里请了个超级管家,但每天得花一辆宝马的钱养着他。

我预测,接下来两年会有两个方向:一是模型轻量化,让更多人能用上;二是多模态能力扩展,视频理解会是下一个爆发点。你想想,当AI能看懂视频,能理解你录的一段生活片段,甚至能帮你剪辑Vlog——那会是多疯狂的事?

但最让我担心的,不是技术本身,而是这个问题:AI的“理解”到底是真的理解,还是高级的模式匹配?当GPT-4能看懂梗图、解物理题、写代码的时候,我们该怎么定义“智能”?这个问题,恐怕比GPT-4本身更值得深思。

说到这儿,我想起一个故事:有人问哲学家,“你怎么证明你不是活在梦里?”哲学家说:“你永远无法证明,因为你无法用梦中的逻辑来否定梦。”AI也一样——它可能永远无法真正“理解”世界,但它能表现得像理解了。这就像我们人类,谁敢说自己真的“理解”了这个世界?

说白了,GPT-4就是个超级工具,用得好是利器,用得不好是祸害。至于怎么用,还得看我们这些“人”的智慧。而AI第一次睁开眼睛看到的,不是世界,是我们自己。

86
4336 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月22日 13:33

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

数据分析师 5天前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)