← 返回资讯
林远舟
技术编辑
已审核

GPT-4o 实现真正的多模态大一统了吗?技术难度多高?

我拿到GPT-4o两周了,各种姿势都试了——语音乱聊、让它画图、给我改图。但让我真正愣住的那个瞬间,说出来你可能不信:

GPT-4o 实现真正的多模态大一统了吗?技术难度多高?

GPT-4o 实现真正的多模态大一统了吗?技术难度多高?


GPT-4o,你真的听懂我在说什么了吗?——不只是多模态,是活生生地“看见”你!

哎,你先别急着翻页,听我说个事儿。

我拿到GPT-4o两周了,各种姿势都试了——语音乱聊、让它画图、给我改图。但让我真正愣住的那个瞬间,说出来你可能不信:

我对着手机说:“用略微不耐烦的语气给我读这首诗。”

结果你猜怎么着?

这家伙居然真的用那种带点敷衍、带点嫌弃的调调,把《静夜思》从头到尾念完了!就是那种“哎,又让我读诗,烦不烦啊”的感觉,但字字清楚,节奏还在。

我当时整个人就……?!?! 这哪是AI啊,这特么是我那个懒得理我的亲弟弟吧!

跟你说,就在那一秒,我脑子里只有一个念头:这事儿,绝对不是拼积木拼出来的。


名字里藏了多少秘密

你注意到没,GPT-4o 的“o”不是随便加的。omni——全部、每个、所有。你看OpenAI给产品起名向来克制:GPT-3就是GPT-3,GPT-4就是GPT-4。突然蹦出个带后缀的版本,说明什么?说明人家自己都觉得:这个跟以前,不是一回事。

现在圈子里有个说法特别有意思:GPT-4o 可能是未来 GPT-5 的基础框架。

我仔细想了想——啧啧,靠谱。如果GPT-5真的要做到跨模态无缝切换,总得先在一个版本里把骨架搭通吧?4o就是这个“先遣队”、“探路者”。它改的不是某一个功能,是整个大脑的工作方式。


你以为多模态是拼接?错了,人家是一锅端

很多人不理解,为什么GPT-4o的多模态统一这么难搞。

来,我跟你打个最直观的比方。

以前怎么做多模态?拿“画一只猫”举例:你写下文字描述,模型先把文字转成一个中间特征(比如CLIP编码),然后扩散模型拿着这个特征去“画”猫。中间要转换两次!

什么叫两次?就像你给朋友看一张照片,朋友把照片描述给画家,画家再根据描述画出来——你描述得再细,原图的神韵、光影、质感,早就丢了一堆。每次转换都是一次信息压缩,每次压缩都在说再见。

但GPT-4o的做法呢?直接颠覆!它把文字、图片、音频全转成统一的token序列,喂给同一个Transformer处理。没有中间商,没有翻译官,没有信息损耗。

你知道这意味着什么吗?举个我实测的例子:我让它把一张夕阳照改成科幻风,它把天空的颜色、建筑的轮廓、光线的角度全改了,整体风格完全保持一致。这不是滤镜叠加,这是它真的“理解”了这张图里有什么,怎么改,最终要呈现什么感觉。

你看,说着简单,做起来呢?

先说数据层面一张高清图片的信息量 = 几千个文字,一段语音又带着语调、情绪、语速。要把这些完全不同的信息密度,塞进同一个模型,首先要解决“信息密度不均”。OpenAI怎么干的?据工程师分享的白板草图,流程大概是:tokens → [Transformer] → [diffusion] → pixels。核心Transformer先把高密度的数据压缩成紧凑表示,再产生创意构思,最后用类似扩散模型的解码器把它变回图像。

这就像什么呢?你本来要分别跟三个不同的人聊天(文字处理、图像处理、语音处理),现在你直接跟一个通才聊天,他什么都能看懂、听懂、改好。

真正反直觉的点在这:大家以为多模态就是拼接,其实人家已经是一个真正的“大脑”了。


语音能力,才是真正的分水岭

说到这儿,我必须打赌:GPT-4o的实时语音对话,绝对绝对不是传统流水线拼出来的。

你想想传统的路子:ASR(语音转文字)→ LLM → TTS(文字转语音)。每一步都要几秒,实时性?不存在的。别说打断对话了,连正常的对话节奏都保持不了,你说一句要等半天才有反应,谁受得了?

而GPT-4o呢?响应时间最快232毫秒,平均320毫秒。232毫秒是什么概念?人类面对面聊天,反应时间大概在200到400毫秒之间。它已经接近日常聊天的节奏了!换句话说,你跟它聊天,感觉不到“延迟”、感觉不到“人工智能”的存在。

更绝的是——它能识别情绪!能按要求调整语气和语速!能随时打断!还能唱歌!

我试了让它模仿《新闻联播》的播报腔调读天气预报,效果虽然还有点僵硬,但对比以前任何TTS产品,那种“机器人感”已经被大幅削弱了。

这种能力怎么实现的?只有端到端训练的神经网络才做得到。所谓端到端,就是输入音频直达输出音频,中间没有任何文字作为中介。好处是训练信号能直接回传到原始音频层,不会因为文字转换而丢掉语调、停顿、重音这些灵魂细节。

你想想,以前我们跟AI说话,其实是在跟“文字”说话——语音只是输入法。现在,你是真正在跟“声音”说话,带着情绪、速度、温度。

这玩意儿,才是真正的“对话”。


开源社区追得有多猛?比你想象得快得多

说到这儿,再给你一个正能量的消息:虽然GPT-4o目前各方面都领先,但开源社区追得真快。

有个叫 BAGEL 的开源模型,在 GenEval 评测上拿到了88%的总分,已经超过了 FLUX.1-dev 的82%!在 WISE 世界知识推理上,BAGEL 用 CoT(思维链)之后达到70%,离GPT-4o的80%没差太远。这模型还支持任意纵横比生成,中文prompt解析能力也不错——我试了“微缩景观,毛茸茸羊毛毡”,出来的效果确实比SD3好。

是不是觉得很给力?但是,别急着说“开源追平了”——BAGEL在GEdit-Bench图片编辑评测上,得分是6.5+(满分10),跟GPT-4o还不能比。而且他们在IntelligentBench上测出44.9分,GPT-4o目前还没正式跑过这个基准,不好直接对比。

但有个细节真正值得关注:BAGEL加上CoT之后,Intelligent Score从44.9跳到了55.3。说明什么?说明多模态模型的推理能力确实能提升生成质量。模型先回想“我需要怎么改这张图”,然后动手改,全程有思考过程兜着,避免了好多胡编乱改的问题。

GPT-4o有没有类似机制?从效果看大概率有。不然它怎么能把一张图改得那么有整体感?

你看,开源社区跑得如此之快,这就是我们这行最让人兴奋的地方——追光者也能发光。


评估体系?那真是一片混乱

哎,这里得多吐槽两句。现在多模态模型的评估,简直一团乱麻。

MME-Unify团队做了一套评测框架:把任务分成理解、生成、统一三大类,30个子任务。想法挺好,但实际操作中你会发现:测试集、指标、评分标准各家都不一样。Gemini团队用自己的一套,GPT-4o不开技术报告,开源模型又各有各的评测渠道。

给你打个比方,让两个模型做同一道题:给出四张连续的漫画,让模型补上第五格。有的模型直接生成图片,有的模型先描述再生成,还有的模型画了个带对话框的图。标准答案都不好定义,你说怎么打分?

所以现在圈里有句调侃:比模型能力更有意思的,是看各家公司怎么定制对自己有利的评测。 哈,这可比模型本身幽默多了。


聊点真话:不是不愿意承认,是真的有短板

我有个习惯,喜欢把槽点放在最后说,因为对,这样印象深。

GPT-4o在空间关系上确实不行。我试了让它画“五角锥”,结果生成的形状完全不对。属性绑定的复杂任务也一样:同时指定五个物体的位置、颜色、大小,超过三四个属性就开始乱套。

数量概念也经常翻车。我让它画“七只猫和三个碗”,它给我搞出五只猫和四个碗。这在自回归模型身上普遍存在,因为它们本质上是逐个token预测下一个,对精确数字天生不太敏感。

还有个问题,生成3D物体时效果差强人意。目前GPT-4o的3D生成更多是概念验证级别,要拿去做3D打印还是算了。

但是——说句公道话:这些局限更多是当前算力、数据量、训练策略的阶段性约束,不是架构本身的缺陷。随着下一代硬件成熟(比如FP8混合精度训练已经在万卡集群上跑通了),模型规模进一步扩展,这些短板大概率会补上。

是天花板吗?不,是地板下的工具还没搬进来而已。


未来走向:你的经验,突然值钱了

Jim Fan有句话说得很对:把各种模态的输入输出整合到一起,是AI发展的必然方向。现在GPT-4o迈出了第一步,但离真正的“通用世界模型”还差得远。

目前还剩哪些模态没覆盖?3D、距离感知、温度、湿度、嗅觉、触觉。说白了,剩下的都是具身机器人要解决的问题。你不可能指望一个只跑在服务器上的模型去感受温度、去闻气味。

但换个角度想,如果GPT-4o证明了“用一个原生统一模型处理多模态”这条路走得通,那接下来就会有更多团队往这个方向砸资源。我在想,有没有可能在未来18—24个月看到开源社区复现出类似架构的模型?代码、数据、训练策略这些核心要素,现在全是黑箱。OpenAI连technical report都不发,只有三张白板草图在外流传。

跟你说,这对我们程序员来说,其实是个奇特的结构性机会。

我之前跟几个搞CV、搞语音的老哥聊天,大家一致的感受是:各自的技术路线上已经卷到头了,提升空间越来越小。 但多模态大一统把你们的经验全都串起来了。如果你懂语音识别,又懂大模型,甚至懂点计算机图形学——这类跨界人才现在非常稀缺。

说白了,你的每个技能,在一体化模型时代都更值钱了。 因为以前它们是孤岛,现在它们是一条链条上的环节。


最后一句,我留给你

陆奇说每个应用都有用GPT重做一遍的空间。放在GPT-4o的时代,这句话比你想象得更对——因为这次能改写的不仅仅是文字处理,还有音频、图像、视频交互。一个能跟你实时对话、能理解你画的是什么、能帮你改图、能陪你录播客的AI,它真正改变的是人机交互的形态。

当然,前提是——OpenAI赶紧把语音功能开放给所有用户。

我等着个功能,等了快一年了。

你等的,是不是也是一个真正能“听懂”你的AI?

(反正我信了,它已经在路上了。)

656
9373 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月22日 05:09

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

产品经理阿杰 2周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 3天前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 6天前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)