← 返回资讯
苏晴
资深编辑
已审核

深入解析多模态大模型-主要技术和最新发展综述

好,收到你的文章了!干货满满,逻辑清楚。但说真的,原稿有点像是给同行看的内部报告,少了点“人味儿”。

深入解析多模态大模型-主要技术和最新发展综述

深入解析多模态大模型-主要技术和最新发展综述


好,收到你的文章了!干货满满,逻辑清楚。但说真的,原稿有点像是给同行看的内部报告,少了点“人味儿”。

现在,让我用那种“你朋友正拍着大腿跟你唠嗑”的语气,把它彻底重写一遍。保证情绪拉满,让你读完想立刻转发到兄弟群!


前两天,我一哥们儿兴冲冲地发来一张Excel表格截图,问我:“快帮我看看,这Qwen2.5-VL能看懂这个复杂的加班时间表吗?我想让它帮我算算我上个月到底被白嫖了多少工时。”

我说,哪儿用得上那么复杂的模型,回头我给你跑跑。

你看,这就是我们现在聊天的常态。一个关于“让AI长眼睛”的话题,从2023年就开始火,到2025、2026年更是烧得不行。我翻了一百多篇论文,又自己跑了十几个开源模型,结果发现一个特别反直觉的事儿——

多模态大模型这场仗,战场早就不在模型本身了!

你还在那儿纠结给巨大的语言模型(LLM)配个什么样的“眼镜”(视觉编码器)?比如接个什么ViT(视觉Transformer)再搞个线性层?你要是这么想,我只能说,你的认知至少落后了一年!

大家以为是“谁的芯片(模型)算力更强”,其实现在真正的胜负手,是“谁能把这套装备(系统)给整合好”。

说到这儿,咱们得先聊一个最常见的误区。

很多人一上来就拿理解模型跟生成模型比谁画得好。比如拿Qwen2.5-VL去跟FLUX比做海报的精细度?这就好比让博尔特跟鲁班比木匠活,完全是在两条赛道上跑的车!

我用Qwen2.5-VL看过一本几百页的扫描版《宏观经济学》,它对图表和公式的推理能力,真的让你觉得它是个学霸。我让它把书里的供需曲线图直接生成一张漂亮的海报,你猜怎么着?它彻底翻车了!画出来的东西跟车祸现场似的,文字渲染得一塌糊涂。

反过来,GPT Image 2那个新模型,文字渲染和排版控制简直是一流,我让它给我设计一张“2026年目标”的励志海报,效果炸裂。可一旦问它一句:“帮我分析下这两张销售趋势图的变化原因”,它就立刻开始满嘴跑火车,给你编故事。

所以,我现在的认知非常清晰,必须把多模态拆成三条完全不同的路:

1. 理解模型:专门干“看懂”的事。看图文、看文档、看视频、看手机界面。代表选手:Qwen2.5-VL、Gemini 2.5 Pro、Claude系列。它们就像是侦探,擅长找细节、理逻辑。

2. 生成/编辑模型:专门干“动手”的事。画个海报、P个图、做个信息图。代表选手:Qwen-Image-2.0、GPT Image 2、FLUX.1。它们就像是画家兼设计师,负责美和创造。

3. Omni/Agent系统:专门干“搞定”的事。它不仅要看,还要听,还要去帮你调用工具、执行任务。代表选手:Qwen2.5-Omni、Gemini 2.5的tool路线、Claude的agent化尝试。这才是真正的超级助理!

这三条线的目标、架构、评价标准完全不同。你要是把它们混在一起比谁强,就好比问“木棍和石头哪个更厉害”,一辈子吵不出结果。


咔嚓!连接器这东西,听着就笨重对吧?

最早的模型,比如2023年的LLaVA,就特简单粗暴:用CLIP ViT提取图片特征,然后搞个“线性投影层”,就像用一根电话线把两个世界的语言勉强连起来,丢给后面的语言模型处理。简单,但效果居然还不错。

后来呢?老司机们发现电话线太慢了,就换成了两个“加速器”(两层MLP+GELU),效果果然好了不少。我自己跑过对比,是真的有提升。

再到后来,BLIP-2发明了个“Q-Former”,就像在中间加了个“采访团”,用32个智能记者去提问视觉特征,把256个视觉词压缩成32个。传给语言模型时,计算量瞬间下降。但训练这玩意儿,复杂得让人想摔键盘。

你看,不管怎么变,它们干的都是同一件事:在视觉和语言之间,修一座桥。

但到了2025年,Qwen2-VL一出来,事情彻底变了。它直接把那座桥拆了!

它搞了个“动态分辨率”和“M-RoPE”技术,让视觉和语言在底层就原生融合。它不再把图片死命压缩成统一尺寸,而是像拼乐高那样,把图片切成小块,直接和文字token一起放进Transformer里处理。位置编码也统一了,这就好比开了个“直达专列”。

我拿一段20分钟的教学视频去测试,Qwen2-VL对时序的理解,比那些老模型强了不止一个档次。你想象一下,一个非要在火车站换乘,一个是直接坐高铁。这叫降维打击。

这种“原生统一”的架构,才是未来。 连接器做得再花哨,也只是在修补裂缝。真正的解法,是让这两东西在造的时候,就长在一起。


护城河?不存在的!真正的红利,在“整合”系统里。

我刚看到Trai 8的一篇总结,他直接说:GPT-4o、Claude 3.5的“性能护城河”,快被开源模型填平了。

哎,我完全同意!你看看2026年的开源模型,比如Molmo、InternVL系列,在单纯的视觉理解任务上,和闭源模型的差距已经小到可以忽略不计了。两年前还有15%的差距,现在可能就3%-5%。

那闭源模型还剩什么活路?

是系统级整合的能力!

比如Claude的“Computer Use”,它能直接操控你的电脑桌面,帮你操作GUI界面;Gemini的“Tool Calling”,能链接你的计算器、地图、数据库;还有Qwen2.5-Omni,一个模型就能同时处理文本、图像、语音,还能通过API调用工具。

这才是真正能落地的差距!

举个我自己的例子。我试图用纯开源模型搭一个“读取PDF表格+分析数据趋势+自动生成报告”的工作流。你猜怎么着?整个流程充满了断点。读PDF用一个模型,分析数据还得我手动把数据导出来,画图又得换另一个生成模型。体验割裂到你忍不住想骂人。

但Qwen2.5-Omni就不一样。一个模型,把什么都包了。读文本、看图表、听指令,甚至还能帮你算算数、搜个信息。它是一个闭环!

在真实的打工人工作流里,一个功能完整、能一条龙服务的系统,远比一个模型在一个不接地气的基准测试上多考2分重要一万倍!


下一个风口!AI开始琢磨“物理规律”了

你猜猜2025-2026年的前沿热点在聊啥?不是谁谁谁又刷榜了。而是空间推理音频推理

我特别喜欢TRACE(空间推理)和LOTUS(遗忘技术)这些论文。它们让我看到了多模态模型在向着“物理理解”进军。

TRACE那篇论文直接指出了现有模型的“智障”时刻:它们根本搞不明白“杯子在盒子里面”这种空间关系!你给它看一张图,模型只能说“有一个盒子,有一个杯子”,但没法推理出“杯子被盒子遮住了”或者“杯子应该在盒子里面”。这直接关系到未来能不能做机器人!一个连物体相对位置都搞不明白的模型,你让它去操控机器臂拿杯子?想都别想!

另一个让我拍案叫绝的,是香港中文大学那篇音频推理综述。它揭示了一个真相:很多看起来是音频推理的任务,其实模型压根儿没听音频,它只是在走文本捷径!它把语音转成文字,然后根据文字瞎蒙答案。这和真正的“听声推理”是两码事。真正的推理,必须锚定在音频信号的时间维度上,比如分析语气的顿挫、音调的变化。

读完之后,我立马拿几条数据去试了几个市面上的语音助手,果然!大部分只是“语音转文字+大模型”,根本没有真正的声学特征分析。

这些研究告诉我,多模态的下一个战场,是物理一致性跨模态深度推理。模型不能只是个“看图说话”的小学生,它必须进化成能理解“这东西怎么动?它在哪里?它说话的语气为什么犹豫?”的高中生。这需要重新设计训练数据和损失函数,绝不是简单加个视觉分支就能搞定的。


回应一个“早产儿”的担心

你可能会问:“你说的系统能力固然重要,但模型的基础理解还没做好吧?谈系统是不是太早了?”

我理解这种担忧。但我必须说:基础理解的边际回报,已经在大幅递减了。

从2024到2026,模型在文档理解、图表分析这些任务上的分数,涨得微乎其微,可能就不到10个点。但为了提升这10个点,工程复杂度却翻了一倍!你投入100分的精力,只换来10分的回报,不划算。

真正卡住落地脖子的瓶颈是什么?是模型能不能调用工具?能不能在多轮对话中保持一致性?能不能一次性读完整本PDF?能不能在你修改了之后,保持生成内容的风格统一?

比如Qwen-Image-2.0,它花了大功夫在图像生成的多轮编辑一致性上。你让它画个图,然后说“把背景换成红色,字体再大一点”,它能精准执行,并且保持画面其他元素不变。这就是系统级的问题。

我的观点是:模型的基础能力,做到85分就够了。 剩下的15分,不值得你用牺牲工程可行性去换取。


行动,别光看了!

所以,别再盯着那些光鲜亮丽的模型排行榜了那上面的分数,对于你手里的产品,屁用没有。

如果你在做产品,多问问自己:这个模型能不能读我的长文档?能不能让我连续修改同一张图?能不能通过API无缝接入我现有的工具链?这些能力,比一个高分值钱一万倍。

如果你在搞研究,别去卷那些已经被卷烂的方向。空间推理和音频推理,尤其是那种把推理过程真正锚定在连续感知信号上的思路,是妥妥的蓝海。

如果你只是关注,我建议你直接去跑跑Qwen2.5-VL,感受一下“动态分辨率”带来的流畅;再对比一下InternVL系列,看看它们在不同任务上的真实表现。真实手感,比任何论文和评测都管用。

多模态的下半场,是系统战、工程战、场景战。谁先跑通从“感知”到“行动”再到“反馈”的完整闭环,谁,就是那个能吃掉整块蛋糕的赢家。

这场仗的胜利,不再属于那个最强的零件,而是属于那个懂得把零件完美组装成一台超级机器的匠人。

682
11370 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 04:21

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 1周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 昨天
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 4天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)