← 返回资讯
苏晴
资深编辑
已审核

多模态大模型业界现状、综述及行业应用

好,说说多模态这事儿。是不是听着像老生常谈?但我讲的这些,跟膝盖上的旧伤一样——去年摔的,现在阴天还疼。

多模态大模型业界现状、综述及行业应用

多模态大模型业界现状、综述及行业应用


好,说说多模态这事儿。是不是听着像老生常谈?但我讲的这些,跟膝盖上的旧伤一样——去年摔的,现在阴天还疼。

你先想个场景:你在一家电商公司做运营,手里拿着商品规格截图,想知道这玩意儿能不能定制尺寸。你把截图丢进模型,信心满满。结果呢?一个模型告诉你“可定制”,另一个说“不支持”。两个模型,两张嘴,你信谁?我当时差点把键盘摔了。

真的。

这事儿就从那张表格说起。


我那时候给电商做了个智能助手,目标不复杂:用户上传商品截图,系统得看懂文字、表格、价格,还要能基于这些做推理。听起来不难吧?表面上是。但第一个坑藏在文档理解里——我拿主流模型开测,GPT-4V和几个开源方案都上了。素材是一张带表格的规格页,我问:“这款产品的尺寸支不支持定制?”

模型A看到表格标题区写着“定制服务”,回我:“支持。”

模型B仔细看了每一行,发现某个单元格空着,回我:“不支持。”

结果呢?两个都错。模型A只读标题,根本没理解表格结构;模型B不知道空单元格不能直接等于否定。翻车。

现在回头看,很多多模态模型所谓的“看懂表格”,其实就是OCR加语义匹配。行和列的关系?不存在。表头和数据项的绑定?不存在。俩人在黑箱里猜谜。

后来我翻技术报告——2025年下半年,Qwen2.5-VL和Gemini 2.5还在优化文档理解benchmark。石头硬着呢。我自己实测,Claude Sonnet(具体版本记不清了,好像4点几)在处理复杂表格时相对稳一点,但一遇到合并单元格那种不规则版式,立马傻眼。劝退。


刚爬出第一个坑,第二个就等着了:图像生成与编辑的多轮一致性。这个更惨。

我给一个设计团队做工具,允许用户对同一张海报反复改:第一回把背景换成蓝色,第二回把标题字体换成微软雅黑,第三回把LOGO放大并移到右上角。结果?第三轮改完,前两轮生成的标题内容变了——两个英文字母拼反了。背景里的渐变色也丢了。我气炸了。后来我在开发日志里写了句话:“多轮编辑的模型记忆力,大概和我的短期记忆差不多——转头就忘。”

测试下来,Qwen-Image-2.0和GPT Image 2都有这毛病。单次生成时惊艳得不行,一进多轮交互,模型好像把前几轮输出当成全新图来处理,压根没有“编辑历史”的概念。每次修改都是第一次见面。咋整?

我试了一种解法:把用户的历史修改指令和版本描述全塞进上下文,让模型基于描述而不是图像本身去理解“我们前面做了什么”。效果好了那么一点点——真的只是一点点。代价是prompt变得极其冗长,模型的注意力也被稀释了。试了好几次,也就那样。绝了。


第三个坑叫模态协同——这词太学术,说白了就是三个和尚没水喝。

我参与过一个概念验证项目:用户用语音描述一张图,模型生成一段视频解说词,再配上背景音乐。理论很美好对吧?实际做出来:语音识别把“蔚蓝的海面”听成了“蔚来的海面”(没错,电动车那个)。图像理解把“夕阳下的渔船”描述成“一个船状的物体在水面上”。生成的解说词干巴巴得像产品说明书。这三个模块彼此完全不知道对方在干什么。语音模型不知道图像模型看到了什么,图像模型不关心视频生成需要什么视角,视频生成模型只管按自己的风格暴力输出。

整个过程就像三个陌生人在厨房里各做各的菜,最后端上一盘谁都不想吃的东西。

现在有些方案——比如Qwen2.5-Omni和Gemini 2.5系列——试图用同一个模型主干同时处理所有输入输出,让不同模态信息在同一个语义空间里共享。但说实话,离真正的协同还很远。很远。我觉得这玩意儿比相亲还难撮合。


第四个坑,benchmark崇拜。这事儿我得坦白——我一度也是“看榜选模型”的人。哪个模型在MMMU上分数高,就优先试它。然后摔了一个大跟头。

一个在MMMU上排名靠前的模型,在我们内部一个简单的GUI操作任务里频频翻车——让它在一个网页上找搜索框并输入关键词,它总是点到附近的一个广告位。怎么回事?后来做了分析:这模型的训练数据里,GUI截图样本比例极低,它对“网页元素”的概念主要来自视觉描述而非交互经验。而benchmark测试的GUI任务大多是静态页面理解(“这张截图里有几个按钮”),压根不涉及动态交互(“你先点击这个按钮,再输入文字”)。

Benchmark测不出真实场景的系统级能力。细想一下,这就像用高考成绩预测一个人的职场表现——有关系,但不绝对。

更有意思的是,2025年的CVPR有一篇论文研究了RL后训练对多模态推理的影响。他们设计了一个聪明的实验:把训练数据的图像换成空白图、随机图,或者去掉文本信息,然后看模型表现。结果发现:即使训练数据被严重损坏——比如图像完全是空白——RL训练依然能提升模型在推理任务上的表现。说明模型根本没有真正使用视觉信息,只是在强化文本侧的推理能力。这他妈不就是披着多模态外衣的单模态模型吗?Benchmark yyds?未必。所以我现在看数据,但更看它测的是什么。如果它只问“这张图里有什么”,你测试的是OCR能力;如果它问“结合这张发票,我的报销流程是什么”,那才是系统级多模态理解。


第五个坑,音频推理——我以为它很接近了。好蠢。

去年年底,我接到一个项目:需要模型从一段会议录音里提取关键信息,回答类似“汇报人提到项目截止日期是什么时候”的问题。我当时想当然地认为:直接把音频转文字,然后喂给文本模型就完事了。多省事啊。结果被现实教做人。

因为会议录音里有大量非语言信息——语气、停顿、重叠说话、背景音。有个场景,某位参会者回答问题前顿了3秒,然后说了一个日期。纯文本模型完全意识不到这3秒停顿意味着什么——那沉默里藏着不确定,藏着犹豫。如果你听了音频,你会知道他说那个日期时心里没底。而模型只知道“他回答了一个日期”,还觉得自信满满。

所以,只做ASR再推理,会丢掉决定性的声学线索。这个问题在音频推理领域有个说法,叫“acoustic-grounded reasoning”——模型必须锚定在连续的、细粒度的声学证据上,而不是只依赖文本转录。

后来我读了港中文的一篇综述,里面一个观点直接击中了我:很多所谓的“音频推理”任务其实并不真正依赖音频,模型可以通过文本提示或转录找到正确答案。我们要问的不是“模型回答对了吗”,而是“模型真的听了声音吗”。和多模态理解那会发现一模一样——模型有没有真正看图像?一样的。这玩意儿可能比我想的难得多。继续摔。


六个坑踩下来,我自己的认识也迭代了好几轮。

一开始我觉得多模态 = 视觉模块 + 语言模型。后来发现这架构处理复杂视觉输入很吃力,因为视觉模块的编码方式(比如ViT)在细粒度理解上天生受限。然后我开始关注“原生多模态”——不是把视觉编码器接到语言模型上,而是从一开始就设计一个能处理多种模态的统一架构。

目前比较成熟的方案是沿这条线走的:Gemini 3、DeepSeek Janus-Pro,都是把不同模态映射到统一的token空间,共享同一个Transformer主干。理论上能实现更好的跨模态对齐。但训练成本极高,通常只有头部玩家负担得起。而且我注意到,大多数真实场景里的多模态使用量,其实根本用不上原生架构的优势——你看个文档、提个知识性问题,模块化方案和原生方案差异并不明显。原生架构的真正价值可能体现在更复杂的任务上:长视频理解、复杂的多轮交互、极细粒度的声学推理。

所以我现在更倾向于把选择权交给团队:如果你的任务主要涉及静态图文理解,模块化架构足够用,成本低,灵活度高。如果你要做复杂的多模态推理、跨模态生成、或者需要处理极长的上下文,那原生方案可能更有前景。但这里有个悖论:原生方案虽然理论上更强,目前成熟度却不比模块化方案高多少。你切换到原生架构,可能换来的是一堆新坑——训练不稳定、数据配比难调、推理效率低。大概是2025年中的现状吧。

等等,我刚才是不是把话说太满了?其实不看benchmark也不是绝对的——有些benchmark至少能筛掉垃圾模型,但你不能只靠它选模型。对,大概这个意思。


再扯两句行业应用。从我接触到的项目来看,多模态大模型的落地正在从“Demo验证”转向“规模化商业变现”。2024年,大多数项目还停留在“看看模型能不能做到”的阶段。到2025年下半年,客户已经开始问:“多少钱一次调用”“准确率能到多少”“延迟多高”“怎么接入我们的系统”。真正的变化是:多模态技术开始进入垂直行业的工作流。

我一个做工业检测的朋友,用视觉语言模型替代了传统的缺陷分类流水线——不是让模型自己看,而是让模型辅助质检员做决策。质检员拍一张照片,模型回答“这个区域可能有划痕,概率70%”,然后由人做最终判定。这种做法和我想象的“AI直接替换人类”不太一样,但效果出奇地好——准确率提升到98%以上,效率提升了3倍。巴适。

所以你说多模态的终极在哪?它可能不在那篇发在顶会的论文里,不在某个刷榜的benchmark上,而是在那个车间里、在那个电商客服界面上、在那个会议室录音的分析工具里。真的。


最后写几条自己摔出来的底线吧,算不上建议,就是我现在的心得。

一条是别迷信benchmark,尤其当它只测单点能力。我之前就是看榜选模型的人,结果在真实表格上摔得鼻青脸肿。现在学乖了,拿自己的业务数据测——对话、表格、截图、多轮交互——一个一个摸过去。连我们内部测试集都打不过的模型,别往生产里放。

另一条是如果你做系统级应用,别只靠一个模型。多模态能力现在还是碎片化的,没有哪个模型能在一件事上拿到满分。我会用多个模型打配合——一个负责视觉理解、一个负责推理、一个负责生成——中间加一套自己的逻辑层来协调。虽然麻烦了点儿,但比一个模型瞎整稳多了。

还有,别在“原生多模态”这概念上砸太多资源。团队不大、数据不多、场景固定的话,模块化方案省心得多。原生方案的优势可能在你完全不需要的时候才能体现出来——别被“统一架构”忽悠了。先看实际需要什么。

再就是音频推理,比你以为的难得多。别以为转成文字就算走完了。如果你的场景依赖声学线索——语气、停顿、情绪——那需要专门的音频推理模型,而不是通用语音助手。我在这上面栽过,希望你不会。

最后一句,这行业变得太快,别把任何判断当真。我上面说的话,大概半年后就会过时——甚至更快。保持观察,保持动手,保持怀疑。还有,别怕犯错——我犯过的错比上面写的多两倍,但每次翻车都让我离真相更近一步。

真的。

189
3158 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月26日 14:02

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

A
AI研究员 5天前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 1周前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 2周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)