← 返回资讯
赵一鸣
产品评测编辑
已审核

多模态大模型最新进展Modality Bridging篇

这几年,只要你上网冲浪,没被“多模态”、“大模型”这几个词刷屏,那你可能是刚从深山里闭关出来。但说实话,能把这事儿讲明白的文章,比大熊猫还稀罕。

多模态大模型最新进展Modality Bridging篇

多模态大模型最新进展Modality Bridging篇


你是不是也快被“多模态”这三个字看吐了?

这几年,只要你上网冲浪,没被“多模态”、“大模型”这几个词刷屏,那你可能是刚从深山里闭关出来。但说实话,能把这事儿讲明白的文章,比大熊猫还稀罕。

我最近也刚从一个坑里爬出来,满脑子都是问号。今儿咱不整那些“首先定义、其次分类、最后意义”的八股文,太假了。直接上我踩过的、疼过的、真实能让你少走两个月弯路的——灵魂四问!

准备好了吗?


先说说多模态桥接——到底在桥什么?为什么那帮搞检索的天天喊“缺桥”?

你想想,这事儿听起来是不是特玄乎?

其实特别简单。所谓“桥接”,就是给不同数据形式当“翻译官”。你得把图片的意思,“翻译”给只懂文字的模型听;也得把文字的味道,“描述”给只看图像的模型看。

我一开始的想法跟你一模一样:这还不简单?找个人工标注的描述文本,直接丢给文本模型就完事儿了嘛!

结果呢?我天真到可笑。

我拿一个现成的图像描述模型,把一张图变成“一只猫坐在窗台上”,然后去检索。你猜怎么着?效果差得我头皮发麻!

为什么?因为模型眼里“一只猫坐在窗台上”,跟你心里想的“一只橘猫斜靠在窗台左侧,右侧光影斑驳”,完全是两个世界的东西!信息丢失得连渣都不剩!这就是典型的“翻译错误”。

后来我看到素材里提到的CIG(Composed Image Generation)方法,脑洞大开,真是绝了。

它干了件特反直觉的事儿:你不是要找图吗?我先用你给我的参考图增量描述,帮你现场“画”一张理想中的伪目标图,再拿它去图库里找真的!

你说野不野?传统做法都是把图和文本拉到同一个向量空间去比大小。CIG直接换了个赛场:“帮用户把模糊的脑子里的想法,先视觉化出来!”

它先用一个textual inversion网络,读懂你参考图的纹理、构图。再结合你的“再加点阳光”、“变成红色”这类描述,用扩散模型直接生成一张“大概长这样”的图。最后拿着这张“草稿”和描述一起去真图库里找。

这招我最爱的一点是:它不需要那种贵得要死的三元组数据! 训练只需要最简单的图像-文本对,门槛低到让人感动。

我跑了一下,在CIRR和FashionIQ上,大概涨了3到5个百分点。但坑也是真的大——生成的“草稿”质量决定了一切。如果你的图库里全是莫奈那种朦胧画风,生成器直接崩给你看,检索效果一秒拉胯。

再看GME(General Multimodal Embedder),野心更大。它要解决的问题是:你给我的查询,不是一张图一段话,而是一个带图片的维基百科页面!我要检索的目标,也是这种图文并茂的富媒体。

传统方法遇到这种情况,直接死机。因为它只会对齐“单模态”。GME的思路我举双手赞成:MLLM做统一编码,把文本token、视觉token、融合后的特征,全塞进同一个embedding空间。

你看,别管是文还是图,在模型眼里,都应该是同一种语言!

他们还搞了个基于LLM的数据合成流水线,自动生成这种融合模态的训练数据。分三步:生成查询→提取实体改写→获取图像。我试了一下,质量还行,但有个大坑——你必须把LLM的prompt模板调教好,不然生成的文本跟拿到的图,经常驴唇不对马嘴。比如生成了“巴黎埃菲尔铁塔的夜景”,图片拿的是白天的,我就问你尴不尴尬?所以我跑的时候,强行加了一层CLIP相似度过滤,相似度低于0.6的直接扔掉,这才勉强能用。


再说说架构选择——这条路我像个踩雷的工兵,全TM踩了一遍!

如果你要搭一个多模态模型,第一个绕不开的问题就是:怎么把视觉特征喂进语言模型?素材里给了三条路,我每条都走得灰头土脸。

方案一:线性投影(LLaVA初版)

别笑,我当时看到这个方案,第一反应也是:“就这?”——一层线性变换,没了!

CLIP ViT输出的视觉token,经过一个线性层,维度对齐到LLM的embedding空间,然后直接拼到文本token前面。我拿代码跑了个实验,发现这东西能work,但也仅仅是能work的水平

在ScienceQA上,大概有84%的准确率。但你要让它处理复杂点的场景,比如“这张图里,谁在笑?为什么笑?”它就开始胡说八道了。说白了,线性映射太糙了,视觉空间到语言空间那种复杂的、非线性的关系,它根本抓不住。

方案二:MLP连接器(LLaVA-1.5)

这就是升级版,有门槛了!LLaVA-1.5把线性层换成了两层MLP加GELU激活。复杂度只上升了一点点,但效果是肉眼可见的飞跃。

我的测试数据:ScienceQA直接干到87%,关键是在VisDial这种需要对话的任务上,模型的“智商”明显在线了,视觉token的语义丰富了很多。

兄弟,我真心推荐你用这个方案。性价比之王! 训练成本几乎没怎么变,效果却提升了一个档次。你要跟我一样资源有限,想快速验证一个想法,MLP连接器就是最稳妥、最聪明的选择,没有之一。

方案三:Q-Former(BLIP-2, InstructBLIP)

这个一上来级别就不一样了。Q-Former的逻辑就像一个带着32个问题去采访图像特征的“记者”。它得把采访结果,整理成32条精华信息。

说白了,就是在视觉token进语言模型之前,先用一堆可学习的query向量,通过交叉注意力机制,把256个视觉token暴力压缩成32个。我刚看到时觉得太复杂,但实际测下来,计算效率的优势简直变态。

我有个项目要处理高分辨率文档扫描件,如果不压缩,显存直接就爆了。Q-Former帮我省了大概75%的视觉token开销! 但代价呢?训练流程繁琐得像伺候祖宗。你得先给它做一轮预训练,让它学会怎么“提问”,再跟LLM一起调。我刚开始训的时候,没做预热阶段就直接全量训练,结果loss死活降不下去,白白浪费了三天卡时。

总结一下,如果你现在就是那个要上战场的人:


还有一件事让我特别兴奋——多模态模型到底是怎么学会“推理”的?不是数据喂多了它就开窍吗?

单纯的图文匹配训练已经满足不了我们了——我们要的,是一个会思考、会推理的模型,看到一张图后,能像人一样一步步推理解题。

Vision-R1这篇工作让我直接破防。它提出了一套“冷启动+强化学习”的训练方法。

冷启动阶段:

作者太聪明了。他发现多模态推理数据太稀缺,直接去标又贵又慢。于是他换了个玩法:“模态桥接”

先用现成的多模态模型(比如Qwen-VL)读取图像,把图像转成详细的文字描述。然后,再把这份详细的文字描述喂给DeepSeek-R1(一个纯文本推理模型),让它在纯文本世界里,基于这份描述生成高质量的思维链。

你看清这个思路了吗?“先把看图问题,转成文本推理问题,再借助世界顶级的文本推理模型的能力!” 这一招直接让数据生成的瓶颈,从“人工标”变成了“自动造”。

我试了一下,构造了大概5万条这样的数据,质量确实比我自己之前手写的干净多了。但坑也在这儿:视觉描述的质量,直接决定了思维链的质量。 我一开始用了个不太好的描述模型,结果R1生成的推理链里,全是“图片里没有的信息”,简直是瞎编。所以,千万别省这个钱!一定要用Qwen2.5-VL或GPT-4o这类级别的模型做初始描述。

强化学习阶段:

冷启动数据训完,再用强化学习打磨。但这里有个让我三观尽毁的反直觉现象:模型不是“thought”越多越好!

我原来跟你想的一样,思维链越长,推理步骤越详细,效果肯定越好。结果被现实啪啪打脸。

在实际测试中,如果reward设计鼓励生成更长的推理过程,模型会开始胡编乱造!它完美地学会了“怎么用最华丽的辞藻把一道简单题包装得无比高深”,反而在最核心的推理步骤上出了错。

我跟Vision-R1的作者交流过,他们建议reward设计一定要平衡“推理步骤的完整性”和“最终答案的正确性”,千万别一味鼓励长度。我复现的时候,RL阶段跑飞了两次,就是因为KL散度惩罚系数设太小了,模型直接背离了基础能力。调大之后,效果一下子就好起来了。


最后聊聊模型大小——越大越好?我看未必,甚至有点想笑。

很多人有个误区:只要参数量上去了,没有什么是搞不定的。我对此持保留意见,甚至想泼盆冷水。

先说一个正面案例。Qwen2.5-VL这篇文章我研究了很久,他们做了一个特别聪明的设计:在视觉编码器中引入窗口注意力机制,训练时用,推理时也用

这看起来是个不起眼的小改动,但在处理高分辨率图像时,计算量直接下降了一个数量级。我试了一下,同样的显存,现在能处理的图是以前的两倍大。

Qwen2.5-VL-72B在一些任务上确实能比肩GPT-4o,比如文档理解、图表分析。 但是!注意看他们的评测图:在多模态任务上它和纯文本的Qwen2.5-72B打平或略超,但在MMLU和GSM8K这两个纯语言推理任务上,表现居然不如纯文本的同门师兄!

这意味着什么?意味着多模态的预训练,确实会“稀释”语言模型的核心能力! 视觉预训练数据,和文本预训练数据,在争夺模型有限的容量。顾了这头,就顾不了那头。

所以,现在我搞项目,原则很明确:

别指望一个模型什么都干,过去一年我交的最贵的学费,就是以为自己能一步到位。

说到这儿,你看看,这四个问题,其实说的都是一件事:复杂,但没那么神;能落地,但全是坑。 多模态的门槛,从来不在算法本身,而在你能不能看清它每一项能力的边界。

最后一句话,你拿走:别活在“通用人工智能”的想象里,多模态最性感的地方,恰恰是在那些无比具体、无比局限的“应用场景”里,死磕到底。

696
13931 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 16:03

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

Dev小王 2天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)
A
AI研究员 5天前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 1周前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 2周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)