← 返回资讯
苏晴
资深编辑
已审核

一文看完多模态:从视觉表征到多模态大模型

前阵子朋友火急火燎地找我:“ChatGPT不是挺牛的吗?你让它帮我看看这张CT片子,有没有问题?”

一文看完多模态:从视觉表征到多模态大模型

一文看完多模态:从视觉表征到多模态大模型


你给ChatGPT看CT片子?它说:“我看不见。”

前阵子朋友火急火燎地找我:“ChatGPT不是挺牛的吗?你让它帮我看看这张CT片子,有没有问题?”

我说:“你试试呗,它现在能看图了。”

他试了。然后骂了一句:“它说它看不到图片。它瞎了!”

哈哈,其实他用的可能是免费版,还不支持图片上传。就算用上GPT-4,它对医学影像的解读也未必靠谱——毕竟不是专业医生。但这事儿背后藏着一个有趣的问题:怎么让语言模型“看懂”图片?

我花了几个月时间,把多模态大模型从里到外翻了个遍。踩过坑,流过汗,也拍过桌子。今天这篇,我就用说人话的方式,把这事儿给你讲透。


一、为什么让模型“看图”这么难?——你以为是塞数字,其实是塞一座山

语言模型吃的是啥?token啊!一串数字向量。你给它“猫”这个字,它去词表里查一下,变成一个向量,搞定。

但图片呢?是一堆像素点,一个二维矩阵。

你猜一张224×224的彩色图片有多少个像素值?224×224×3 = 150,528个!十五万个数字!这玩意儿怎么塞进语言模型那个小脑袋里?

我刚开始学的时候,干过一件蠢事——我想:“简单啊!把图片压扁成一个长向量不就行了?” 结果模型根本学不到东西!空间信息全丢了!就像把一首歌的所有音符揉成一团,然后跟你说“这是旋律”,你听个屁啊。

所以核心思路只有一个:把图片也变成token。让图片和文字用同一种语言对话。


二、ViT:把图片当句子读——Google这招绝了

2020年,Google搞出了ViT(Vision Transformer)。想法直白得让你想拍大腿:“既然Transformer能处理文本序列,那把图片切成小块,每个小块当做一个‘词’,不就行了?”

具体怎么切?以ViT-L/14为例:它把224×224的图片切成14×14像素的小方块(patch),总共得到256个patch(16×16个)。每个patch通过一个线性层,变成一个1024维的向量。

你看,一张图片就这样被“翻译”成了256个词。每个词代表图片的一个局部区域——就像你用眼睛扫过一张照片,先看左边的人,再看右边的狗。

去年我在自己的项目里试过用ViT替换原来的CNN做特征提取。效果真的不一样!ViT能捕捉到全局关系——比如一张照片里,左边的人和右边的狗,ViT的注意力机制能让它们“互相看见”。而CNN呢?得堆很多很多层才能做到这一点,像走迷宫一样绕来绕去。

但ViT有个硬伤:它只懂视觉,不懂语言。它不知道“猫”这个向量和“猫”这个字有什么关系。它就是个纯粹的视觉特征提取器,像个哑巴,只会看不会说。


三、CLIP:让图片和文字“对上话”——OpenAI的跨语言词典

2021年,OpenAI的CLIP解决了这个问题。思路也简单到让你怀疑人生:同时训练一个图像编码器和一个文本编码器,让语义相似的图文对在向量空间里“靠近”,不相似的“远离”。

我测试过CLIP的零样本分类能力——给它一张猫的照片,不需要任何训练数据,它就能从“猫、狗、汽车、飞机”这些类别里选出“猫”。准确率高得吓人!

CLIP相当于给图像和语言建立了一本“跨语言词典”。从此,机器可以用同一套坐标系来表示一张猫的照片和“一只毛茸茸的橘猫”这句话。

但CLIP也只能做匹配,不能生成文字。你问它“图里有什么”,它回答不了。它就像个能认出你所有朋友的照片却不会说话的相册。


四、LLaVA:最简单的多模态方案——我亲手跑过,简单到让人想哭

2023年,LLaVA(Large Language and Vision Assistant)出来了。它的架构简单到让我怀疑人生:

1. 用CLIP的视觉编码器把图片变成视觉token

2. 用一层线性投影把视觉token的维度对齐到语言模型的embedding空间

3. 把视觉token和文字token拼在一起,送进LLM

就这么简单?我一开始也不信。后来自己跑了一遍LLaVA-1.5的代码,发现确实就这么简单。

我用llama.cpp跑过llava-llama-3-8b-v1_1这个模型,需要两个文件:一个是模型本身,另一个是mmproj投影文件(多模态投影层)。运行的时候,图片经过ViT变成token,再经过投影层对齐维度,然后和问题一起送进LLM。

效果嘛,比我想象的好。给它一张手绘的数学题,它能看懂并给出解答步骤。但细节上还有问题——比如让它数图里有几个人,它偶尔会数错。连人都能数错,这模型还得多练练。


五、Qwen2-VL:原生融合的突破——我测试过,这是真正的质变

今年Qwen2-VL给我的印象最深。它做了两个关键改进,每一个都让我拍案叫绝:

动态分辨率:以前的模型要求图片固定尺寸(比如224×224),导致图片被拉伸变形。你想想,一张4K的高清地图,被压成224×224,字都看不清了,还能看懂个屁啊!Qwen2-VL可以处理任意分辨率的图片,我测试过一张4K的高清地图,以前的模型根本处理不了,Qwen2-VL能看懂!这在实际场景中太重要了。

M-RoPE:这个技术让视觉和语言在底层架构上实现融合,而不是简单拼接。它用旋转位置编码(RoPE)把视觉token的位置信息和语言token的位置信息统一起来。

我的判断是:Qwen2-VL代表了多模态大模型从“拼接”走向“融合”的关键一步。早期方案(包括LLaVA)本质上是把视觉特征“翻译”给语言模型,而Qwen2-VL是在底层就让视觉和语言共享同一个表示空间。就像两个人从“鸡同鸭讲”变成了“心有灵犀”。


六、训练策略:两阶段走——数据质量比模型结构重要100倍

我研究过几个主流多模态模型的训练流程,发现基本都是两阶段:

第一阶段:对齐预训练

冻结视觉编码器和LLM,只训练连接器。目标是把视觉特征“翻译”成LLM能理解的格式。数据量通常很大(几百万图文对),但训练相对简单。

第二阶段:指令微调

解冻部分参数,用高质量的图文对话数据训练。这个阶段决定了模型的实际表现。我试过用自己标注的几十条数据微调LLaVA-1.5,效果确实有提升。但数据质量太重要了——垃圾数据喂进去,模型就学歪了。你要是天天看垃圾图片,能学会啥?


七、我的实操踩坑记录——说出来都是泪

说几个我踩过的坑,希望你绕过去:

坑1:分辨率问题

刚开始我用默认的224×224跑ViT,结果图片里的文字完全看不清。后来换了更高分辨率的版本(比如ViT-L/14的336×336),效果好很多。但代价是计算量暴涨——patch数量从256变成576。你以为免费?没有的事!

坑2:投影层的选择

LLaVA用单层线性投影,简单但效果不错。我试过用MLP替代,发现训练更慢但效果提升有限。所以别盲目堆复杂结构,有时候简单就是王道。

坑3:数据质量

我用自己的数据集微调时,发现模型容易过拟合到某些特定模式。后来加了数据增强(随机裁剪、翻转、颜色抖动),效果好了不少。数据质量比模型结构重要100倍,这话我说一万遍都不嫌多。


八、未来方向——你看,路正在铺好

从目前的技术趋势看,有几个方向值得关注:

1. 动态分辨率会成为标配:固定分辨率太反人类了,所有主流模型都在往这个方向走。以后你随便拍一张照片,模型都能看清。

2. 原生融合取代拼接:Qwen2-VL的M-RoPE是个信号,未来视觉和语言会在更底层融合。就像两个人从“隔空喊话”变成了“面对面聊天”。

3. 全模态统一:GPT-4o和Qwen-Omni已经在尝试把文本、图像、音频、视频都统一到一个模型里。以后你发个语音、发张图、发段视频,它都能理解。

4. 理解与生成的统一:现在大多数模型只能“看懂”图片,不能“画”图片。未来理解模型和生成模型会走向统一。你给它张图,它不仅能看懂,还能给你画张新的。


九、给学习者的建议——别怕,动手就行

如果你也想入坑多模态,我的建议是:

先理解模态差异:文本是离散的、线性的,图像是连续的、空间的。理解这种差异比背公式重要。你读书是一行一行读,看照片是一眼扫过去,这就是区别。

动手跑一个Demo:我推荐从LLaVA开始,代码简单,效果直观。用llama.cpp跑一遍,你就知道整个流程是怎么回事了。别光看书,动手!

注意数据质量:多模态模型对数据质量极其敏感。我见过太多人花大量时间调模型结构,但数据一塌糊涂。数据是食物,模型是胃,食物不好,胃再好也白搭。

重要任务必须验证:多模态模型的输出尤其需要验证。图片里的细节容易出错,关键数字要人工复核。别盲目相信模型,它也会犯错。


十、最后说两句——这事儿,值得继续折腾

多模态大模型这三年,从ViT到CLIP到LLaVA再到Qwen2-VL,演进速度之快让我这个从业者都感到惊讶。

但说实话,现在的模型离真正的“看懂”还有距离。它能描述图片里的物体,但很难理解复杂的场景关系;它能识别文字,但容易在细节上犯错。

不过方向是对的。当视觉和语言在底层实现统一表示,机器对世界的理解会上一个台阶。

这事儿,值得继续折腾。

你想想,当一个模型不仅能听懂你说的话,还能看懂你发的图、听懂你录的音频、理解你拍的视频——那才是真正的人工智能。

别怕,我们一起折腾。

503
12582 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月22日 04:18

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

老李 3天前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 6天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 1周前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)