GPT-4的多模态能力是如何实现的?
你亲手写过那种字迹狂草、连自己回头都得认半天的购物清单吗?
我写了。
然后,我拍了张照片扔给GPT-4V——就是带视觉能力的那位。你猜怎么着?它不但一个字没落下地读了出来,还自动给我分成了“生鲜类”“日用品类”。最后,它悠悠地补了一句:“建议确认牛奶保质期。”
我当时就愣了。
这根本不是简单的文字识别——它是在“懂”啊!知道这是购物清单,知道牛奶会过期,知道该提醒你一句。我后背一凉:这玩意儿比我妈还贴心。
但你知道吗?我刚开始研究多模态的时候,也被那些什么跨模态注意力、统一语义空间、Q-Former桥接……一堆高大上的术语砸得头晕。后来我撸了几个模型,翻了十几份技术报告,才发现:这事儿没你想的那么玄,但也绝对比你想象的更震撼!
你以为多模态就是看图识字?太天真了!
很多人觉得,多模态嘛,就是让模型既能认图又能认字,两边一拼完事。
这跟说“造火箭就是把燃料和发动机装一块儿”一个水平。
真正的多模态,核心思路就一句话:把图像和文本扔进同一个Transformer,让它们共享一套注意力机制。 不是你有你的视觉编码器,我有我的文本编码器,最后拿根转接线强行对接——而是从一开始,大家就在一个池子里扑腾!
具体怎么干?
图像进来先切成小块(Patch Embedding),文本进来切成Token(Token Embedding),然后全部丢进统一的编码器。注意力的世界里,没有图像和文字的区别,只有“我要跟谁互动”的需求。所以它们既要跟同类眉来眼去,也要跟异类勾肩搭背。
换句话说,它看你拍的那张购物清单,不只是认出几个字,而是把字的形状、周围的像素、整体的布局全部揉在一起理解。就像你看一张照片,不光是看人,还看环境、看灯光、看氛围——整体感知。
真正让我震惊的,是开源模型的“极简主义”
去年我在本地跑了一个叫LLaVA的开源模型。这货的设计思路跟GPT-4差不多,但架构简单到让我怀疑人生:一个CLIP ViT做图像编码,一个线性投影层做维度对齐,然后直接娶给LLaMA。
没有Q-Former。没有复杂的跨模态注意力。就是一层线性映射!
可效果呢?好得吓人。
为什么?因为语言模型本身已经是一个超级上下文理解机了!你只要把视觉信息翻译成它听得懂的话,它自己就能琢磨怎么用。那个线性投影层就是个翻译官——把视觉坐标换成语言坐标。
说到这儿,我不得不感叹一句:大语言模型被严重低估了。 你以为它只是个能说会道的聊天机器人,其实它最厉害的是理解力——不管输入是文字、图像还是声音,只要格式对,它都能给你盘出逻辑来。
训练过程,才是真正的骚操作
GPT-4的多模态不是一天练成的。分了四个阶段,而且进行了大量迭代。
第一阶段:海量预训练。 纯文本、交错图文、图像字幕对全上。先拿大炮轰一遍,建立基础理解。跟我当年训BERT思路差不多——先砸数据,再搞精细活。
第二阶段:行为对齐。 让模型学会跟人类价值观对齐。这个阶段产出了两个关键武器:一个基于规则的奖励模型(RBRM),一个基于深度学习的奖励模型(RM)。
第三阶段:RLHF。 用上面俩奖模当裁判,给主模型打分,模型跟着学。你来写,我来改,我来打分,你照着练。
第四阶段——最骚的一步来了:模型自我提升。 GPT-4自动生成更多训练数据,然后循环回去迭代训练。等于说它自己当了自己的老师!
有没有搞错?
我当年做模型训练,最痛苦的就是数据标注。现在倒好,模型自己就能生产训练数据了。技术进步,就是这么不讲道理,又让人又爱又怕!
安全这块,GPT-4下了血本
你可能觉得:多模态不就是个加强版搜索引擎吗?有啥难的?
对了一半。
多模态确实能提升理解能力,但也带来了新的隐患——比如“多模态幻觉”:模型看了一张图,硬说自己看到了图里根本没有的东西。而且图像里的有害内容更难识别。
GPT-4为了对付这个问题,搞了一套“基于规则的奖励模型”(RBRMs)。本质就是一堆zero-shot分类器,在RLHF微调期间给模型提供额外的奖励信号。比如教它:“遇到有害内容请求,要拒绝,但拒绝要得体,不能闪烁其词,也不能太散漫。”
效果怎么样?OpenAI自己的数据摆在这儿:
- GPT-4对禁止内容请求的倾向**降低了82%**!
- 有毒内容生成率:GPT-4只有**0.73%**会出问题,而GPT-3.5是**6.48%**。
看懂了吗?不是花瓶式升级,是底层的安全机制实打实做扎实了。
数字不会骗人。
但你千万别觉得它完美了——冷水必须泼
我得说句大实话。
GPT-4的多模态还是胡编乱造。你拿一张模糊的照片让它识别,它可能拍着胸脯说:“这是一只柯基犬!”但实际上——那可能是只猫。
这个问题背后的逻辑特别讽刺:RLHF训练的目标是让人类标注者觉得模型的输出好。但人类标注者往往更喜欢一个“自信的答案”,而不是“我不确定”。所以模型学会了:就算拿不准,也得装懂!
这不就是在鼓励它自信犯错吗?
技术就是这样,总有两面性。我们得到了前所未有的理解能力,但同时,也要承受它的“过度自信”。
购物清单读得好,因为它清晰;模糊的猫说成狗,因为它不知道“不知道”也可以说出来。
说到最后
从购物清单到柯基犬,GPT-4的多模态到底怎么做到的?
说白了,就是把图像和文字扔进同一个大池子,让它们互相泡、互相学。加上四阶段疯狂训练、安全机制层层加固、自我迭代升级。它没长眼睛,也不需要长眼睛。它靠的是数据、算法和人类对理解的渴望。
而今天,你我也许都该问自己一个问题:
当机器开始真正“理解”我们时,我们能给它一个更好的世界去理解吗?
最后一句话,送给读完这篇文章的你:
多模态的终极意义,不是让机器看见世界,而是让世界通过机器,第一次真正看见了我们。
(就这句,拿去截图吧。)
读者评论 4