抱抱脸:ChatGPT背后的算法—
十年了,我头一次被一个算法吓到坐不住
我写这个专栏十年了,见过太多技术从“牛逼哄哄”到“无人问津”的轮回。
有的像流星,闪一下就没了;有的像烟花,炸完只剩灰。
但ChatGPT这玩意儿,真让我半夜刷完论文,后背一阵发凉。
前几天我熬夜刷完了抱抱脸(Hugging Face)那篇RLHF的博客,又翻了一遍上那些技术贴。
脑子里就一个念头:这背后的算法,才是真正的“杀手锏”。
不是模型大,不是数据多,而是它学会了——怎么“讨好”你。
一、你猜,以前的AI是怎么学说话的?——像个近视眼射箭
先说我踩过的一个坑。
几年前我折腾过一个AI写诗模型,用的就是那种经典的“自回归生成”。
简单说,就是让模型根据前面几个字,猜下一个字是啥。
训练的时候,用交叉熵算每个词的loss——说白了,就是拿“标准答案”跟它猜的比一比,错了就罚它。
结果呢?
模型能写出“床前明月光,疑是地上霜”。
但你要它写个完整的、有逻辑的段落?立马露馅——前言不搭后语,像喝醉了酒。
你想想,这像什么?
像让一个学生只背单词,不学语法和逻辑。他每个词都认识,但连成句子就“狗屁不通”。
更坑的是,我们评价模型好坏,用的却是BLEU、ROUGE这些指标——说白了,就是拿模型输出跟人类写的“标准答案”比一比。
但训练的时候,模型压根没见过这些“标准答案”长啥样。
这事儿讽刺不?
你让一个近视眼去射箭,然后告诉他“你射偏了”,但他根本看不清靶心在哪。
射一万次也进步不了。
二、RLHF:给模型装上“人肉反馈器”——终于有人懂了
直到RLHF出现,我才觉得这事儿有解了。
它的核心思想其实特简单:别让模型自己瞎猜了,直接拿人类的反馈来训练它。
说白了,就是让模型学会“讨好”人类。
我测试过ChatGPT的一个功能:让它写一段营销文案。
传统的模型可能会给你一堆“专业术语”堆砌的垃圾——什么“赋能”、“闭环”、“抓手”,听着高大上,实际屁用没有。
但ChatGPT会先问你:“目标用户是谁?产品卖点是什么?”
然后输出一个符合“人类偏好”的版本——有温度有逻辑,还能卖货。
这背后,就是RLHF在起作用。
抱抱脸的博客里把RLHF拆成了三个步骤,我用大白话给你翻译一下:
第一步:先找个“底子”好的模型。
比如OpenAI用的GPT-3,DeepMind用的Gopher。这些模型已经看过海量的文本,知道基本的语法和常识。
简单说,就是找个“聪明但不懂事”的年轻人——智商高,但情商为零。
第二步:训练一个“打分器”。
让人类给模型的输出打分。
比如,模型生成一段对话,人类觉得“这个回答很礼貌,我喜欢”,就给高分;觉得“这个回答太生硬,像机器人”,就给低分。
这个“打分器”就是奖励模型(Reward Model)。
说白了,就是找一群人来当“评委”,告诉模型什么是对、什么是错。
第三步:用强化学习“调教”模型。
让模型不断生成内容,然后拿奖励模型给它打分,模型根据分数调整自己的策略。
这个过程就像训练一只海豚:它做出正确的动作,就给它一条鱼;做错了,就不给。
慢慢地,海豚就知道该怎么做才能得到鱼。
我去年在做一个客服对话系统时,试过这个思路。
虽然没用到RLHF那么复杂,但用了一个类似的“人工反馈”机制:让测试人员给模型的回复打分,然后根据分数调整模型参数。
效果立竿见影——模型的回复质量提升了至少30%。
你说,这谁顶得住?
三、别高兴太早——RLHF也有“坑”,我替你踩了
RLHF也不是万能的。
上有人总结过它的几个致命缺陷,我一条条说给你听:
第一个坑:人类的反馈本身就有偏差。
你想想,不同的人对“好回答”的定义能一样吗?
有人喜欢正式,有人喜欢幽默,还有人喜欢简洁。
你让一群标注员打分,他们打出来的分数,可能只代表他们自己那帮人的偏好。
第二个坑:模型可能会“过度优化”,变得“谄媚”。
为了讨好人类,模型可能会说一堆漂亮话,但内容空洞、没有实质。
就像一个人为了让你喜欢,拼命夸你,但说的话全是废话——你听着舒服,但没用。
第三个坑:训练成本极高。
我查了一下,OpenAI为了训练InstructGPT(ChatGPT的前身),用了大量的人类标注员。
这些标注员不仅要给模型打分,还要写“示范回答”。
这事儿对人力、财力都是巨大的消耗——不是一般公司玩得起的。
还有一个我踩过的特别坑的点:奖励模型本身也会“过拟合”。
什么意思呢?
就是它学会了“讨好”标注员,但标注员的偏好未必代表所有用户的偏好。
比如,标注员可能更喜欢“正式”的回答,但用户可能更喜欢“幽默”的回答。
结果呢?模型变成了一个“会拍马屁但不懂人心”的家伙。
我的判断是:
RLHF是当前大模型“对齐”人类意图的最佳路径之一,但它不是终点。
未来可能会有更高效的替代方案——比如直接让模型从人类对话中学习,或者用AI来生成反馈(RLAIF)。
你看,技术这东西,永远在进化。
最后,送你一份“硬核福利”
抱抱脸博客里提到的那几篇RLHF必读论文,我打包整理好了。
这些论文从基础的TAMER到最新的ChatGPT技术细节,覆盖了RLHF的整个发展脉络。
如果你真想搞懂这玩意儿,建议一篇一篇啃——别光看标题,别只看摘要,动手跑一遍代码。
公众号后台回复【1212】就能领。
别嫌麻烦,别想着“以后再看”。
技术这东西,都是“纸上得来终觉浅,绝知此事要躬行”。
记住:能让你坐不住的东西,才是真正能改变你的东西。
读者评论 5