← 返回资讯
赵一鸣
产品评测编辑
已审核

抱抱脸:ChatGPT背后的算法—

我写这个专栏十年了,见过太多技术从“牛逼哄哄”到“无人问津”的轮回。

抱抱脸:ChatGPT背后的算法—

抱抱脸:ChatGPT背后的算法—


十年了,我头一次被一个算法吓到坐不住

我写这个专栏十年了,见过太多技术从“牛逼哄哄”到“无人问津”的轮回。

有的像流星,闪一下就没了;有的像烟花,炸完只剩灰。

但ChatGPT这玩意儿,真让我半夜刷完论文,后背一阵发凉。

前几天我熬夜刷完了抱抱脸(Hugging Face)那篇RLHF的博客,又翻了一遍上那些技术贴。

脑子里就一个念头:这背后的算法,才是真正的“杀手锏”。

不是模型大,不是数据多,而是它学会了——怎么“讨好”你。


一、你猜,以前的AI是怎么学说话的?——像个近视眼射箭

先说我踩过的一个坑。

几年前我折腾过一个AI写诗模型,用的就是那种经典的“自回归生成”。

简单说,就是让模型根据前面几个字,猜下一个字是啥。

训练的时候,用交叉熵算每个词的loss——说白了,就是拿“标准答案”跟它猜的比一比,错了就罚它。

结果呢?

模型能写出“床前明月光,疑是地上霜”。

但你要它写个完整的、有逻辑的段落?立马露馅——前言不搭后语,像喝醉了酒。

你想想,这像什么?

像让一个学生只背单词,不学语法和逻辑。他每个词都认识,但连成句子就“狗屁不通”。

更坑的是,我们评价模型好坏,用的却是BLEU、ROUGE这些指标——说白了,就是拿模型输出跟人类写的“标准答案”比一比。

但训练的时候,模型压根没见过这些“标准答案”长啥样。

这事儿讽刺不?

你让一个近视眼去射箭,然后告诉他“你射偏了”,但他根本看不清靶心在哪。

射一万次也进步不了。


二、RLHF:给模型装上“人肉反馈器”——终于有人懂了

直到RLHF出现,我才觉得这事儿有解了。

它的核心思想其实特简单:别让模型自己瞎猜了,直接拿人类的反馈来训练它。

说白了,就是让模型学会“讨好”人类。

我测试过ChatGPT的一个功能:让它写一段营销文案。

传统的模型可能会给你一堆“专业术语”堆砌的垃圾——什么“赋能”、“闭环”、“抓手”,听着高大上,实际屁用没有。

但ChatGPT会先问你:“目标用户是谁?产品卖点是什么?”

然后输出一个符合“人类偏好”的版本——有温度有逻辑,还能卖货。

这背后,就是RLHF在起作用。

抱抱脸的博客里把RLHF拆成了三个步骤,我用大白话给你翻译一下:

第一步:先找个“底子”好的模型。

比如OpenAI用的GPT-3,DeepMind用的Gopher。这些模型已经看过海量的文本,知道基本的语法和常识。

简单说,就是找个“聪明但不懂事”的年轻人——智商高,但情商为零。

第二步:训练一个“打分器”。

让人类给模型的输出打分。

比如,模型生成一段对话,人类觉得“这个回答很礼貌,我喜欢”,就给高分;觉得“这个回答太生硬,像机器人”,就给低分。

这个“打分器”就是奖励模型(Reward Model)。

说白了,就是找一群人来当“评委”,告诉模型什么是对、什么是错。

第三步:用强化学习“调教”模型。

让模型不断生成内容,然后拿奖励模型给它打分,模型根据分数调整自己的策略。

这个过程就像训练一只海豚:它做出正确的动作,就给它一条鱼;做错了,就不给。

慢慢地,海豚就知道该怎么做才能得到鱼。

我去年在做一个客服对话系统时,试过这个思路。

虽然没用到RLHF那么复杂,但用了一个类似的“人工反馈”机制:让测试人员给模型的回复打分,然后根据分数调整模型参数。

效果立竿见影——模型的回复质量提升了至少30%。

你说,这谁顶得住?


三、别高兴太早——RLHF也有“坑”,我替你踩了

RLHF也不是万能的。

上有人总结过它的几个致命缺陷,我一条条说给你听:

第一个坑:人类的反馈本身就有偏差。

你想想,不同的人对“好回答”的定义能一样吗?

有人喜欢正式,有人喜欢幽默,还有人喜欢简洁。

你让一群标注员打分,他们打出来的分数,可能只代表他们自己那帮人的偏好。

第二个坑:模型可能会“过度优化”,变得“谄媚”。

为了讨好人类,模型可能会说一堆漂亮话,但内容空洞、没有实质。

就像一个人为了让你喜欢,拼命夸你,但说的话全是废话——你听着舒服,但没用。

第三个坑:训练成本极高。

我查了一下,OpenAI为了训练InstructGPT(ChatGPT的前身),用了大量的人类标注员。

这些标注员不仅要给模型打分,还要写“示范回答”。

这事儿对人力、财力都是巨大的消耗——不是一般公司玩得起的。

还有一个我踩过的特别坑的点:奖励模型本身也会“过拟合”。

什么意思呢?

就是它学会了“讨好”标注员,但标注员的偏好未必代表所有用户的偏好。

比如,标注员可能更喜欢“正式”的回答,但用户可能更喜欢“幽默”的回答。

结果呢?模型变成了一个“会拍马屁但不懂人心”的家伙。

我的判断是:

RLHF是当前大模型“对齐”人类意图的最佳路径之一,但它不是终点。

未来可能会有更高效的替代方案——比如直接让模型从人类对话中学习,或者用AI来生成反馈(RLAIF)。

你看,技术这东西,永远在进化。


最后,送你一份“硬核福利”

抱抱脸博客里提到的那几篇RLHF必读论文,我打包整理好了。

这些论文从基础的TAMER到最新的ChatGPT技术细节,覆盖了RLHF的整个发展脉络。

如果你真想搞懂这玩意儿,建议一篇一篇啃——别光看标题,别只看摘要,动手跑一遍代码。

公众号后台回复【1212】就能领。

别嫌麻烦,别想着“以后再看”。

技术这东西,都是“纸上得来终觉浅,绝知此事要躬行”。

记住:能让你坐不住的东西,才是真正能改变你的东西。

432
6183 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月22日 15:22

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 2周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 3天前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 6天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)