← 返回资讯
苏晴
资深编辑
已审核

GPT / GPT-2 / GPT

好家伙!前两天跟朋友吃饭,他一脸笃定地说:“GPT-3不就是ChatGPT吗?换个皮肤而已。”我差点把嘴里的饭喷出来!**这误会可太大了!** 我决定亲自下场,把GPT家族从1代到InstructGPT全测一遍——不光是看论文,是真上手跑模型!看看它们到底差在哪儿!

GPT / GPT-2 / GPT

GPT / GPT-2 / GPT


好家伙!前两天跟朋友吃饭,他一脸笃定地说:“GPT-3不就是ChatGPT吗?换个皮肤而已。”我差点把嘴里的饭喷出来!这误会可太大了! 我决定亲自下场,把GPT家族从1代到InstructGPT全测一遍——不光是看论文,是真上手跑模型!看看它们到底差在哪儿!


先说最直接的测试。我拿同一个问题去砸不同模型:“法国的首都是什么?”

你猜原版GPT-2怎么回的?我敲进去“法国的首都是”,它老人家头也不抬地续了一句:“法国是一个位于欧洲的国家,以美食、艺术和时尚闻名。” 没了???巴黎呢? 它根本不知道你在问问题!它只是在玩概率游戏:前面出现了“法国的首都是”,后面最可能接啥?哦,“法国”接着絮叨吧。这就是个纯粹的续写机器,没有“对话”这回事!

换InstructGPT试试:“法国的首都是什么?” 秒回:“巴黎。”后面还贴心地补了一句解释。差距就是这么扎眼!

但最让我惊掉下巴的,是GPT-3基座模型。2020年我用davinci引擎时,试着让它翻译:“翻译一下:Hello world”。你猜它回了什么?“翻译一下:Hello world\n\n翻译出”。它没给我中文,而是继续写“翻译”这个话题!它根本不懂指令! 所以当年OpenAI的Prompt教程才疯狂强调要给例子啊——

CODE
英语: Hello -> 法语: Bonjour
英语: Good morning -> 法语: Bonjour
英语: Apple -> 法语: 

这叫Few-Shot。例子越多,它越能摸准你的意图。但注意!这不是理解,这是上下文学习(In-Context Learning)! 模型参数没动,纯粹靠注意力从示例里提取模式。这也是GPT-3论文标题“Language Models are Few-Shot Learners”的核心——它证明了一件事:只要模型够大(1750亿参数),不微调,光在提示词里塞例子就能干活!


到这里,有个巨大的认知陷阱必须戳破:GPT-3本质上还是预训练模型,没经过指令微调! 很多人后来用得顺手,是因为OpenAI在它上面加了一层指令微调和RLHF,变成了InstructGPT(text-davinci-002/003)。2020年刚放出davinci时,那家伙根本不做指令遵循!

我把对比表扔这,你一眼就懂:

| 模型 | 发布时间 | 参数量 | 训练方式 | 是否指令微调 | 如何完成任务 |

|------|----------|--------|----------|--------------|--------------|

| GPT-1 | 2018 | 1.17亿 | 预训练 + 任务微调 | 否(需要下游微调) | 微调模型参数 |

| GPT-2 | 2019 | 15亿 | 预训练 | 否 | 无条件续写 / 零样本启发 |

| GPT-3 | 2020 | 1750亿 | 预训练 | 否 | In-Context Learning(Few-Shot) |

| InstructGPT | 2022 | 13亿~1750亿(13B效果最优) | 预训练 + SFT + RLHF | 是 | 直接遵循指令 |

注意看InstructGPT那行:它的13亿参数版本,在人类偏好评估里击败了1750亿的GPT-3! 这事儿当时震撼到我头皮发麻——你不跟人对齐,参数再大也白搭!


那InstructGPT是怎么对齐的?三步走:

1. SFT(监督微调):从真实用户请求里抽指令,让标注员写高质量回答;

2. Reward Model(奖励模型):用这些数据和人工排序训练一个“评判官”,给回答打分;

3. PPO强化学习:让策略模型死磕高分回答,越变越“讨喜”。

这么一来,模型学的不再是“下一个词是什么”,而是“人类喜欢什么样的回答”。标注员喜欢肯定、有条理、有信息量的回答,不爱听“我不知道”。所以InstructGPT哪怕不确定,也硬给一个答案,语气还特自信。从用户体验看,比GPT-3好用十倍!


但是!副作用也炸裂了。我测试时发现,对于明显超出知识边界的问题(比如2023年的事),InstructGPT照样能编出一套看似合理的回答。这就是RLHF的代价:校准性让位于有用性。 预训练模型本来概率分布比较平均,对未知会犹豫;对齐后模型学会了把低概率猜测也说得斩钉截铁。你问“2026年世界杯冠军是谁?” 它答:“很可能是巴西或法国。”但语气强硬得跟真的似的。

所以你得留个心眼——用InstructGPT做客服或生成内容,别全信它的自信。幻觉不是bug,是训练目标里自带的特性。


说到使用建议:如果你只需要一个听话的助手,直接上InstructGPT(或ChatGPT),别犹豫。但如果你做创意写作、续写、需要模型放飞想象力——原始的预训练基座反而更香! 它没那么“端着”,续写多样性更强。我写小说开头时试过用GPT-2接着写,虽然语法偶尔崩,但时不时冒出惊艳的句子。InstructGPT写出来的太工整,少了点野性的灵气

还有一个实战细节:InstructGPT的训练数据截止2021年9月。问2022年以后的事,它要么瞎编,要么认怂。GPT-4也一样,只是知识截止点更新一点。知道这个边界,用起来才不会盲目相信。


我现在的工作流是这样的:事实查询用Instruct版本(再加个RAG检索),创意生成用基座模型(但很少直接上线,太不可控),复杂推理就自己设计Chain-of-Thought,分步走。

写这篇,就是想把概念的坑填上。很多人搞了一两年Prompt,连自己用的是基座还是指令模型都搞不清。你想想,你在InstructGPT上写得好好的Prompt,一迁到GPT-3就稀里哗啦——不是你没技术,是模型的行为逻辑完全不同! 理解这点,以后选模型才有谱。


GPT系列的进化,说白了就是从“学会说话”到“学会听人话”的过程。中间跨过了多少坑、做了多少取舍,只有亲手跑一遍的人才知道。我跑了,也踩了。这一路真挺过瘾,也让我对“对齐”这两个字再也不敢轻视。

参数可以堆,对齐得用心。技术再强,不听人话也白搭。

——这句话,值你一张截图。

133
6678 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 21:55

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

A
AI研究员 3天前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 6天前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 1周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)