← 返回资讯
陈默
AI 行业分析师
已审核

OpenAI揭秘训练细节,但最值钱的数据配方没给

昨天半夜,朋友突然给我发来一条微信:“ChatGPT到底是怎么练出来的?我看了半天资料,越看越糊涂!”

OpenAI揭秘训练细节,但最值钱的数据配方没给

OpenAI揭秘训练细节,但最值钱的数据配方没给


OpenAI第一次“揭秘”训练细节?我说句大实话:他们给了你一块肉,但汤底秘方藏得死死的!

你猜怎么着?

昨天半夜,朋友突然给我发来一条微信:“ChatGPT到底是怎么练出来的?我看了半天资料,越看越糊涂!”

我当时正躺在床上刷手机,看到这条消息直接笑出声。我回他:“这事儿啊,说难也难,说简单也简单——就四步:预训练、有监督微调、奖励建模、强化学习。”

朋友沉默了五秒钟,回了我三个字:“就这?”

我:“就这。”

哈哈哈,你看,这就是大多数人看到答案后的反应。四个看似直白的步骤,听起来好像没什么了不起的。但你要是真信了,那就太天真了。


说到这儿,不得不提Andrej Karpathy在Build 2023的那场演讲

说实话,那确实是OpenAI第一次把训练流程摊在桌上给大家看。但你看仔细了吗?他们摊开的是流程,不是配方。

我把那个视频翻来覆去看了三遍!又找到了Altman和GPT-4.5团队的访谈,啃了一遍又一遍。再加上我自己折腾开源模型掉过的坑、踩过的雷,今天必须跟你聊聊,那些藏在PPT背后的真相。


第一个反直觉的真相:**99%的算力扔在预训练,但最值钱的东西,他们一个字没提**

Andrej的流程图里,预训练那一块,整整占了全图99%的计算时间!

他拿Meta开源的Llama举例子,讲了数据混合比例:CommonCrawl、C4、GitHub、维基百科……听起来是不是特清楚?

但问题来了——OpenAI自己的数据混合长什么样?

不知道。

Andrej只轻飘飘地丢了一句:“我们不做公开缩放研究。”

啧啧啧,你品,你细品。

我猜啊,他不是不想说,是说了也没用。你能复制他们的比例,却复制不了人家的数据清洗管道和去重策略。那套东西才是真正的黑箱!

我自己调过一个小模型,光处理中文语料里的那些垃圾数据,就差点要了我半条命。错别字、重复内容、格式混乱……改到想砸电脑。

OpenAI在GPT-4.5访谈里提到过一个概念叫“数据长尾效应”——让模型学到那些低频但关键的模式。你知道这是砸了多少血本才磨出来的吗?两年时间,10万块GPU,几百号人没日没夜地跑实验!

所以啊,第一个真相就是:预训练的本质,根本不是什么算法突破,这是一场数据工程和基础设施的马拉松! Andrej给了你一张地图,但每个关键的岔路口该怎么走,他一个字都没提。


微调和RLHF这部分,你能偷师……但别太当真

说到第二阶段——监督微调(SFT)和强化学习(RLHF),Andrej讲得相对细致了一些:怎么收集人类示范数据,怎么训练奖励模型,怎么用PPO做强化学习优化。

这确实给开源社区指了条明路!后来有了Alpaca、Vicuna、Qwen的微调版本,有人号称用几百美元就“复刻”了ChatGPT的效果。

但说真的?我自己拿Alpaca和GPT-3.5同时问过同样的问题,差距那是肉眼可见!

为什么差这么多?

答案就两个字:数据。

OpenAI手里有海量的高质量对话数据!这些数据来自真实用户和强化学习过程的迭代采集。Andrej提到过,在RLHF阶段他们会不断生成多个候选回复让人工排序。这个数据集的规模和质量,你在公开渠道根本买不到!

Altman在访谈里也明确说过:数据效率才是下一个瓶颈,算力反倒退居其次。

换句话说——你就算有10万张显卡,没有好数据,也白搭!

再说PPO这玩意儿,调参简直是炼狱级别的折磨。Andrej说他们用着一套内部工具,但没告诉你他们跑了多少版实验才找到合适的参数。我自己试着调过一次PPO,Loss直接飙升到天际,折腾了一个星期才勉强稳住。

OpenAI的系统团队几十号人憋了两年弄出来的东西,你指望一篇演讲就学会?


10万卡集群的坑:这才是OpenAI最坦诚的一部分

要是说Andrej的演讲是给外行看的热闹,那Altman和GPT-4.5团队45分钟的对谈,才是内行该认真看的门道。

他们第一次承认了:10万卡训练集群的“灾难性问题”!

一个隐藏的小bug,导致系统频繁报错。而他们一直到训练进度条走到40%才发现!

40%啊朋友们!相当于你跑马拉松跑了半程,才发现鞋子里的沙子是块石头!

首席系统架构师Amin Tootoonchian的原话是:单个加速器、网络、所有组件都需要按预期同时工作。当集群从1万卡扩到10万卡,原本的小概率故障变成了每天必现的常态。

你想啊,1万卡的时候可能一周出一次小毛病,10万卡的时候每天都有新惊喜!

我读过AWS的一些白皮书,知道大规模分布式训练的网络拓扑和故障容错有多难。但OpenAI这番话还是让我震惊了。

GPT-4.5的诞生,不仅是算法胜利,更是系统团队的工程奇迹。他们“边修边训”,在两个月的时间里跑完整个训练——这个能力本身,就是一座别人翻不过去的大山!

所以你明白了吗?我们常说的“大模型门槛”,算力只是入场券。你能不能把10万块GPU当成一台计算机来用,那才是真正的分水岭。


我想回应一种看法

有人可能会说:“Andrej的演讲已经很透明了!连四个阶段的训练目标函数都公开了,你还要怎样?”

我承认,比起以前那个像防贼一样盯着技术细节的CloseAI,这次的OpenAI确实进步了不少。但是朋友,你得搞清楚“技术科普”和“技术揭秘”的区别啊!

Andrej讲得深入浅出,能让非专业人士听得眉飞色舞。可真正做模型训练的人会发现——所有具体的参数、比例、超参、故障处理,全都模糊处理了。

GPT-4的技术报告是67页的工程总结,依然没提模型大小、数据规模、训练技巧。GPT-4.5的访谈强调了数据效率和不完美信息,但也没给出可复现的公式。

所谓的“首次揭秘”,更像一个精心设计的公关动作。 在微软的开发者大会上,总得讲点有意思的东西,但核心竞争力?对不起,一个字都不能泄露。


最后,说说我的判断和建议

如果你现在还在纠结“该不该从零开始预训练一个GPT”,我劝你打住。

OpenAI这条路,是用十亿美金和几百人团队铺出来的。普通人别跟着瞎凑热闹。

那该做什么?两件事:

第一,用好现有的基础模型。

Andrej在演讲的第二部分讲了prompt的本质——它是在调用模型预训练时形成的知识分布。你写一个精心设计的system prompt,让模型切换到它熟悉的某些模式,效果比你瞎训练强一百倍!

我亲测过一个场景:用少量例子诱导模型使用思考链,数学推理的正确率从30%直接跳到70%。一分钱没花!

第二,关注数据效率,别再盲目堆算力。

从GPT-4.5的访谈可以听出来,OpenAI内部已经明确把“用同量数据学更多知识”列为头号目标。他们现在说,5到10个人就能复刻出GPT-4级别的模型了。

如果你还在嘲笑“中国大模型只会内卷”,不如想想人家不断提升的工程效率。与其花钱烧算力,不如花时间研究数据!


回看那场演讲:Andrej全程微笑,语速飞快,PPT精美得像艺术品,活像个大学教授在讲课。

但你得明白——教授教的是理论,真正赚钱的配方,他留着写论文和开公司去了。

我很感谢OpenAI第一次把黑箱打开一个口子,让我们看到了光。

但别以为看见了光,就等于拿到了钥匙。

接下来的路,还得自己一步一步走出来。


他给了你一把钥匙,但锁是他家保险柜的。

38
964 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 06:51

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

技术小白 1周前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 1周前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)