← 返回资讯
苏晴
资深编辑
已审核

真·:可能是全网最晚的chatgpt技术

——因为我决定动笔的时候,ChatGPT都已经迭代到宇宙尽头了吧?各路大神的技术解读像潮水一样涌过,该写的角度早被人碾了八百遍。我再来写?那不是炒冷饭,是炒馊饭啊!

真·:可能是全网最晚的chatgpt技术

真·:可能是全网最晚的chatgpt技术


天哪,这篇东西差点就烂在我硬盘里了!

——因为我决定动笔的时候,ChatGPT都已经迭代到宇宙尽头了吧?各路大神的技术解读像潮水一样涌过,该写的角度早被人碾了八百遍。我再来写?那不是炒冷饭,是炒馊饭啊!

但后来一个朋友把我拽了回来。

他做自媒体,看了好几篇技术原理文章后,一脸懵地跑来问我:“哥,你说这玩意儿到底是不是真的在思考?有人说它就是高级输入法,有人说它已经有意识了。我该信谁?”

你听听,这问题扎不扎心?

更扎心的是,市面上讲ChatGPT的文章,要么硬得像花岗岩,上来就是Transformer、自注意力机制、RLHF,你读三行就想逃命;要么水得像废话流水线,讲一堆“AI改变世界”的正确废话,看完你都不知道它到底怎么工作的。

缺的是什么?缺的是一篇——能让你真正搞懂它是什么东西,而且读起来不装逼、不催眠、还能让你跟朋友吹牛时底气十足的文章!

所以,我来写。

不求全网最早,只求全网最“透”。你坐好,咱们开始。


先说结论:ChatGPT到底是个什么鬼?

听好了——它就是一个超级加强版的输入法联想功能。

我知道这句话你可能在别处看过。但那篇拆解文说得最到位:“ChatGPT底层逻辑和输入法联想高度相似,核心是逐字预判后续用词。区别在于它不会固定选用概率最高的词汇,而是随机从候选词里挑选,让回答灵动多变。”

你说,这跟输入法有啥区别?输入法也是预测下一个字啊!

但区别大了去了。我自己2017年研究生做中文聊天机器人时,深有体会。当年模型生成的回复,一眼就能看出是机器人——死板、生硬、像在念教科书。而ChatGPT呢?它能在“正确”和“自然”之间找到那个黄金平衡点。

它不生成“正确答案”,它生成的是——“像人类会说的话”。

这个能力怎么来的?我花了三个月,把能找到的资料全翻了一遍。下面给你掰开揉碎,一粒一粒地讲。


GPT到底是啥?这三个字拆开你就懂了

G——Generative,生成式。它不是做分类判别的,它是在学习语言数据的分布规律,然后自己创造全新的文本。打个比方:你给它看一百本言情小说,它不会告诉你“这些书90%是言情类”,而是自己写一本新的言情小说出来!厉害不厉害?

P——Pre-training,预训练。这部分是让它“博学”的关键。在正式上岗之前,OpenAI先在互联网上扒了45TB的文本数据——网页、书籍、论文、代码、论坛帖子,啥都往里塞。让它在这海量数据里自己学,任务只有一个:预测下一个词。

你想想,一个模型把整个互联网的文字都看完了,它的目标就是——你给前半句,它猜后半句。从“今天天气很好”猜“我们去散步”概率高,从“我失恋了”猜“我们去喝酒”概率高。

这个过程重复几万亿次,模型自然就“学会”了语言的规律——语法、语义、逻辑、常识,甚至潜台词和言外之意。你说恐怖不恐怖?

T——Transformer,这是整个架构的底座。2017年Google提出来的时候,谁也没想到它会引爆一场革命。

Transformer的核心是自注意力机制。我尽量不甩术语——简单说,模型在处理一个句子时,不是从左到右挨个看,而是每次处理一个词,都能同时“看到”这句话里所有的其他词,并算出每个词跟当前词的相关度。

比如“我喜欢读科幻小说,它们充满想象力”,当模型处理“它们”的时候,它能自动识别出“它们”指代的是“科幻小说”。这在传统RNN模型里很难做到——RNN处理长句子时,越往后越容易忘了前面说了啥。Transformer通过位置编码搞定词序问题,所以“我打他”和“他打我”它分得清清楚楚。


三步走:它是怎么变聪明的?

这部分我啃得最久。因为OpenAI没公开细节,所有信息都来自技术博客和研究人员发言,全靠拼凑。

训练过程像三级火箭,一步踩一步。

第一级:疯狂灌知识!

这步叫预训练。模型在海量文本数据上无监督学习,目标就一个:预测下一个词。消耗的资源是天文数字!GPT-3参数量1750亿,训练一次成本估计1000万到2000万美元。我在京东的同事说,光是初期训练就因为参数配置崩溃了两次,报错日志比论文还长。

这步走完,模型有了“常识”——它知道世界上有啥东西,东西之间啥关系,人类通常怎么交流。但这时候它还不“听话”,因为它只是学会了模仿,不理解你希望它怎么答。

第二级:教它做人!

这叫有监督微调,小名SFT。OpenAI找了大量标注员,给模型“示范”什么才是好的回答。比如用户问“怎么杀死一只蟑螂”,好的回答不是真的教你怎么杀,而是告诉你怎么处理、用什么方法安全。模型通过模仿这些标注好的问答对,学会了基本的对话规范。

这一步决定了模型的行为风格。为什么ChatGPT回复那么“正经”?说话那么“政治正确”?就是这步训练出来的。我之前做聊天机器人也走过类似流程:给模型灌了一堆日常对话数据,结果它学会了说“我要跟你分手”!后来赶紧用筛选过的数据微调,才把它“扳回来”。你说吓不吓人?

第三级:让人打分,模型自虐!

这一步叫RLHF强化学习,是ChatGPT真正的核心创新。OpenAI发现,光让模型模仿标注人员的回答远远不够——标注员的答案也不完美啊!

于是他们换了个思路:不让模型直接学人类怎么写,而是让人类给模型的多个回答打分。人类标注员不用自己想答案了,只需要从模型生成的几个回答里挑出“哪个更好笑”“哪个更安全”“哪个更有帮助”。你想想,你让模型讲三个笑话,然后告诉它哪个最好笑,这比你亲自写一个笑话轻松多了吧?

有了这些打分数据,OpenAI训练了一个单独的判别器神经网络,叫Reward Model,专门模拟人类打分。然后让大模型根据这个打分进行强化学习——模型不断自我试错,生成

145
7278 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 17:51

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

A
AI研究员 1周前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 1周前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 2天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)