← 返回资讯
陈默
AI 行业分析师
已审核

一篇文章讲清大语言模型发展史

2017年,我还在工位上调LSTM,盯着跑了一夜的代码,结果模型把开头第三句话彻底忘了。气得我差点摔键盘——你想想,写个几百字的文本,前面跟后面完全没关系?这玩意儿怎么能商用?

一篇文章讲清大语言模型发展史

一篇文章讲清大语言模型发展史


大模型这十年:全是意外,没有剧本

2017年,我还在工位上调LSTM,盯着跑了一夜的代码,结果模型把开头第三句话彻底忘了。气得我差点摔键盘——你想想,写个几百字的文本,前面跟后面完全没关系?这玩意儿怎么能商用?

然后Google的那篇《Attention Is All You Need》出来了。第一次看完,我第一反应是:“不用RNN?这群人疯了吧?”——就这一句话,拉开了十年意外史的序幕。


一、骨架是碰上的,不是设计出来的

你猜怎么着?Transformer最初是给翻译做的。那帮人只是想把翻译里的循环层换掉,根本没想到后来会成为所有大模型的脊梁骨。一个为了解决眼前麻烦的“土办法”,硬是撑起了一个时代。

最搞笑的是分叉。2018年,OpenAI做了GPT-1,只用了Transformer的Decoder部分;Google做了BERT,只用了Encoder部分。两边赌的方向完全相反。Google赌理解,OpenAI赌生成。谁对?几年后证明:Decoder-only在扩展时更平稳,而Encoder-Decoder在推到一定规模后开始出现不稳定的迹象。很多人猜测,OpenAI当年选Decoder其实是因为穷,算力不够跑完整的Encoder-Decoder。但这个看似“偷工减料”的决定,反而成了历史级的神操作。

说到这儿,我插一句自己的经历。后来我在小团队里复现过BERT-style的生成模型,调试起来想哭。换成GPT-style,简单多了。我当时就一个感觉:越简单的东西,在工程上跑得越远。 这不是理论推导出来的,纯粹是“拆掉一半零件,车反而跑快”——意外中的意外。


二、大力出奇迹,我们是一脸懵着信的

2019年GPT-2出来,15亿参数,能写假新闻。我当时心里想的是:“这不过是更大规模的过拟合,换点数据就得现原形。”——是不是跟你现在想的一样?那时候所有人都觉得,能力靠精巧设计,不是靠堆参数。

2020年GPT-3直接把我的脸打肿了。1750亿参数、45TB数据、一次训练烧掉上千万美元。关键不是它大,而是大了以后出现了没人预料到的能力——只给几个例子,它就能翻译、写代码、做数学题。这些在训练时根本没教过它。而且越往后,你在它身上看到的“涌现”越多,仿佛这模型自己长出新本事。

Scaling Law那篇论文直接成了圣经。参数量每提升10倍,下游任务成绩几乎是平滑上升的,看不到头。我后来拿GPT-3的API做了一百个分类任务,跟之前微调过的BERT对比——GPT-3在三分之二的任务上赢了,而且它从没见过那些任务的标注数据。

有人现在说Scaling Law撞墙了。我不同意。它只是换了方向——2024年大家开始卷推理时的计算量,其实就是换个维度继续“大力出奇迹”。你看,这从来不是理论胜利,是工程运气。


三、ChatGPT为什么炸了?不是因为它强,而是因为它“听话”

2022年11月,ChatGPT发布当晚我注册了。聊了半小时,我在朋友圈写了一句:“AI第一次不需要我迁就它了。”

你用过的GPT-3就知道,特憋屈。你要写“请翻译以下英文为中文:Hello world”,它才乖乖翻译。你说“帮我翻译Hello world”,它可能反过来给你解释什么叫Hello world。问题是用户谁会读说明书?

ChatGPT做了两件关键的事:把所有任务统一成对话,再用RLHF让回答符合人类偏好。不说废话、不冒犯、追问澄清。就这么简单。

我2022年底给客户做AI客服系统,拿GPT-3 davinci接口调,提示词写了三页纸,效果还是随机的。后来换成GPT-3.5,同样的任务,提示词三句话就搞定。这说明什么?模型70%的能力被锁死在“不会配合”上。对齐,就是那把钥匙。

有人会担心RLHF阉割创造力。我承认,在某些开放式任务上,ChatGPT比原始GPT-3保守。但你要分清“产品级”和“研究级”。面向大众的产品,牺牲一点上限换全面可用性,这笔账太划算了。否则你根本不会用,再强又怎样?


四、开源那把撬棍:LLaMA和DeepSeek教会我们一件事

2023年初,Meta放出LLaMA,参数从7B到65B,性能直逼GPT-3。最关键的是——权重开源。我当天就在本地跑了个7B模型做翻译,效果比不上GPT-3.5,但已经能用了。社区只用了不到一个月就做出Alpaca、Vicuna这些微调版,质量又跳一截。

开源模型的迭代速度,让“闭源领先”成了短暂状态。 到了2024年,DeepSeek-V2用MoE架构把训练成本打到极低,性价比吊打一众商业模型。我直接把公司的客服系统从GPT-4换到DeepSeek-V2,成本降了80%,准确率掉3%。这不是个例——我周围做AI应用的朋友,2024年下半年全偷偷混用了开源模型。

最爆炸的2025年初DeepSeek-R1,它把OpenAI o1提出的“推理时计算”做成了开源实现。性能接近o1,成本十分之一。我第一次用它做逻辑题,心里冒出一个感觉:这模型好像真的在“想”。虽然我知道它只是内部多转了几圈——但这不重要,重要的是,它做到了。

闭源还剩一个优势:省事。不用部署,不用调优,直接调API。但如果你有自己的场景和数据,开源的可定制性,反而成为更大的胜势。


五、推理模型:从“教它怎么想”到“它自己会想”

2022年Google提出Chain-of-Thought,当时大家只把它当成一种提示技巧——在问题后面加一句“请逐步思考”。但很脆弱,换个说法就失效。

2024年9月,OpenAI发布o1,直接把CoT嵌入模型内部。它在生成答案前会进行一段长长的内部思考。我用了之后最大的感受是:以前写prompt是在教模型怎么想,现在只需要告诉它要什么,它自己会想。

2025年初DeepSeek-R1把这个能力开源并优化。我马上在本地搭了一个,测企业合同审查。过去用GPT-4审查,经常漏掉附录里的条款变更;R1呢,它会先列出所有风险点,再一一比对原文,最后生成报告。它学的是人的工作方法,不是文字接龙。

这个变化的意义巨大:模型的“智能感”从模仿式回答,转向了结构化推理。不是从冰箱里拿菜,而是打开冰箱、检查保质期、再决定做什么。每一步都是概率,但整体流程接近人。你还能说它只是“统计模型”吗?


结尾:别追名词,追问题

说了这么多,我不是想让你记住那些术语。忘了也没关系,几条主线就够了。架构从串行到并行,骨架就这么定了;规模一开始被普遍怀疑,后来算力堆出了涌现,现在大家又在推推理计算;对齐让模型从半成品变成了好用的产品;开源直接拉低了门槛,应用遍地开花;而推理模型让能力从知识回顾进化为真正的思考过程。

下次你看到RAG、Agent、MoE、RLHF这些词,别慌。它们都是这些主线下的“工具”——为解决具体问题而生。你只需要问一句:它能解决我现在的什么实际问题?

我现在的习惯是:关注场景,不看榜单。用一个新模型之前,先在自己最头痛的三个测试case上跑一遍。好使?那就用。不好使?名字再潮也白搭。

大模型再快,技术再玄,也逃不过一个铁律:能解决问题的技术,才是好技术。 最后一句话,你截图留着:

**真正厉害的AI,不是让你记住它能做什么,而是让你忘了技术本身。**
145
3640 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 09:39

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

张工 昨天
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 4天前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)