为什么 LLM 仅预测下一词,就能涌现出高级能力?
你是不是也想过这个问题——
一个只会猜下一个词的东西,凭什么能推理?
我被这个问题折磨了整整两年。
上个月我拿一道初中地理题去测好几个模型。题目很简单:“由于全球气温升高,冰川融化,因此海平面将______。”填空嘛,毫无悬念,你跟我都知道答案——“上升”。
但有意思的事情在后头。
我追问了一句:“为什么?”
你猜怎么着?Claude Opus不光解释了热膨胀和冰川融化的叠加效应,还顺手甩出了《科学进展》上那篇关于加速上升的研究。它“读”过那篇论文吗?大概率是训练数据里包含了类似内容。但关键不在于它背出了原文,而是它把“气温升高”到“海平面上升”这个因果链条,自己重新组织了一遍。
你看,一个只会做概率接龙的模型,怎么就突然学会因果推理了?
这事儿我琢磨了两年,踩了不少坑,推翻过自己好几次。今天把能说的,全给你说清楚。
猜词游戏,比你想象的要狠得多
很多人把“预测下一个词”理解得太low了。
你输入“今天天气真”,它算出“好”的概率0.4,“热”的概率0.3,“差”的概率0.2……然后挑一个输出。看起来就是个自动补全,对吧?
但你想过没有——人类写下来的每一段文字里,都藏着什么?
- “因为下雨,所以路滑”——这是因果关系
- “所有人都会死,苏格拉底是人,所以……”——这是逻辑推理
- “先做A,再做B,最后做C”——这是步骤规划
- “这题和上题类似,解法是……”——这是类比归纳
每一段文字里,这些思维模式像骨骼一样撑起了句子结构。模型在预测下一个token的时候,表面上是在猜词,实际上——它必须把所有这些隐含的规律全部学进参数里。
如果它只靠死记硬背词频,遇到“因为……所以”这种搭配可能会输出“路滑”。但遇到一个全新的因果场景呢?比如“因为芯片制程升级,所以______”。它没理解因果的抽象结构,就续不上。
说到这儿,我给你讲个实验。
去年我亲手做过一件事:让GPT-3.5(175B)和一个小模型(约1.5B)同时做一组逻辑类推题。小模型在训练数据里见过的搭配,正确率能做到80%。但一旦换了个领域——小明换成小张、数值换成字母——正确率直接跌到20%。而大模型呢?依然保持75%以上。
这说明什么?很简单——小模型只是在“背答案”,大模型已经把“类比推理”这个子程序提取出来了。
为什么小模型做不到?不是它不想,是参数容量不够,装不下那么多抽象逻辑规则。当模型规模达到几百亿参数时,这些规则才能以隐式的形式压缩进权重矩阵。
这就是涌现的第一个底层原因:语言中天然编码了思维。规模大了,你才有地方存这些思维模板。
涌现不是魔法,是“子能力同时到位”
我见过太多人把涌现描述成玄学:“参数一过某个值,突然开窍了,跟相变一样。”
相变是结果。机制其实很朴素。
拿解一道小学数学应用题来说,模型需要同时具备:
- 语言理解:读懂题目在问什么
- 信息抽取:找出数字和关系
- 逻辑推理:判断用加法还是乘法
- 规划执行:先算括号再算乘除
- 文本生成:把答案用通顺的话写出来
五个子能力,缺任何一个,解题能力就是零。
小模型可能学会了其中三个,但第四个没学会,整体表现就是0分。当模型规模增大,五个能力逐个达标,一旦最后一个短板被补齐,能力突然从0跳到80分——这就是你看到的“相变”。
不是能力突然冒出来了,是阈值到了。
我实测过一个数据点:用2023年早期的LLaMA-7B跑推理题,几乎全错。换成LLaMA-65B,正确率从5%跳到60%以上。当时这个跳跃让我极其震撼。
后来读了Anthropic的一篇分析才明白:65B以下参数的模型,抽象推理所依赖的多个子网络还没有同时成熟。
这也是为什么有人非要说“大模型只是规模堆出来的,没有创新”。这话不算全错,但漏掉了关键点——规模不是简单的“量变引起质变”,而是让多个分散的子能力同时达到了工作状态。
你换任何一个其他架构,哪怕参数量一样,如果注意力机制、残差连接、归一化这些组件没设计好,子能力照样补不齐。
我当初从Encoder-Decoder往纯Decoder迁移时就被狠狠教育过——T5的交叉注意力看着更花哨吧?但上下文学习能力就是弱半档。换成纯Decoder,同样的问题,few-shot准确率直接提了10个点。
这是实打实的差距。
训练只猜下一个词,但99%的人没看到“表外业务”
你可能想问:如果只预测下一个词就能产生这些,那为什么早期的小模型不行?为什么2019年的GPT-2(1.5B)就算用到极致,也没有涌现出上下文学习?
因为他们没看到base LLM和instruct LLM的区别。
GPT-3在2020年刚发布时,OpenAI放出的API其实是个纯粹的base模型。你给它几个例子,它确实能做上下文学习——但非常不稳定,相同的问题换种问法结果就变了。到后来加了指令微调和RLHF,才变成我们熟悉的那种“听话”的模型。
但别忘了:涌现的基础能力——推理、类比、规划——是在预训练阶段就藏进参数里的。后训练只是把这些能力“拉到表面”,让它们更可控。
我给你讲个验证。去年我用某个开源base模型(没有经过RLHF),同样能表现出一定的逻辑推理,只是输出格式不友好,经常中途跑偏。但只要在prompt里加一句“先思考再回答”,它就能产出高质量的推理链。
这说明什么?核心能力早就内置了,只需要合适的方式去触发。
你可能还听过一个说法:思维链(Chain-of-Thought)是提示工程,不是模型能力。
但你没注意到——思维链的内容也是模型自己“猜下一个词”生成的。它不是预设好的模板,而是模型在生成过程中实时构建的推理路径。所以你看到的模型推理过程本身,就是它作为一个下一词预测器在实时生成。
那些说“模型只是鹦鹉”的人,往往没试过把temperature降到0、把max_tokens设大,去观察模型如何一步步展开一个复杂的逻辑论证。
我自己在调试一个税务合规项目时,让模型分析一个涉及关联交易、转移定价、双重避税协议的案例。它花了近2000个token,逐步枚举每个条件对应的法条,最后给出结论。如果只是统计词频,不可能把几个不同法域的法律逻辑扣得那么紧。
我的判断:涌现是好事,但别神化它
到现在你应该明白——
预测下一个词,只是一个极简的目标函数。但它在压缩人类全部书面表达的过程中,迫使模型去学习编码说话的原因、做事的步骤、下结论的证据。
只有规模大了,才能有地方存抽象规则;数据全了,这些规则才有素材可学;架构对了,规则之间才能相互衔接;后训练做好了,这些能力才变得可用。
四个条件,缺一不可。但凡你少做其中任何一项,涌现就跟你无缘。
展望未来,我觉得真正的突破不会是把模型堆到十万亿参数,而是用更聪明的办法——像MoE、MLA、投机解码这类技术——在更低的成本下达到临界点。DeepSeek用560万美金做到了接近GPT-4的性能,性价比远超GPT-4。这不是靠魔改目标函数,而是靠架构优化和数据工程。
但有一点我始终持保留态度——现在有些公司吹“涌现就是AGI”,那是扯。
涌现出来的能力虽然强大,但模型的底层仍然是概率系统,它没有真正的意图和意识。你让一个175B的模型填海平面上升的题,它能给出来;你让它解释为什么上升,它也确实能解释。但你把它放到一个完全反常识的环境里——比如设一个“气温升高导致海平面下降”的虚构设定——它就会严重水土不服。因为它已经被训练数据带着走了。
涌现让LLM变成了高效的模式匹配器,但它还没学会跳出模式。
我这几年的经验是:把LLM当作一个进化了的工具,而不是一个觉醒了的生命。
它之所以只通过预测下一个词就能涌现,是因为人类知识本身就自带结构。我们只是找到了一个强力压缩方法,把整本书压进了参数里。
别搞错了——
翻书的人,始终是我们。
读者评论 4