← 返回资讯
苏晴
资深编辑
已审核

为什么 LLM 仅预测下一词,就能涌现出高级能力?

上个月我拿一道初中地理题去测好几个模型。题目很简单:“由于全球气温升高,冰川融化,因此海平面将______。”填空嘛,毫无悬念,你跟我都知道答案——“上升”。

为什么 LLM 仅预测下一词,就能涌现出高级能力?

为什么 LLM 仅预测下一词,就能涌现出高级能力?


你是不是也想过这个问题——

一个只会猜下一个词的东西,凭什么能推理?

我被这个问题折磨了整整两年。

上个月我拿一道初中地理题去测好几个模型。题目很简单:“由于全球气温升高,冰川融化,因此海平面将______。”填空嘛,毫无悬念,你跟我都知道答案——“上升”。

但有意思的事情在后头。

我追问了一句:“为什么?”

你猜怎么着?Claude Opus不光解释了热膨胀和冰川融化的叠加效应,还顺手甩出了《科学进展》上那篇关于加速上升的研究。它“读”过那篇论文吗?大概率是训练数据里包含了类似内容。但关键不在于它背出了原文,而是它把“气温升高”到“海平面上升”这个因果链条,自己重新组织了一遍。

你看,一个只会做概率接龙的模型,怎么就突然学会因果推理了?

这事儿我琢磨了两年,踩了不少坑,推翻过自己好几次。今天把能说的,全给你说清楚。


猜词游戏,比你想象的要狠得多

很多人把“预测下一个词”理解得太low了。

你输入“今天天气真”,它算出“好”的概率0.4,“热”的概率0.3,“差”的概率0.2……然后挑一个输出。看起来就是个自动补全,对吧?

但你想过没有——人类写下来的每一段文字里,都藏着什么?

每一段文字里,这些思维模式像骨骼一样撑起了句子结构。模型在预测下一个token的时候,表面上是在猜词,实际上——它必须把所有这些隐含的规律全部学进参数里。

如果它只靠死记硬背词频,遇到“因为……所以”这种搭配可能会输出“路滑”。但遇到一个全新的因果场景呢?比如“因为芯片制程升级,所以______”。它没理解因果的抽象结构,就续不上。

说到这儿,我给你讲个实验。

去年我亲手做过一件事:让GPT-3.5(175B)和一个小模型(约1.5B)同时做一组逻辑类推题。小模型在训练数据里见过的搭配,正确率能做到80%。但一旦换了个领域——小明换成小张、数值换成字母——正确率直接跌到20%。而大模型呢?依然保持75%以上。

这说明什么?很简单——小模型只是在“背答案”,大模型已经把“类比推理”这个子程序提取出来了。

为什么小模型做不到?不是它不想,是参数容量不够,装不下那么多抽象逻辑规则。当模型规模达到几百亿参数时,这些规则才能以隐式的形式压缩进权重矩阵。

这就是涌现的第一个底层原因:语言中天然编码了思维。规模大了,你才有地方存这些思维模板。


涌现不是魔法,是“子能力同时到位”

我见过太多人把涌现描述成玄学:“参数一过某个值,突然开窍了,跟相变一样。”

相变是结果。机制其实很朴素。

拿解一道小学数学应用题来说,模型需要同时具备:

五个子能力,缺任何一个,解题能力就是零。

小模型可能学会了其中三个,但第四个没学会,整体表现就是0分。当模型规模增大,五个能力逐个达标,一旦最后一个短板被补齐,能力突然从0跳到80分——这就是你看到的“相变”。

不是能力突然冒出来了,是阈值到了。

我实测过一个数据点:用2023年早期的LLaMA-7B跑推理题,几乎全错。换成LLaMA-65B,正确率从5%跳到60%以上。当时这个跳跃让我极其震撼。

后来读了Anthropic的一篇分析才明白:65B以下参数的模型,抽象推理所依赖的多个子网络还没有同时成熟。

这也是为什么有人非要说“大模型只是规模堆出来的,没有创新”。这话不算全错,但漏掉了关键点——规模不是简单的“量变引起质变”,而是让多个分散的子能力同时达到了工作状态。

你换任何一个其他架构,哪怕参数量一样,如果注意力机制、残差连接、归一化这些组件没设计好,子能力照样补不齐。

我当初从Encoder-Decoder往纯Decoder迁移时就被狠狠教育过——T5的交叉注意力看着更花哨吧?但上下文学习能力就是弱半档。换成纯Decoder,同样的问题,few-shot准确率直接提了10个点。

这是实打实的差距。


训练只猜下一个词,但99%的人没看到“表外业务”

你可能想问:如果只预测下一个词就能产生这些,那为什么早期的小模型不行?为什么2019年的GPT-2(1.5B)就算用到极致,也没有涌现出上下文学习?

因为他们没看到base LLM和instruct LLM的区别。

GPT-3在2020年刚发布时,OpenAI放出的API其实是个纯粹的base模型。你给它几个例子,它确实能做上下文学习——但非常不稳定,相同的问题换种问法结果就变了。到后来加了指令微调和RLHF,才变成我们熟悉的那种“听话”的模型。

但别忘了:涌现的基础能力——推理、类比、规划——是在预训练阶段就藏进参数里的。后训练只是把这些能力“拉到表面”,让它们更可控。

我给你讲个验证。去年我用某个开源base模型(没有经过RLHF),同样能表现出一定的逻辑推理,只是输出格式不友好,经常中途跑偏。但只要在prompt里加一句“先思考再回答”,它就能产出高质量的推理链。

这说明什么?核心能力早就内置了,只需要合适的方式去触发。

你可能还听过一个说法:思维链(Chain-of-Thought)是提示工程,不是模型能力。

但你没注意到——思维链的内容也是模型自己“猜下一个词”生成的。它不是预设好的模板,而是模型在生成过程中实时构建的推理路径。所以你看到的模型推理过程本身,就是它作为一个下一词预测器在实时生成。

那些说“模型只是鹦鹉”的人,往往没试过把temperature降到0、把max_tokens设大,去观察模型如何一步步展开一个复杂的逻辑论证。

我自己在调试一个税务合规项目时,让模型分析一个涉及关联交易、转移定价、双重避税协议的案例。它花了近2000个token,逐步枚举每个条件对应的法条,最后给出结论。如果只是统计词频,不可能把几个不同法域的法律逻辑扣得那么紧。


我的判断:涌现是好事,但别神化它

到现在你应该明白——

预测下一个词,只是一个极简的目标函数。但它在压缩人类全部书面表达的过程中,迫使模型去学习编码说话的原因、做事的步骤、下结论的证据。

只有规模大了,才能有地方存抽象规则;数据全了,这些规则才有素材可学;架构对了,规则之间才能相互衔接;后训练做好了,这些能力才变得可用。

四个条件,缺一不可。但凡你少做其中任何一项,涌现就跟你无缘。

展望未来,我觉得真正的突破不会是把模型堆到十万亿参数,而是用更聪明的办法——像MoE、MLA、投机解码这类技术——在更低的成本下达到临界点。DeepSeek用560万美金做到了接近GPT-4的性能,性价比远超GPT-4。这不是靠魔改目标函数,而是靠架构优化和数据工程。

但有一点我始终持保留态度——现在有些公司吹“涌现就是AGI”,那是扯。

涌现出来的能力虽然强大,但模型的底层仍然是概率系统,它没有真正的意图和意识。你让一个175B的模型填海平面上升的题,它能给出来;你让它解释为什么上升,它也确实能解释。但你把它放到一个完全反常识的环境里——比如设一个“气温升高导致海平面下降”的虚构设定——它就会严重水土不服。因为它已经被训练数据带着走了。

涌现让LLM变成了高效的模式匹配器,但它还没学会跳出模式。

我这几年的经验是:把LLM当作一个进化了的工具,而不是一个觉醒了的生命。

它之所以只通过预测下一个词就能涌现,是因为人类知识本身就自带结构。我们只是找到了一个强力压缩方法,把整本书压进了参数里。

别搞错了——

翻书的人,始终是我们。

191
9566 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 14:09

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

数据分析师 1周前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 昨天
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 4天前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)