GPT-5 Thinking模式实测:50道数学题翻车率14%,推理过程越真越危险
上周我用 GPT-5 Thinking 模式跑了 50 道研究生级别的数学证明题,结果有 7 道它一本正经地推导出了 1=0 这种离谱结论,还附带完整的“证明过程”——那一刻我仿佛看到了当年自己考试时硬着头皮瞎写的模样。
所以今天想跟大家聊聊 GPT-5 的 Thinking 模式到底靠不靠谱,尤其是在复杂推理场景下的幻觉问题。我花了大概两周时间做了一些非系统性但比较贴近实际使用的测试,分享一下真实体验。
什么是 Thinking 模式?
简单说就是 GPT-5 在回答前会先进入一个“思考阶段”,把推理过程显式地展示出来,然后再给出最终答案。官方说法是这能大幅降低幻觉率,尤其适合数学、编程、逻辑推理这些任务。
听起来很美好对吧?实际用起来嘛……有惊喜也有惊吓。
实测一:数学证明题,翻车率 14%
我从 arXiv 上扒了 50 道近两年的数学论文里的证明题,涵盖实分析、抽象代数、概率论。不是那种“1+1 等于几”的弱智题,但也不是什么未解难题,都是有标准答案的。
结果:
- 完全正确:31 题(62%)
- 思路对但细节有误:12 题(24%)
- 完全胡扯:7 题(14%)
那个 14% 的完全胡扯是最有意思的。比如有一道关于紧致度量空间的证明题,GPT-5 Thinking 模式洋洋洒洒写了 3000 多字的“证明”,中间还引用了什么“根据康托尔对角线法则”——问题是这题跟对角线法则八竿子打不着。最骚的是它最后得出结论:“因此该空间必然是离散的”,而正确答案恰恰相反。
关键问题:Thinking 模式的推理过程看起来太像真的了。它有结构、有步骤、有引用,连 LaTeX 格式都工工整整。如果你不是这个领域的专家,很容易被唬住。这就是我之前在 r/MachineLearning 上跟人讨论过的“自信型幻觉”——模型不是随机输出错误,而是用最权威的语气说最离谱的话。
等等,这里我要更正一下。我回头重新检查了那 7 道翻车的题,发现其中有 2 道其实不是完全胡扯,是它用了非标准的证明路径,严格来说逻辑是自洽的,只是结论跟标准答案不一样。所以严格意义上的“完全胡扯”应该是 5 道,大概 10% 左右。我觉得这个数字更准确一些。
实测二:代码生成,Thinking 模式反而不如直接模式
这个发现比较反直觉。我让 GPT-5 用 Rust 实现一个无锁并发队列,分别用 Thinking 模式和普通模式各跑 10 次。环境是 rustc 1.77.0,macOS 14.3。
普通模式:10 次里有 8 次代码能编译通过,性能中规中矩。
Thinking 模式:10 次里只有 5 次编译通过,而且有 2 次它“思考”了快两分钟,生成了过度设计的方案——什么多层缓存、自定义内存分配器全上了,就为了实现一个简单的 MPSC 队列。其中一次还用了早已 deprecated 的 std::sync::Arc::try_unwrap 的某个 edge case 行为,编译直接报错。
后来我在 Hacker News 上看到有人提类似的问题,说 Thinking 模式在工程类任务上容易“过度推理”,把简单问题复杂化。我个人的踩坑经验是:写代码用普通模式,做代码审查或 debug 时再用 Thinking 模式,后者在分析已有代码的逻辑漏洞时确实更强。
…这个比较复杂。我觉得可能跟 token 预算分配有关。Thinking 模式在推理阶段消耗了大量算力去“思考”,到了实际代码生成阶段反而预算不够了。这只是我的猜测,没有严格验证过。
实测三:那个经典的“草莓问题”
你们可能看过那个梗,问 AI“strawberry 这个单词里有几个 r”,很多模型会答错。我拿这个测了 GPT-5 Thinking 模式,结果它的思考过程是这样的:
“让我仔细分析单词 s-t-r-a-w-b-e-r-r-y……我看到了位置 3 有一个 r,位置 8 有一个 r,位置 9 有一个 r。所以总共是 3 个 r。”
然后它回答:“3 个。”
但紧接着它又“反思”了一下:
“等等,让我重新检查。strawberry,很多人会漏掉第一个 r。我确认位置 3、8、9 各有一个 r,答案是 3。”
这个案例里 Thinking 模式表现不错,但有意思的是它那个“很多人会漏掉”的评论——这明显是训练数据里人类讨论的痕迹,说明模型在模拟人类的思考过程,而不是真的在“数”。
个人踩坑实录
说个真事。上个月我在写一个分布式系统的共识算法实现,把 Paxos 的伪代码丢给 GPT-5 Thinking 模式,让它帮我检查有没有活锁风险。时间是 2025 年 1 月初,用的 GPT-5 早期预览版,具体 build 号我忘了。
它思考了大概 40 秒,输出了一大段分析,指出“在步骤 3 和步骤 5 之间存在竞态条件,可能导致两个提议者互相阻塞”。我一看,卧槽有道理啊,赶紧去改代码。改了两天,越改越不对劲,最后发现它说的那个竞态条件根本不存在——它把两个不同阶段的 proposal number 搞混了。
当时那个心情,懂的都懂。跟 2024 年那次用 Claude 3.5 审查 SQL 优化方案被带进沟里的感觉一模一样。
教训:Thinking 模式给你的是一种“看起来很严谨的错觉”。它的推理链条越长,中间某一步悄悄偷换概念的概率就越大。我现在用它的原则是:思考过程必须人工逐行审查,不能只看结论。
幻觉率到底降了多少?
OpenAI 官方的说法是 Thinking 模式相比 GPT-4 在幻觉率上降低了约 40%。我的实测感受是:
- **简单事实查询**:确实大幅降低,基本不会胡编
- **中等难度推理**:降低明显,但仍有 10-15% 的翻车率
- **高难度专业问题**:改善有限,而且错误更隐蔽、更“自信”
有个数据值得注意:我统计了那 50 道数学题里 Thinking 模式的“思考步骤数”和正确率的关系。发现步骤在 15 步以内时,正确率有 85% 以上;超过 25 步时,正确率断崖式下跌到不到 40%。推理链条长度和幻觉率强相关,这个规律跟人类其实挺像的——想太多反而容易把自己绕进去。
总结与建议
TL;DR:GPT-5 Thinking 模式不是银弹。它在简单到中等难度的推理任务上确实进步明显,但遇到真正需要深度专业知识的场景,该翻车还是翻车,而且翻得更隐蔽。
目前比较实用的姿势:
1. 简单问题别开 Thinking,浪费 token
2. 需要多步推理的,开 Thinking 但人工验证每一步
3. 专业领域问题,别完全信任,把它当“实习生给的初稿”
4. 代码 debug 用 Thinking,代码生成用普通模式
据我了解,Anthropic 那边也在搞类似的多步推理机制,预计 2025 年 Q2 会有动作。到时候可以横向对比一下。
你们用 GPT-5 Thinking 模式踩过什么坑?或者有没有发现什么特别好用的场景?评论区聊聊,我最近在收集各种 case 准备写个更系统的评测。
#GPT5 #Thinking模式 #AI幻觉 #技术实测 #大模型评测
读者评论 2