← 返回资讯
陈默
AI 行业分析师
已审核

GPT-5 Thinking模式实测:50道数学题翻车率14%,推理过程越真越危险

上周我用 GPT-5 Thinking 模式跑了 50 道研究生级别的数学证明题,结果有 7 道它一本正经地推导出了 1=0 这种离谱结论,还附带完整的“证明过程”——那一刻我仿佛看到了当年自己考试时硬着头皮瞎写的模样。

GPT-5 Thinking模式实测:50道数学题翻车率14%,推理过程越真越危险

GPT-5 Thinking模式实测:50道数学题翻车率14%,推理过程越真越危险


上周我用 GPT-5 Thinking 模式跑了 50 道研究生级别的数学证明题,结果有 7 道它一本正经地推导出了 1=0 这种离谱结论,还附带完整的“证明过程”——那一刻我仿佛看到了当年自己考试时硬着头皮瞎写的模样。

所以今天想跟大家聊聊 GPT-5 的 Thinking 模式到底靠不靠谱,尤其是在复杂推理场景下的幻觉问题。我花了大概两周时间做了一些非系统性但比较贴近实际使用的测试,分享一下真实体验。


什么是 Thinking 模式?

简单说就是 GPT-5 在回答前会先进入一个“思考阶段”,把推理过程显式地展示出来,然后再给出最终答案。官方说法是这能大幅降低幻觉率,尤其适合数学、编程、逻辑推理这些任务。

听起来很美好对吧?实际用起来嘛……有惊喜也有惊吓。

实测一:数学证明题,翻车率 14%

我从 arXiv 上扒了 50 道近两年的数学论文里的证明题,涵盖实分析、抽象代数、概率论。不是那种“1+1 等于几”的弱智题,但也不是什么未解难题,都是有标准答案的。

结果:

那个 14% 的完全胡扯是最有意思的。比如有一道关于紧致度量空间的证明题,GPT-5 Thinking 模式洋洋洒洒写了 3000 多字的“证明”,中间还引用了什么“根据康托尔对角线法则”——问题是这题跟对角线法则八竿子打不着。最骚的是它最后得出结论:“因此该空间必然是离散的”,而正确答案恰恰相反。

关键问题:Thinking 模式的推理过程看起来太像真的了。它有结构、有步骤、有引用,连 LaTeX 格式都工工整整。如果你不是这个领域的专家,很容易被唬住。这就是我之前在 r/MachineLearning 上跟人讨论过的“自信型幻觉”——模型不是随机输出错误,而是用最权威的语气说最离谱的话。

等等,这里我要更正一下。我回头重新检查了那 7 道翻车的题,发现其中有 2 道其实不是完全胡扯,是它用了非标准的证明路径,严格来说逻辑是自洽的,只是结论跟标准答案不一样。所以严格意义上的“完全胡扯”应该是 5 道,大概 10% 左右。我觉得这个数字更准确一些。

实测二:代码生成,Thinking 模式反而不如直接模式

这个发现比较反直觉。我让 GPT-5 用 Rust 实现一个无锁并发队列,分别用 Thinking 模式和普通模式各跑 10 次。环境是 rustc 1.77.0,macOS 14.3。

普通模式:10 次里有 8 次代码能编译通过,性能中规中矩。

Thinking 模式:10 次里只有 5 次编译通过,而且有 2 次它“思考”了快两分钟,生成了过度设计的方案——什么多层缓存、自定义内存分配器全上了,就为了实现一个简单的 MPSC 队列。其中一次还用了早已 deprecated 的 std::sync::Arc::try_unwrap 的某个 edge case 行为,编译直接报错。

后来我在 Hacker News 上看到有人提类似的问题,说 Thinking 模式在工程类任务上容易“过度推理”,把简单问题复杂化。我个人的踩坑经验是:写代码用普通模式,做代码审查或 debug 时再用 Thinking 模式,后者在分析已有代码的逻辑漏洞时确实更强。

…这个比较复杂。我觉得可能跟 token 预算分配有关。Thinking 模式在推理阶段消耗了大量算力去“思考”,到了实际代码生成阶段反而预算不够了。这只是我的猜测,没有严格验证过。

实测三:那个经典的“草莓问题”

你们可能看过那个梗,问 AI“strawberry 这个单词里有几个 r”,很多模型会答错。我拿这个测了 GPT-5 Thinking 模式,结果它的思考过程是这样的:

“让我仔细分析单词 s-t-r-a-w-b-e-r-r-y……我看到了位置 3 有一个 r,位置 8 有一个 r,位置 9 有一个 r。所以总共是 3 个 r。”

然后它回答:“3 个。”

但紧接着它又“反思”了一下:

“等等,让我重新检查。strawberry,很多人会漏掉第一个 r。我确认位置 3、8、9 各有一个 r,答案是 3。”

这个案例里 Thinking 模式表现不错,但有意思的是它那个“很多人会漏掉”的评论——这明显是训练数据里人类讨论的痕迹,说明模型在模拟人类的思考过程,而不是真的在“数”。

个人踩坑实录

说个真事。上个月我在写一个分布式系统的共识算法实现,把 Paxos 的伪代码丢给 GPT-5 Thinking 模式,让它帮我检查有没有活锁风险。时间是 2025 年 1 月初,用的 GPT-5 早期预览版,具体 build 号我忘了。

它思考了大概 40 秒,输出了一大段分析,指出“在步骤 3 和步骤 5 之间存在竞态条件,可能导致两个提议者互相阻塞”。我一看,卧槽有道理啊,赶紧去改代码。改了两天,越改越不对劲,最后发现它说的那个竞态条件根本不存在——它把两个不同阶段的 proposal number 搞混了。

当时那个心情,懂的都懂。跟 2024 年那次用 Claude 3.5 审查 SQL 优化方案被带进沟里的感觉一模一样。

教训:Thinking 模式给你的是一种“看起来很严谨的错觉”。它的推理链条越长,中间某一步悄悄偷换概念的概率就越大。我现在用它的原则是:思考过程必须人工逐行审查,不能只看结论。

幻觉率到底降了多少?

OpenAI 官方的说法是 Thinking 模式相比 GPT-4 在幻觉率上降低了约 40%。我的实测感受是:

有个数据值得注意:我统计了那 50 道数学题里 Thinking 模式的“思考步骤数”和正确率的关系。发现步骤在 15 步以内时,正确率有 85% 以上;超过 25 步时,正确率断崖式下跌到不到 40%。推理链条长度和幻觉率强相关,这个规律跟人类其实挺像的——想太多反而容易把自己绕进去。

总结与建议

TL;DR:GPT-5 Thinking 模式不是银弹。它在简单到中等难度的推理任务上确实进步明显,但遇到真正需要深度专业知识的场景,该翻车还是翻车,而且翻得更隐蔽。

目前比较实用的姿势:

1. 简单问题别开 Thinking,浪费 token

2. 需要多步推理的,开 Thinking 但人工验证每一步

3. 专业领域问题,别完全信任,把它当“实习生给的初稿”

4. 代码 debug 用 Thinking,代码生成用普通模式

据我了解,Anthropic 那边也在搞类似的多步推理机制,预计 2025 年 Q2 会有动作。到时候可以横向对比一下。

你们用 GPT-5 Thinking 模式踩过什么坑?或者有没有发现什么特别好用的场景?评论区聊聊,我最近在收集各种 case 准备写个更系统的评测。


#GPT5 #Thinking模式 #AI幻觉 #技术实测 #大模型评测

277
13896 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月27日 19:28

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

数据分析师 3天前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 6天前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)