GPT-5 Mini全面碾压Sonnet4.5:大模型编程能力10月榜,新测试方法揭真相
大语言模型编程能力测评:25年10月榜,我换了一套测试方法
上周五晚上,我在咖啡馆写代码,旁边一个穿格子衫的小哥对着屏幕抓狂——报错信息刷屏,他一脸“我要砸电脑”的表情。我凑过去看了一眼,笑着说:“你试试把这个报错扔给AI,让它自己改。”他半信半疑,复制粘贴进去,你猜怎么着?三分钟后,代码跑通了。他瞪大眼睛:“这玩意儿还能这样用?”
你看,很多人还在把AI当一次性键盘侠——扔个需求,等它吐出代码,然后自己吭哧吭哧改bug。但真正的用法,是让它自己修自己!这就是我这次改测试方法的灵感来源。
为什么要改测试方法?
我从15年开始写技术专栏,测评大模型编程这事儿,从去年GPT-4时代就在搞。每个月更新一次,到现在整整十期了。但说实话,之前的测试方法我一直觉得不对劲。
以前我是这么测的:让模型一次性输出代码,然后我手动修掉明显的语法错误——比如Python少个冒号、Golang变量声明了没使用。修完再跑测试。
问题在哪?你想想,实际开发中谁会这么用AI?IDE里直接贴代码,lint一跑、run一下,报错信息立马出来。模型完全可以在多轮对话里自己改啊!你又不是AI的保姆,凭什么帮它擦屁股?
所以这个月我换了玩法:第一轮代码如果有语法错误或运行时异常,我不动手,直接把报错信息扔回去,让模型自己修。 每轮修复后重新评分,直到跑通或者模型彻底摆烂。
这样测出来的,才是真实场景下你能用到的水平。换句话说——你当甩手掌柜,让AI当修理工。
测试配置
- 测试时间:2025年10月5日-7日(三天,熬夜肝出来的)
- 语言:TypeScript、Java、Golang、Python、C#(各6题,共30题)
- 模型:GPT-5 Mini、Sonnet4.5、Gemini 2.5 Pro/Flash、DeepSeek V3.2(推理/非推理)
- 上下文窗口:统一32K,输出8K
- 评分标准:3轮内通过所有测试用例得满分,每轮扣分
结果总览:谁是真·王者?
先上结论。GPT-5 Mini全面领先,Sonnet4.5紧随其后,Gemini系列和DeepSeek V3.2各有硬伤。 但最让我惊讶的不是分数,而是——有些模型越改越烂,有些模型越改越稳。 你猜哪种更可怕?
具体数据我放个表格(别跳过,后面有故事):
| 模型 | 综合得分 | 首轮通过率 | 平均轮数 | 修复稳定性 | 重构表现 |
|---|---|---|---|---|---|
| GPT-5 Mini | 96.5 | 60% | 1.4 | 稳定提升 | 偏保守 |
| Sonnet4.5(非推理) | 93.2 | 43% | 1.8 | 稳定 | 优秀 |
| Gemini 2.5 Pro | 88.1 | 37% | 2.1 | 不稳定(3题倒退) | 首轮必翻车 |
| DeepSeek V3.2(非推理) | 85.4 | 33% | 2.3 | 不稳定 | 幻觉严重 |
看到没?首轮通过率最高的不是GPT-5 Mini吗?No! 你以为是60%已经很高了?但Sonnet4.5首轮只有43%,最终得分却只差3分。为什么?因为Sonnet修bug的能力太强了——它就像个经验丰富的老医生,第一次诊断可能不准,但第二次就能对症下药。
各模型表现拆解:谁在摸鱼,谁在拼命?
GPT-5 Mini:稳得不像话
30道题里,只有12道进了第二轮,3道进了第三轮。而且每次修改,分数都是往上走的,没出现过“改出更烂的代码”这种智障行为。这就像一个老司机,从不超车,但永远不会翻车。
但有个槽点:重构类问题太保守。 第16题是个500行的Java类,要求重构。GPT-5 Mini基本就是局部改改,不敢动结构。最后输出300行,虽然能跑,但跟“重构”这个词的预期差距挺大——它更像是在“微调”,而不是“重写”。
说白了,它像个老司机——安全第一,绝不超车。但你如果让它开赛道,它只会踩刹车。
Sonnet4.5:效率之王
Sonnet让我最惊艳的不是分数,是速度。非推理模式下平均30秒出结果,在测试的模型里排第三低。你想想,一个代码助手如果每次要等两分钟,谁受得了?等你喝完咖啡它还没跑完,咖啡都凉了。
但Sonnet有个问题:首轮容易翻车。 复杂问题上,第一轮通过率只有43%,经常要跑到第三轮才能满分。不过重构和代码迁移类任务,它基本一遍过,而且思路比GPT-5 Mini激进——会主动找更好的架构。就像一个年轻的设计师,第一次方案可能跑偏,但第二次就能给你惊喜。
非推理版有一个题最终代码不可编译,但我觉得再给一轮大概率能修好。它只是差那么一点点运气。
Gemini 2.5 Pro/Flash:成绩还行,体验拉胯
Gemini系列最终得分不算低,但问题一堆。就像班里那个考试能考85分,但作业总是抄错行的同学。
最烦人的是多轮不稳定。Pro和Flash各有3个题,改到第三轮得分反而比第一轮低。Pro有4个题改来改去原地打转,Flash更离谱,7个题都这样。你想想,你让它修bug,结果它把没bug的地方改出bug,还越改越烂——这不就是传说中的“修电脑综合征”吗?
重构类问题更是灾难。Pro和Flash第一轮必犯错——改坏原逻辑、引入低级语法错误。一般要2-3轮才能救回来。就像你让一个实习生重构代码,他第一天就把数据库表删了。
Flash的非推理版在Golang上反复犯语法错误,我都怀疑它是不是跟Golang有仇。连续三次报同样的错,我差点以为它在故意气我。
DeepSeek V3.2:推理版反而更糟
V3.2同样是“越改越差”的重灾区。推理版更夸张,有时候想太多,错误更多,得分提升还不如非推理版。就像一个学霸考试时想得太复杂,反而把简单题算错了。
但在复杂问题上,推理版的初见得分确实更高——毕竟有深度思考的优势。然而一旦涉及细节场景,比如重构,V3.2的上下文幻觉就开始作妖。越推理错得越多,用的轮数比基础版还多。第16题的Java重构,前两轮稳定拿分,第三轮直接0分。你敢信?它像是跟自己过不去,非要把自己绕晕。
不过说句公道话,V3.2在国产模型里算均衡的,除了C++偏弱,其他语言没有明显偏科。但如果你指望它修bug,建议你备好速效救心丸。
我的使用建议:选对模型,少掉头发
如果你在选模型做日常开发,我的建议是:
1. 核心模块、复杂重构:优先GPT-5 Mini。虽然保守,但稳定。重构类任务可以考虑Sonnet4.5,思路更开阔。保守不出错,激进出惊喜。
2. 快速迭代、批量修改:Sonnet4.5非推理版。30秒出结果,效率无敌。时间就是生命,Sonnet帮你续命。
3. 日常开发、平衡质量与效率:Mimo v2.5 Pro(这次没测,但之前的数据显示它很均衡)。就像白米饭,没什么惊艳,但永远不会饿着你。
4. 高自主探索、长上下文理解:GLM-5.2。它愿意充分探索上下文,但Token消耗高,预算敏感的话要谨慎。它是个探险家,但你需要准备好干粮。
5. Gemini系列和DeepSeek V3.2:除非你愿意接受“可能越改越差”的风险,否则不太推荐。赌博有风险,修Bug需谨慎。
这次测试的局限性:别把榜单当圣经
说实话,这次测试虽然改了方法,但依然有局限:
- 分数来自模型自测自评,没有外部裁判复核——**有点像自己给自己打分,难免有水分。**
- 只测了30道题,样本量不算大——**你见过谁用30道题判断一个程序员水平的?**
- 没有覆盖所有语言和框架——**C++、Rust、Go微服务?下次再说。**
- 没有做人工代码审查——**AI写的代码,你敢直接上生产?**
如果要搞严格榜单,还得加上:统一外部裁判、多轮重复测试、更大规模项目、不同语言和框架场景、人工代码审查和真实运行验收。
但作为一个写了十年专栏的老家伙,我觉得这个测试已经能反映真实使用场景了。毕竟,你用AI写代码的时候,不就是这么干的吗?——扔个需求,报错扔回去,修好上线,一气呵成。
最后,送你一句话
AI写代码不是终点,AI会修bug才是真正的生产力。 别把大模型当打字机,把它当你的结对编程伙伴——它犯错,你纠错,它改错,你们一起成长。
下次写代码卡住的时候,试试把报错扔给它,然后喝口咖啡。你猜怎么着?咖啡还没凉,代码已经跑通了。
读者评论 2