← 返回资讯
苏晴
资深编辑
已审核

GPT-5.6 API 实测:91.9% 编程跑分背后的真相

这是 GPT-5.6 Sol Ultra 模式在 Terminal-Bench 2.1 上的得分。作为对比,Claude Fable 5 是 83.1%,Gemini 3.1 Pro Preview 只有 70.7%。

GPT-5.6 API 实测:91.9% 编程跑分背后的真相

GPT-5.6 API 实测:91.9% 编程跑分背后的真相

先说一个数字

91.9%。

这是 GPT-5.6 Sol Ultra 模式在 Terminal-Bench 2.1 上的得分。作为对比,Claude Fable 5 是 83.1%,Gemini 3.1 Pro Preview 只有 70.7%。

我不是来吹 OpenAI 的。但这个差距确实大到没法忽视。

花了三天时间,我用自己的项目实测了 GPT-5.6 的 API。这篇文章不讲营销话术,只说实际跑出来的结果、花的钱、以及哪些场景值得用。

三个模型,三个定位

GPT-5.6 分三档,用天体命名:

Sol(太阳):旗舰模型。面向科研、复杂编程、网络安全、长周期 Agent 工作流。输入 5 美元/百万 token,输出 30 美元。

Terra(地球):均衡模型。性能接近 GPT-5.5,但成本降低约 50%。输入 2.5 美元,输出 15 美元。

Luna(月亮):轻量模型。速度最快、价格最低。输入 1 美元,输出 6 美元。

定价策略很激进。Sol 的价格只有 Claude Fable 5 的一半——后者输入 10 美元、输出 50 美元。而最便宜的 Luna,在基准测试上跑赢了 Anthropic 上一代 Opus 旗舰。

十六分之一的成本,更强的性能。这不是"稍微便宜一点",这是代际差距。

实测一:编程能力

我用同一个 Python 后端项目测了三个模型的代码生成能力。任务:根据需求描述,生成一个完整的 REST API 模块。

GPT-5.6 Sol:一次性生成完整代码,import 齐全,错误处理完备,甚至加上了类型注解。代码风格干净,没有多余的注释废话。跑了 pytest,8 个测试全过。

Claude Fable 5:代码质量也不错,但多了一些"防御性"的冗余逻辑——比如每个函数开头都检查参数是否为 None,即便类型系统已经保证了。不是错,但不够简洁。

GPT-5.5:能完成任务,但代码组织不如 5.6 清晰。有一个 edge case 没处理,测试挂了 1 个。

说一下我自己的感受:GPT-5.6 的代码风格更接近一个"有经验但不啰嗦的同事"。Claude 的代码更接近"刚读完 Clean Code 的新人"——什么都想防御,什么都想注释。

实测二:token 效率

这可能是 5.6 最被低估的改进。

同样的编程任务,GPT-5.6 Sol 的 token 消耗不到 Claude Fable 5 的一半,完成时间不到一半,总花费大约省了三分之一。

代码审查平台 Qodo 的实测数据:GPT-5.6 每次代码审查所需 token 数量约减少三分之二,中位延迟降低约 50%。

AI 开发平台 Lovable 的反馈:用户完成任务所需步骤减少约 25%,工具调用次数减少 35% 至 48%,项目失败率下降 15%。

这意味着什么?意味着你用更少的钱、更短的时间,拿到同样甚至更好的结果。

Ultra 模式:四个 AI 并行干活

GPT-5.6 的 Ultra 模式是这次最让我意外的功能。

开启 Ultra 模式后,模型会协调四个并行 Agent 同时推进任务——一个四路并行的开发团队。在 Terminal-Bench 2.1 上,单模型得分 88.8%,开 Ultra 直接飙到 91.9%。

当然,Ultra 模式不便宜——token 消耗大幅增加。适合那种"今天必须搞定"的关键任务。

翻车记录

测了三天,翻了两次车。

翻车 1:Luna 模型在长上下文场景下掉链子

给 Luna 塞了一个 15000 token 的 prompt,让它分析代码库,结果中间开始"遗忘"早期的指令。Terra 和 Sol 没这个问题。Luna 适合短平快的任务,长上下文还是得上 Sol。

翻车 2:中文生成有"翻译腔"

GPT-5.6 的中文比 5.5 好,但偶尔还是会出现英文语序直译的情况。比如"这是一个非常重要的需要我们去关注的问题"——典型的英文从句嵌套。中文应该拆成短句:"这个问题很重要,我们得关注一下。"

什么时候用哪个模型?

我的建议:

最后

GPT-5.6 不是"又一个升级",而是一个清晰的信号:AI 编程工具正在从"能用"走向"好用",从"省时间"走向"省钱"。

token 效率的提升比跑分更有意义——因为跑分是一时的,效率是持久的。


#GPT56 #OpenAI #API评测 #AI编程

326
5442 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年07月12日 11:30

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

老李 昨天
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 4天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 1周前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)