← 返回资讯
林远舟
技术编辑
已审核

GPT-5.5 token消耗降了40%,SWE-Bench却几乎原地踏步

从GPT-3就开始在API上跑活的老玩家。写过吐槽帖,搭过生产级Agent,每次大版本更新,都得亲手拆一遍才敢上线。这次GPT-5.5发布,OpenAI自称“迄今最大更新”,48天就端上新版本。我心里打了个结。

GPT-5.5 token消耗降了40%,SWE-Bench却几乎原地踏步

GPT-5.5 token消耗降了40%,SWE-Bench却几乎原地踏步


凌晨三点,我在屏幕前枯坐了三晚。

从GPT-3就开始在API上跑活的老玩家。写过吐槽帖,搭过生产级Agent,每次大版本更新,都得亲手拆一遍才敢上线。这次GPT-5.5发布,OpenAI自称“迄今最大更新”,48天就端上新版本。我心里打了个结。

三个晚上,我的心情从希望到惊叹,又变成骂娘,最后是沉默。


虚假的舒适圈:排名看着漂亮,细看让人发虚

官方发了九项对比表,我全重绘了。但这些基准测试啊,越来越像高考选考科目,谁选得巧谁分数高。

Artificial Analysis Intelligence Index(第三方加权):GPT-5.5第一,60分。总算打破三强并列,而且效率有明显改善——干同样的活,token消耗比5.4少了40%。这个OpenAI没吹牛。

接下来才是关键。

编程方面

看到SWE-Bench Pro那个数字我笑出声。OpenAI说自己不用SWE-bench Verified了,理由是训练数据污染和测试用例误判——于是摆出SWE-bench Pro。现在Pro上进步也不大,就又弄了个Expert-SWE来证明自己。

老套路:考不好就换试卷。

卷子越换越难,结果越换越暧昧。好比健身教练说“体脂秤不准,我们测体态”,然后给你看一堆看不太懂的姿势评分。

其他知识工作

我敢说:想让ChatGPT帮你点星巴克?接着失望吧。


实测见真章:有些惊喜,有些想骂人

编程:确实干得了了

我翻出两个历史项目:一个C语言小工具,一个E项目的Web应用。

GPT-5.5的总扣分只有5.4的三分之一。E项目几乎一遍过,只有一个一眼就能修的小错。

最意外的是——UI审美!

以前GPT写的前端页面,圆角歪、间距崩、颜色辣眼睛。这次它直出的SVG和交互动效,几乎不用调,跟Opus 4打平。你给的需求,它出品的视觉,直接拿给客户看都不会被骂。

但是—— 架构设计上,它不会像Opus那样自作主张给你大段重写。你想要的架构,还是得在prompt里说清楚。少了一分“我懂你”的默契,多了一分“你说了算”的规矩。

逻辑测试:直觉快了,下限依然不靠谱

我自己出了一套找规律和文本解析题(参考了网友的#41、#61、#62)。

中等难度,GPT-5.5只用了3000 token就想出答案,比5.4还少10%。Claude Opus用了8000,国产模型普遍2万以上,有的直接token耗尽开始穷举。

更难的#41混乱文本解析,它第一次拿到了满分。以前从来没通过,这次过了,我差点拍桌子。

然而—— 不稳定。跑十次,七次满分,三次崩盘。你还是不敢完全信任它。


钱的事:你以为省了?其实没

GPT-5.5 API定价:5美元/百万输入token,30美元/百万输出token。是5.4价格的两倍。

OpenAI说:别怕,token消耗少40%,总成本不升。

我连夜算了一笔账——

一个任务,5.4需要1000个输出token(成本0.015美元),5.5需要600个(成本0.018美元)。

实际还贵了20%。

省下来的token红利,变成了你的额外支出。就像健身房的年卡促销,算下来其实一次没便宜。

只有做高复杂度任务、5.5一遍过而5.4需要重试时,账才能拉平。

便宜和效率不可兼得,用户二选一。OpenAI把选择题扔给用户,自己两头都想要。

但有一点得承认——5.5的推理稳定性确实上来了。同一个复杂prompt跑多遍,输出之间的差异只有3.2%。以前5.4同一问题三次三个结果,得挑好的用。现在第一遍就是最好的,省了API调用次数,也省了血压。

这叫用钱的痛换心的稳。


降智?你未必知道

每次GPT升级都有人说变蠢。这次也不例外。我没遇到严重降智,但有些事得说明白:

5月6日上线GPT-5.5 Instant——回复长度缩短30%,emoji几乎消失。我在ChatGPT上试了,回复确实更紧凑,但个性也少了。

5月中旬——OpenAI官方页面记录GPT-5.5性能下降。他们说调查并解决了,但论坛上5月24-26日的降智投诉反而更多。

更早的2月——有人用trace命令发现Codex请求被静默降级到5.2。这已经不是第一次了。

你能接受吗?你买的是5.5,系统悄悄给你切成5.2。

我在API上测试时没觉得变蠢,但我用的是5.5(非Instant),且把thinking模式开到高档。默认设置或Instant版的体验可能完全不同。

这种“标签没换脑子换了”的操作,早晚会磨掉用户对品牌的信任。


安全:最严的一代,但也别妄想自由

GPT-5.5号称“迄今为止防护最严”。内部外部红队测试,网络安全和生物武器专项验证,结合近200个真实场景调整。

对企业用户或许是好事。对你我这样的普通开发者呢?

换来的就是更多拒绝回答,更多长流程被掐断。

我测试一个自动撰写市场报告的任务时,模型突然说:“我不能协助生成可能误导读者的内容。”

我写的只是产品介绍。

就像保镖连你进便利店买水都要搜身。安全是安全了,但你失去了“我自己能判断”的体面。


谁该用它,谁该继续等

推荐给你,如果你:

先别冲,如果你:

我的做法——可能听着挺精分:

主力API会切到5.5,但不是一次性全切。先把生产流量分出20%到5.5,跑一周看稳定性。

ChatGPT那边,保留Plus的GPT-5.5选项,但Instant我不用——那玩意儿明显缩水。

写文章这类创意工作,我还在Claude Opus和GPT-5.5之间交替用,看谁更听话。

就像老司机的修理厂里备了两台发动机:一台快但爱偷懒,一台稳但费油。哪个活用哪个,别跟机器赌气。


最后说一句

这模型确实强,但不是无脑强

OpenAI在宣传里强调“用更少的token干更难的活”。但没说的是——token省下来了,钱没省。

这种夹缝里的收益,暴露了现在AI厂商的定价策略:知道你离不开,所以按能力定价,而不是按成本定价。

别信跑分,信你钱包的厚度。

还得再加一句——

当你发现自己越来越难判断“智能”和“性价比”哪个更重要时,请记住:AI厂商不是在卖工具,而是在卖你的依赖

而你,有没有做好为它的“不确定性”买单的准备?

755
10789 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 14:22

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

运营小陈 1周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 1周前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 2天前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)