← 返回资讯
林远舟
技术编辑
已审核

Claude Opus 4.5 评测:SWE-bench 80.9%,编程王座又换人了

11 月 12 日,OpenAI 发布 GPT-5.1。11 月 18 日,Google 发布 Gemini 3 Pro。11 月 24 日,Anthropic 深夜放出 Claude Opus 4.5。

Claude Opus 4.5 评测:SWE-bench 80.9%,编程王座又换人了

Claude Opus 4.5 评测:SWE-bench 80.9%,编程王座又换人了

AI 圈的「一周闭环」

11 月 12 日,OpenAI 发布 GPT-5.1。11 月 18 日,Google 发布 Gemini 3 Pro。11 月 24 日,Anthropic 深夜放出 Claude Opus 4.5。

一周之内,AI 编程王座换了三次。

最后的赢家是 Claude Opus 4.5——SWE-bench Verified 得分 80.9%,成为首个突破 80% 的模型。Aider Polyglot 多语言编程测试 89.4% 编辑准确率,8 种编程语言中 7 种保持领先。

我在发布当天就接入了 API,测了三天。这篇文章讲的是跑分之外的东西:实际项目中的表现、token 效率、以及它到底值不值那个价。

定价:Opus 终于不贵了

先看价格。Opus 4.5 定价:输入 5 美元/百万 token,输出 25 美元/百万 token。

对比 Opus 4.1 的价格(输入 15 美元,输出 75 美元),降了 67%。对比 Claude Sonnet 4.5(输入 3 美元,输出 15 美元),Opus 4.5 贵不到一倍。

Anthropic 终于把 Opus 从"奢侈品"变成了"高端消费品"。Cursor CEO Michael Truell 说得很直白:"Opus 4.5 在困难编码任务上的表现明显优于之前的 Claude 模型,定价和智能性都有显著提升。"

实测一:Token 效率

这是 Opus 4.5 最被低估的改进。

同样的编程任务,Opus 4.5 的 token 消耗比 Sonnet 4.5 少了 65%。什么意思?你花 5 美元的输入费,实际产出顶得上 Sonnet 花 15 美元的输入。

我实测了一个场景:重构一个 500 行的 Python 服务模块。

代码质量差不多,但 Opus 少了 44% 的 token 消耗。而且 Opus 的输出更"干练"——没有多余的注释,没有防御性冗余。

Anthropic 还新增了"努力"参数(effort parameter),让开发者自己权衡时间和质量。中等努力水平就能匹配 Sonnet 4.5 的最佳成绩,但输出 token 减少 76%。最高努力水平性能超越 Sonnet 4.5 达 4.3 个百分点。

实测二:多文件重构

给 Opus 4.5 一个真实任务:重构一个微服务项目,涉及 3 个仓库、12 个文件。

任务描述:把用户认证逻辑从每个服务里抽出来,统一放到一个 auth 中间件里。

Opus 4.5 的执行过程:

1. 先扫描三个仓库的结构

2. 找到每个服务里重复的认证代码

3. 设计统一的中间件接口

4. 修改 12 个文件,统一调用中间件

5. 更新测试,修复了 3 个因为接口变化导致的测试失败

整个过程大概 4 分钟。如果人工做,至少要半天。

Staff Engineer Paulo Arruda 的评价很到位:"Opus 4.5 完成了一次令人印象深刻的重构,跨越两个代码库和三个协调的 Agent。非常彻底,帮助制定了稳健的计划,处理了细节并修复了测试。比 Sonnet 4.5 明显进步。"

实测三:模糊需求处理

Opus 4.5 最大的能力跃迁,不在跑分上。

在"处理模糊需求"这件事上,它和之前的模型有质的区别。

我故意给了一个模糊的需求:"用户反馈登录太慢,帮我优化一下。"

之前的模型(包括 Sonnet 4.5)会直接开始改代码——加缓存、改查询、加索引。但 Opus 4.5 先问了我三个问题:

1. 登录慢是在哪个环节?是数据库查询慢还是 API 响应慢?

2. 你有没有监控数据可以给我看一下?

3. 用户量级大概多少?

问完这三个问题之后,它才给出了优化方案。而且方案里包含了"先加监控埋点,确认瓶颈再优化"的建议——这是有经验的工程师才会想到的事。

Anthropic 测试团队的评价是:"Opus 4.5 能够处理模糊信息并在没有手把手指导的情况下权衡利弊。"说得没错。

缺点和注意事项

缺点 1:复杂任务偶尔"想太多"

遇到简单但多步骤的任务,Opus 4.5 有时候会过度规划。明明可以 3 步搞定的,它给你规划 7 步。这是"努力"参数调太高了——中等努力就够。

缺点 2:和 Cursor 的集成还在磨合

在 Cursor 里用 Opus 4.5,偶尔会出现响应格式不兼容的情况。Cursor 团队已经在修了,但现阶段偶尔会遇到。

缺点 3:中文场景不如英文

Opus 4.5 的中文能力比 Sonnet 4.5 有提升,但和 DeepSeek V3.2 比还是有差距。如果是纯中文项目,DeepSeek 仍然是更好的选择。

该升级吗?


#Claude #Opus45 #Anthropic #AI编程 #SWEbench

244
3497 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年07月12日 11:35

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

前端工程师 1周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 1周前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 2周前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)