Claude Opus 4.5 评测:SWE-bench 80.9%,编程王座又换人了
AI 圈的「一周闭环」
11 月 12 日,OpenAI 发布 GPT-5.1。11 月 18 日,Google 发布 Gemini 3 Pro。11 月 24 日,Anthropic 深夜放出 Claude Opus 4.5。
一周之内,AI 编程王座换了三次。
最后的赢家是 Claude Opus 4.5——SWE-bench Verified 得分 80.9%,成为首个突破 80% 的模型。Aider Polyglot 多语言编程测试 89.4% 编辑准确率,8 种编程语言中 7 种保持领先。
我在发布当天就接入了 API,测了三天。这篇文章讲的是跑分之外的东西:实际项目中的表现、token 效率、以及它到底值不值那个价。
定价:Opus 终于不贵了
先看价格。Opus 4.5 定价:输入 5 美元/百万 token,输出 25 美元/百万 token。
对比 Opus 4.1 的价格(输入 15 美元,输出 75 美元),降了 67%。对比 Claude Sonnet 4.5(输入 3 美元,输出 15 美元),Opus 4.5 贵不到一倍。
Anthropic 终于把 Opus 从"奢侈品"变成了"高端消费品"。Cursor CEO Michael Truell 说得很直白:"Opus 4.5 在困难编码任务上的表现明显优于之前的 Claude 模型,定价和智能性都有显著提升。"
实测一:Token 效率
这是 Opus 4.5 最被低估的改进。
同样的编程任务,Opus 4.5 的 token 消耗比 Sonnet 4.5 少了 65%。什么意思?你花 5 美元的输入费,实际产出顶得上 Sonnet 花 15 美元的输入。
我实测了一个场景:重构一个 500 行的 Python 服务模块。
- Sonnet 4.5:输出 3200 token,完成时间 45 秒
- Opus 4.5:输出 1800 token,完成时间 28 秒
代码质量差不多,但 Opus 少了 44% 的 token 消耗。而且 Opus 的输出更"干练"——没有多余的注释,没有防御性冗余。
Anthropic 还新增了"努力"参数(effort parameter),让开发者自己权衡时间和质量。中等努力水平就能匹配 Sonnet 4.5 的最佳成绩,但输出 token 减少 76%。最高努力水平性能超越 Sonnet 4.5 达 4.3 个百分点。
实测二:多文件重构
给 Opus 4.5 一个真实任务:重构一个微服务项目,涉及 3 个仓库、12 个文件。
任务描述:把用户认证逻辑从每个服务里抽出来,统一放到一个 auth 中间件里。
Opus 4.5 的执行过程:
1. 先扫描三个仓库的结构
2. 找到每个服务里重复的认证代码
3. 设计统一的中间件接口
4. 修改 12 个文件,统一调用中间件
5. 更新测试,修复了 3 个因为接口变化导致的测试失败
整个过程大概 4 分钟。如果人工做,至少要半天。
Staff Engineer Paulo Arruda 的评价很到位:"Opus 4.5 完成了一次令人印象深刻的重构,跨越两个代码库和三个协调的 Agent。非常彻底,帮助制定了稳健的计划,处理了细节并修复了测试。比 Sonnet 4.5 明显进步。"
实测三:模糊需求处理
Opus 4.5 最大的能力跃迁,不在跑分上。
在"处理模糊需求"这件事上,它和之前的模型有质的区别。
我故意给了一个模糊的需求:"用户反馈登录太慢,帮我优化一下。"
之前的模型(包括 Sonnet 4.5)会直接开始改代码——加缓存、改查询、加索引。但 Opus 4.5 先问了我三个问题:
1. 登录慢是在哪个环节?是数据库查询慢还是 API 响应慢?
2. 你有没有监控数据可以给我看一下?
3. 用户量级大概多少?
问完这三个问题之后,它才给出了优化方案。而且方案里包含了"先加监控埋点,确认瓶颈再优化"的建议——这是有经验的工程师才会想到的事。
Anthropic 测试团队的评价是:"Opus 4.5 能够处理模糊信息并在没有手把手指导的情况下权衡利弊。"说得没错。
缺点和注意事项
缺点 1:复杂任务偶尔"想太多"
遇到简单但多步骤的任务,Opus 4.5 有时候会过度规划。明明可以 3 步搞定的,它给你规划 7 步。这是"努力"参数调太高了——中等努力就够。
缺点 2:和 Cursor 的集成还在磨合
在 Cursor 里用 Opus 4.5,偶尔会出现响应格式不兼容的情况。Cursor 团队已经在修了,但现阶段偶尔会遇到。
缺点 3:中文场景不如英文
Opus 4.5 的中文能力比 Sonnet 4.5 有提升,但和 DeepSeek V3.2 比还是有差距。如果是纯中文项目,DeepSeek 仍然是更好的选择。
该升级吗?
- **从 Opus 4.1 升级**:必须升。价格降了 67%,能力提升了,没有理由不升。
- **从 Sonnet 4.5 升级**:如果日常处理复杂任务,建议升。如果只是简单补全,Sonnet 够用。
- **从 GPT-5.1 切换**:如果你的核心场景是编程,建议切。Opus 4.5 在编程上的优势是明显的。
#Claude #Opus45 #Anthropic #AI编程 #SWEbench
读者评论 3