← 返回资讯
林远舟
技术编辑
已审核

如何评价 Anthropic 发布的 Claude Fa

上周,我正端着咖啡刷Hacker News,突然看到Anthropic推出Claude 3.5 Sonnet的消息。

如何评价 Anthropic 发布的 Claude Fa

如何评价 Anthropic 发布的 Claude Fa


Claude 3.5 Sonnet?我花200美元买了张“情绪过山车”票!

上周,我正端着咖啡刷Hacker News,突然看到Anthropic推出Claude 3.5 Sonnet的消息。

第一眼,我没反应过来。

不是刚出到Claude 3 Opus吗?怎么就跳到3.5 Sonnet了?等看清那几个关键词——“200K上下文”“价格降了一半”“编程能力大幅提升”——好家伙,咖啡差点喷屏幕上。

这群人,又搞了个大动静。

我咽不下这口气。当天就往API里充了200美元,准备把这匹新模型牵出来遛遛。

三天下来,我让它干了三件事:重构爬虫脚本、吞掉我们团队12万行的遗留代码库、写一个带WebSocket的多人在线绘图工具。

结果?能力不错,但槽点也不少。

今天就跟你聊聊,这200美元花得值不值。


强是真的强,但有时也会突然犯傻

先说好的。

Claude 3.5 Sonnet的编程能力,是我用过的模型里很靠前的。

别跟我提GPT-4。SWE-bench上Claude 3.5 Sonnet拿了47.9%,GPT-4只有38.7%,Claude 3 Opus是45.6%。这差距不是以前那种细微差别,是实打实的提升。

我把它丢进那个12万行的Python/Django老项目,让它做两件事:

第一,把所有requests调用迁移到httpx,支持异步。

第二,重构单元测试,覆盖率从40%拉到70%。

它花了大约25分钟读完全部文件——我的上下文几乎塞满。然后又花了40分钟改代码。中间我离开了一下,回来发现它自己生成了一个迁移计划文档,在项目根目录写了份MIGRATION_STATUS.md,里面详细记录了哪些文件改完了、哪些还有坑。

这活儿以前我得让人花一整天手动整理。

代码质量呢?我review了一部分——约80%的修改可以直接合并。剩下20%,是它高估了某个第三方库的版本兼容性。

这个水平,放一年前,我得说很强。

但好景不长。

我拿它写一篇技术文章——从零搭建一个内部DNS服务器,涉及bind配置和网络策略。完全合法的运维操作。

结果呢?它直接拒绝了,输出:“出于安全考虑,无法提供DNS配置的详细步骤。”

我的血压,瞬间拉满。

Anthropic说安全过滤误报率很低,但自己用下来,只要涉及网络、安全、或者稍微敏感一点的技术操作,触发率明显偏高。官方提到的“误伤无害请求”不是客套话,是真的伤。

我写个DNS配置,就被当成黑客了。这体验,你说糟心不糟心?

关键是你付的是3.5 Sonnet的价格——输入3美元、输出15美元每百万token。结果服务被阻断。这感觉,就像你点了份和牛,厨房说“我们不上这道菜了”。道理我都懂,但钱得退啊。

Anthropic这套安全策略,模型能力强但限制很多,本质上是一种风险控制。用户付钱,但部分请求无法完成。安全当然重要,但透明度和补偿机制呢?价格一样,服务打折,这事儿挺膈应的。


更强版本暂时还摸不着

之前一直有传言说Anthropic内部有一个更强但更安全的模型,只提供给特定组织。现实中,Anthropic确实对某些高危领域限制使用,但至今没有公开更强的受限版本。

我理解安全上的谨慎,但不爽的是信息不透明。同一个模型,对外安全受限,但内部可能更强。这感觉就像——我们完全可以造一个更强的模型,但我们选择不给你用。

从社区反馈来看,做安全研究的博主几乎都在抱怨。普通人根本体验不到百分之百的能力。


Scaling Law撞墙,厂商在偷偷换轮胎

最近有个现象挺明显:数据瓶颈开始显现,训练数据的质量比数量更重要。

Claude 3.5 Sonnet的发布,我注意到一个更有意思的点:Anthropic反复强调它的“token效率”提升了——比以前的Claude模型更省token。同等输出质量下,需要的算力更少了。

这背后是架构或训练方法的优化。当数据不够堆的时候,你就得让模型学会反复利用已有的能力。人脑就是这样——你给一个小孩看三张猫的照片,他就能认出猫。模型用了几十亿张图都还认不全。

所以,token效率才是真正的下一代Scaling Law。Claude 3.5 Sonnet的能力提升,一部分来自数据质量选择,一部分来自算法改进。它记住了上下文,但还没有真正“学会学习”。不过方向是对的。

未来半年到一年,主流厂商都会开始吹自己的token效率,而不是单纯堆参数。那条路走到头了。


Claude 3.5 Sonnet值得今天就用吗?

我个人的判断:

如果你是重度AI开发者,经常做全代码库迁移、大型架构重构、或者复杂的科学分析——Claude 3.5 Sonnet是目前最好的选择之一。硬实力摆在那里。

但如果你只是日常写点小脚本、做笔记总结、写写文案——Claude 3 Haiku完全够用,价格也更便宜。别为了“最强”这两个字冲动消费。我200美元两天就用完了,还遇到了几次拒绝。想想挺心疼。

我更看重的,其实是Anthropic安全策略的下一步。如果他们把误判率真正降到可接受的水平——比如低于1%——并且明确画出哪些话题会触发限制,而不是靠一个黑盒分类器决定“你这问题危不危险”,那么3.5 Sonnet会是真正的旗舰。

现在嘛——能力很高。体验因为安全护栏和价格,打了个狠折。

至于那个传说中的更强版本?先让子弹飞一会儿。等“更广泛的信任计划”真的对开发者和研究人员开放了,我们才能用上完整的特斯拉。现在只能隔着车窗流口水。

预测一下:到2025年底,模型能力会继续提升,安全护栏会更精细,价格也会随着竞争下降。那时候才是入手的真正时机。

现在,我先去把剩下那几十美元额度用完。看看它能不能把我游戏服务器部署脚本也一起写了。别触发过滤器就行。

你看,这200美元,买的不只是算力。买的是对AI未来的好奇心,和一点点不甘心。

254
8469 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 06:00

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

运营小陈 6天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 1周前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)