如何评价 Anthropic 发布的 Claude Fa
Claude 3.5 Sonnet?我花200美元买了张“情绪过山车”票!
上周,我正端着咖啡刷Hacker News,突然看到Anthropic推出Claude 3.5 Sonnet的消息。
第一眼,我没反应过来。
不是刚出到Claude 3 Opus吗?怎么就跳到3.5 Sonnet了?等看清那几个关键词——“200K上下文”“价格降了一半”“编程能力大幅提升”——好家伙,咖啡差点喷屏幕上。
这群人,又搞了个大动静。
我咽不下这口气。当天就往API里充了200美元,准备把这匹新模型牵出来遛遛。
三天下来,我让它干了三件事:重构爬虫脚本、吞掉我们团队12万行的遗留代码库、写一个带WebSocket的多人在线绘图工具。
结果?能力不错,但槽点也不少。
今天就跟你聊聊,这200美元花得值不值。
强是真的强,但有时也会突然犯傻
先说好的。
Claude 3.5 Sonnet的编程能力,是我用过的模型里很靠前的。
别跟我提GPT-4。SWE-bench上Claude 3.5 Sonnet拿了47.9%,GPT-4只有38.7%,Claude 3 Opus是45.6%。这差距不是以前那种细微差别,是实打实的提升。
我把它丢进那个12万行的Python/Django老项目,让它做两件事:
第一,把所有requests调用迁移到httpx,支持异步。
第二,重构单元测试,覆盖率从40%拉到70%。
它花了大约25分钟读完全部文件——我的上下文几乎塞满。然后又花了40分钟改代码。中间我离开了一下,回来发现它自己生成了一个迁移计划文档,在项目根目录写了份MIGRATION_STATUS.md,里面详细记录了哪些文件改完了、哪些还有坑。
这活儿以前我得让人花一整天手动整理。
代码质量呢?我review了一部分——约80%的修改可以直接合并。剩下20%,是它高估了某个第三方库的版本兼容性。
这个水平,放一年前,我得说很强。
但好景不长。
我拿它写一篇技术文章——从零搭建一个内部DNS服务器,涉及bind配置和网络策略。完全合法的运维操作。
结果呢?它直接拒绝了,输出:“出于安全考虑,无法提供DNS配置的详细步骤。”
我的血压,瞬间拉满。
Anthropic说安全过滤误报率很低,但自己用下来,只要涉及网络、安全、或者稍微敏感一点的技术操作,触发率明显偏高。官方提到的“误伤无害请求”不是客套话,是真的伤。
我写个DNS配置,就被当成黑客了。这体验,你说糟心不糟心?
关键是你付的是3.5 Sonnet的价格——输入3美元、输出15美元每百万token。结果服务被阻断。这感觉,就像你点了份和牛,厨房说“我们不上这道菜了”。道理我都懂,但钱得退啊。
Anthropic这套安全策略,模型能力强但限制很多,本质上是一种风险控制。用户付钱,但部分请求无法完成。安全当然重要,但透明度和补偿机制呢?价格一样,服务打折,这事儿挺膈应的。
更强版本暂时还摸不着
之前一直有传言说Anthropic内部有一个更强但更安全的模型,只提供给特定组织。现实中,Anthropic确实对某些高危领域限制使用,但至今没有公开更强的受限版本。
我理解安全上的谨慎,但不爽的是信息不透明。同一个模型,对外安全受限,但内部可能更强。这感觉就像——我们完全可以造一个更强的模型,但我们选择不给你用。
从社区反馈来看,做安全研究的博主几乎都在抱怨。普通人根本体验不到百分之百的能力。
Scaling Law撞墙,厂商在偷偷换轮胎
最近有个现象挺明显:数据瓶颈开始显现,训练数据的质量比数量更重要。
Claude 3.5 Sonnet的发布,我注意到一个更有意思的点:Anthropic反复强调它的“token效率”提升了——比以前的Claude模型更省token。同等输出质量下,需要的算力更少了。
这背后是架构或训练方法的优化。当数据不够堆的时候,你就得让模型学会反复利用已有的能力。人脑就是这样——你给一个小孩看三张猫的照片,他就能认出猫。模型用了几十亿张图都还认不全。
所以,token效率才是真正的下一代Scaling Law。Claude 3.5 Sonnet的能力提升,一部分来自数据质量选择,一部分来自算法改进。它记住了上下文,但还没有真正“学会学习”。不过方向是对的。
未来半年到一年,主流厂商都会开始吹自己的token效率,而不是单纯堆参数。那条路走到头了。
Claude 3.5 Sonnet值得今天就用吗?
我个人的判断:
如果你是重度AI开发者,经常做全代码库迁移、大型架构重构、或者复杂的科学分析——Claude 3.5 Sonnet是目前最好的选择之一。硬实力摆在那里。
但如果你只是日常写点小脚本、做笔记总结、写写文案——Claude 3 Haiku完全够用,价格也更便宜。别为了“最强”这两个字冲动消费。我200美元两天就用完了,还遇到了几次拒绝。想想挺心疼。
我更看重的,其实是Anthropic安全策略的下一步。如果他们把误判率真正降到可接受的水平——比如低于1%——并且明确画出哪些话题会触发限制,而不是靠一个黑盒分类器决定“你这问题危不危险”,那么3.5 Sonnet会是真正的旗舰。
现在嘛——能力很高。体验因为安全护栏和价格,打了个狠折。
至于那个传说中的更强版本?先让子弹飞一会儿。等“更广泛的信任计划”真的对开发者和研究人员开放了,我们才能用上完整的特斯拉。现在只能隔着车窗流口水。
预测一下:到2025年底,模型能力会继续提升,安全护栏会更精细,价格也会随着竞争下降。那时候才是入手的真正时机。
现在,我先去把剩下那几十美元额度用完。看看它能不能把我游戏服务器部署脚本也一起写了。别触发过滤器就行。
你看,这200美元,买的不只是算力。买的是对AI未来的好奇心,和一点点不甘心。
读者评论 3