如何看待 Anthropic 发布的 Claude 4
我花了100美金订阅Claude 4,测了两天,结果让我又笑又骂
说出来你可能不信——
我下单Claude Max会员之前,手抖了整整三秒。
100美元啊!我的钱包在滴血。
但你猜怎么着?付完账冷静下来一算账,我反而笑了。
为啥?OpenAI那边200美元的Plus套餐摆在那儿呢。Anthropic这边,100美元打包给你Pro+Code+Research全套。你知道OpenAI把这几个功能拆开卖要多少钱吗?合着Anthropic这波不是在涨价,是在打价格战啊!
不过,别急着掏钱。
说到这儿,我得先把踩过的坑摊开给你看看。
测了两天,三个让我直摇头的发现
我先拿Sonnet 4.5和它老大哥3.7做了组对比实验。
第一个任务——代码审查。
我自己写了一段代码,故意塞了五个bug进去,埋得还挺深。你猜结果?
Sonnet 4.5找到了四个,3.7找到了三个半。那半个算是擦中了边吧,只能说——进步是有的,但要说是飞跃?那还真谈不上。
第二个任务——多语言翻译。
中译英、日译中、阿拉伯语转德语,全测了一遍。坦白讲,Gemini 2.5 Pro在这块甩它一条街。有多惨?
Claude 4在日语敬语转换上翻车了三次。就「お世話になっております」这句商务日语,它直接翻成「感谢你的照顾」。
你品,你细品。
少了那股客气味儿,这句话在公司里说出来,分分钟被日本客户在心里画个叉。
第三个任务——工具调用。
这是最让我头疼的。我写了个MCP server让它调API拿天气数据,结果Sonnet 4.5两次把经纬度参数传反了,一次返回格式解析失败。你问我这个bug之前有没有?有!3.7也是这毛病,改都没改!
所以你要我说实话的话——
Sonnet 4.5是3.7的Refresh版本,这个判断我觉得不算冤枉它。
但故事到这儿,还没有结束。
Opus 4.8,这才是让我眼前一亮的那一个
我拿它跑了三个真实到不能再真实的场景。
第一个场景——代码审查。
注意了,不是那种「找bug」的练习题。我把我上个月写的一个微服务重构方案直接丢给它,真刀真枪的那种。
Opus 4.8干了一件让我瞬间坐起来的事。
它不只是告诉我哪里有问题——它先问我:「你确定要把缓存层放到API网关后面吗?这会让你的写操作延迟暴增,建议换个思路。」
我愣住了。
你看,以前用别的模型,从来都是直接甩建议。它倒好——先质疑我的决策。
我当时不服气,顺着它的思路做了个性能测试。
结果呢?
它是对的。那个方案确实有性能隐患。
官方文档把这种能力叫「主动标注不确定性」。换句人话说就是——它不再是个无脑执行任务的工具人,开始有点程序员搭档的意思了。
第二个场景——写一份投融资尽调报告。
我丢给Opus 4.8三份PDF格式的财报,让它提取关键指标做对比分析。
以前用3.7的时候,经常出现引文标注对不上号的情况,你得人工一个个核对。这回4.8的引文精准度好了很多,省了我一半核对时间。
但这还不是最炸的。
它主动发现了我给的第三份财报里有个数据口径不一致的问题——那份报告用的是GAAP,另外两份是IFRS。
你想想,不调整的话,分析结论全偏了。
以前我用AI做这类分析,从来没有任何模型主动提出过这种疑问。一次都没有。
第三个场景——我觉得最有意思。
我问了一个故意刁难它的问题。
「2026年4月17日,Google的AlphaFold团队发表了一篇关于蛋白质折叠新方法的论文,论文DOI是什么?」
它回我:「我不能确定这具体是哪篇论文,因为我的训练数据截止到2026年2月,4月17日发表的论文我不确定是否能覆盖。建议你查一下Google Scholar或者直接搜AlphaFold团队的最新动态。」
你可能会觉得——这回答看起来挺普通的啊?
但你想想,以前的模型大概率会干嘛?——编一个DOI出来。哪怕它不确定,它也会编。这是AI的老毛病了。
4.8在这个「诚实度」上的改进,我测下来是真心服气的。
那个让我又爱又恨的Interleaved Thinking
这个功能说白了就是拆解复杂问题,先想一部分,接着再想另一部分,中间还能来回调整。
我拿它解了一道LeetCode hard级别的算法题。它先把问题拆成三个子问题,然后逐个解决。中间还自己发现了一个逻辑漏洞,自己纠正了。
理论上听起来很完美对吧?
但前提是你得用API才能调用,网页版还不行。而且那个裁判模型——用来评判思考路径质量的——还没上线。
现在用起来的感觉就是:能跑,但不知道跑得对不对。
100万Token的上下文,你用得着吗?
Opus 4.8延续了100万Token上下文的支持。我做了个压力测试——
把一本《设计数据密集型应用》的英文版PDF,大概900页,整个丢进去。让它做个摘要,再对比书里提到的几种分布式一致性方案。
结果呢?
它确实能处理。摘要也做出来了。
但两个问题:第一,召回速度明显变慢。第二,超过200K Token的部分要按高级费率计费——输入每百万Token收10美元,输出收37.5美元。
说白了,这功能更适合那些「不差钱」的企业级用户。
个人开发者偶尔用用还行。高频使用?钱包先扛不住。
对行业的影响,我要说三个不得不说的话
第一,Agent化这条路,Anthropic走在了前面。
Dynamic Workflows这个功能,虽然还在预览阶段,但思路是对的——让模型不再是一次性问答,而是能自主规划、拆解、执行任务。
我让Claude Code跑了一个10000行代码的重构项目。它在那次会话里调了几十个子智能体并行干活,最后给我发了个Pull Request。
整个过程我没管。它就自己搞定了。
你想想,Cursor这种搭便车的都能靠Agent概念火起来。Anthropic自己做出来的官方Agent,至少在开发体验上不会差吧?
第二,「更诚实」可能比「更聪明」更有商业价值。
说到这儿,我想问你一个问题——
企业客户最怕的是什么?
不是AI不够聪明。
是AI在犯错的时候,你压根不知道它错了。
Opus 4.8这个「主动说自己不知道」的特性,在金融、医疗这些对错误容忍度极低的行业里,是个大卖点。你想想看,一个AI做财报分析,如果你不知道它不确定的点在哪里,你敢直接用它的结论吗?
第三,那个隐藏的「飞轮」故事才是Anthropic真正想讲的。
注意一个细节:Claude自己正在被用来训练下一代Claude。
从2023年到2026年,更新节奏越来越快——Opus 4.7到4.8只隔了42天。
Anthropic内部团队每天都用Claude Code写代码。下一代模型先在内部试用,试完再发布。
这个循环一旦跑起来,就是研发飞轮。
OpenAI前脚刚说了「AI的发展正在被AI加速」,Anthropic后脚就说「Claude通往递归自我改进的路径已经开始变得可见」。
两家大厂在讲同一个故事。
只是看谁先把它兑现。
那我到底买不买?
说到这儿,给你几个实在的建议——
如果你是企业用户,特别是做代码开发、数据分析、金融分析的,Opus 4.8值得一试。尤其是那个「更诚实」和Dynamic Workflows,在实际工作流里确实能省不少事。
如果你只是日常用用AI写文案、翻译个东西,Sonnet 4.5够用了。没必要为那点可有可无的提升多花钱。Gemini 2.5 Pro在多语言和多模态上依然有优势,Claude的短板一时半会补不上。
如果你是开发者,想玩Agent——Claude Max会员的100美元定价是目前市场上性价比最高的选择。
我已经退订了OpenAI的Pro套餐。
预算全挪到了这边。
最后说句题外话。
那个传说中比Opus更强的Mythos模型,据Anthropic自己说「未来数周内」会向所有客户开放。
我打赌那才是真正的大招。
Opus 4.8更像是把地基打牢,好让Mythos站上去。
真正的浪潮,从来不是靠突然涌起。而是早有人在水下,默默地铺好了承重的石头。
你准备好站在石头上了吗?
读者评论 5