← 返回资讯
赵一鸣
产品评测编辑
已审核

如何看待 Anthropic 发布的 Claude 4

我下单Claude Max会员之前,手抖了整整三秒。

如何看待 Anthropic 发布的 Claude 4

如何看待 Anthropic 发布的 Claude 4


我花了100美金订阅Claude 4,测了两天,结果让我又笑又骂

说出来你可能不信——

我下单Claude Max会员之前,手抖了整整三秒。

100美元啊!我的钱包在滴血。

但你猜怎么着?付完账冷静下来一算账,我反而笑了。

为啥?OpenAI那边200美元的Plus套餐摆在那儿呢。Anthropic这边,100美元打包给你Pro+Code+Research全套。你知道OpenAI把这几个功能拆开卖要多少钱吗?合着Anthropic这波不是在涨价,是在打价格战啊!

不过,别急着掏钱。

说到这儿,我得先把踩过的坑摊开给你看看。


测了两天,三个让我直摇头的发现

我先拿Sonnet 4.5和它老大哥3.7做了组对比实验。

第一个任务——代码审查

我自己写了一段代码,故意塞了五个bug进去,埋得还挺深。你猜结果?

Sonnet 4.5找到了四个,3.7找到了三个半。那半个算是擦中了边吧,只能说——进步是有的,但要说是飞跃?那还真谈不上。

第二个任务——多语言翻译

中译英、日译中、阿拉伯语转德语,全测了一遍。坦白讲,Gemini 2.5 Pro在这块甩它一条街。有多惨?

Claude 4在日语敬语转换上翻车了三次。就「お世話になっております」这句商务日语,它直接翻成「感谢你的照顾」。

你品,你细品。

少了那股客气味儿,这句话在公司里说出来,分分钟被日本客户在心里画个叉。

第三个任务——工具调用

这是最让我头疼的。我写了个MCP server让它调API拿天气数据,结果Sonnet 4.5两次把经纬度参数传反了,一次返回格式解析失败。你问我这个bug之前有没有?有!3.7也是这毛病,改都没改!

所以你要我说实话的话——

Sonnet 4.5是3.7的Refresh版本,这个判断我觉得不算冤枉它。

但故事到这儿,还没有结束。


Opus 4.8,这才是让我眼前一亮的那一个

我拿它跑了三个真实到不能再真实的场景。

第一个场景——代码审查

注意了,不是那种「找bug」的练习题。我把我上个月写的一个微服务重构方案直接丢给它,真刀真枪的那种。

Opus 4.8干了一件让我瞬间坐起来的事。

它不只是告诉我哪里有问题——它先问我:「你确定要把缓存层放到API网关后面吗?这会让你的写操作延迟暴增,建议换个思路。」

我愣住了。

你看,以前用别的模型,从来都是直接甩建议。它倒好——先质疑我的决策

我当时不服气,顺着它的思路做了个性能测试。

结果呢?

它是对的。那个方案确实有性能隐患。

官方文档把这种能力叫「主动标注不确定性」。换句人话说就是——它不再是个无脑执行任务的工具人,开始有点程序员搭档的意思了。

第二个场景——写一份投融资尽调报告

我丢给Opus 4.8三份PDF格式的财报,让它提取关键指标做对比分析。

以前用3.7的时候,经常出现引文标注对不上号的情况,你得人工一个个核对。这回4.8的引文精准度好了很多,省了我一半核对时间。

但这还不是最炸的。

它主动发现了我给的第三份财报里有个数据口径不一致的问题——那份报告用的是GAAP,另外两份是IFRS。

你想想,不调整的话,分析结论全偏了。

以前我用AI做这类分析,从来没有任何模型主动提出过这种疑问。一次都没有。

第三个场景——我觉得最有意思。

我问了一个故意刁难它的问题

「2026年4月17日,Google的AlphaFold团队发表了一篇关于蛋白质折叠新方法的论文,论文DOI是什么?」

它回我:「我不能确定这具体是哪篇论文,因为我的训练数据截止到2026年2月,4月17日发表的论文我不确定是否能覆盖。建议你查一下Google Scholar或者直接搜AlphaFold团队的最新动态。」

你可能会觉得——这回答看起来挺普通的啊?

但你想想,以前的模型大概率会干嘛?——编一个DOI出来。哪怕它不确定,它也会编。这是AI的老毛病了。

4.8在这个「诚实度」上的改进,我测下来是真心服气的。


那个让我又爱又恨的Interleaved Thinking

这个功能说白了就是拆解复杂问题,先想一部分,接着再想另一部分,中间还能来回调整。

我拿它解了一道LeetCode hard级别的算法题。它先把问题拆成三个子问题,然后逐个解决。中间还自己发现了一个逻辑漏洞,自己纠正了。

理论上听起来很完美对吧?

但前提是你得用API才能调用,网页版还不行。而且那个裁判模型——用来评判思考路径质量的——还没上线。

现在用起来的感觉就是:能跑,但不知道跑得对不对。


100万Token的上下文,你用得着吗?

Opus 4.8延续了100万Token上下文的支持。我做了个压力测试——

把一本《设计数据密集型应用》的英文版PDF,大概900页,整个丢进去。让它做个摘要,再对比书里提到的几种分布式一致性方案。

结果呢?

它确实能处理。摘要也做出来了。

但两个问题:第一,召回速度明显变慢。第二,超过200K Token的部分要按高级费率计费——输入每百万Token收10美元,输出收37.5美元。

说白了,这功能更适合那些「不差钱」的企业级用户。

个人开发者偶尔用用还行。高频使用?钱包先扛不住。


对行业的影响,我要说三个不得不说的话

第一,Agent化这条路,Anthropic走在了前面。

Dynamic Workflows这个功能,虽然还在预览阶段,但思路是对的——让模型不再是一次性问答,而是能自主规划、拆解、执行任务。

我让Claude Code跑了一个10000行代码的重构项目。它在那次会话里调了几十个子智能体并行干活,最后给我发了个Pull Request。

整个过程我没管。它就自己搞定了。

你想想,Cursor这种搭便车的都能靠Agent概念火起来。Anthropic自己做出来的官方Agent,至少在开发体验上不会差吧?

第二,「更诚实」可能比「更聪明」更有商业价值。

说到这儿,我想问你一个问题——

企业客户最怕的是什么?

不是AI不够聪明。

是AI在犯错的时候,你压根不知道它错了。

Opus 4.8这个「主动说自己不知道」的特性,在金融、医疗这些对错误容忍度极低的行业里,是个大卖点。你想想看,一个AI做财报分析,如果你不知道它不确定的点在哪里,你敢直接用它的结论吗?

第三,那个隐藏的「飞轮」故事才是Anthropic真正想讲的。

注意一个细节:Claude自己正在被用来训练下一代Claude。

从2023年到2026年,更新节奏越来越快——Opus 4.7到4.8只隔了42天。

Anthropic内部团队每天都用Claude Code写代码。下一代模型先在内部试用,试完再发布。

这个循环一旦跑起来,就是研发飞轮。

OpenAI前脚刚说了「AI的发展正在被AI加速」,Anthropic后脚就说「Claude通往递归自我改进的路径已经开始变得可见」。

两家大厂在讲同一个故事。

只是看谁先把它兑现。


那我到底买不买?

说到这儿,给你几个实在的建议——

如果你是企业用户,特别是做代码开发、数据分析、金融分析的,Opus 4.8值得一试。尤其是那个「更诚实」和Dynamic Workflows,在实际工作流里确实能省不少事。

如果你只是日常用用AI写文案、翻译个东西,Sonnet 4.5够用了。没必要为那点可有可无的提升多花钱。Gemini 2.5 Pro在多语言和多模态上依然有优势,Claude的短板一时半会补不上。

如果你是开发者,想玩Agent——Claude Max会员的100美元定价是目前市场上性价比最高的选择。

我已经退订了OpenAI的Pro套餐。

预算全挪到了这边。


最后说句题外话。

那个传说中比Opus更强的Mythos模型,据Anthropic自己说「未来数周内」会向所有客户开放。

我打赌那才是真正的大招。

Opus 4.8更像是把地基打牢,好让Mythos站上去。

真正的浪潮,从来不是靠突然涌起。而是早有人在水下,默默地铺好了承重的石头。

你准备好站在石头上了吗?

84
2803 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 08:29

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

产品经理阿杰 6天前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 1周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 昨天
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 4天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)