← 返回资讯
苏晴
资深编辑
已审核

GPT-4o比Claude贵40%,准确率只高2%,AI模型价格战开打

上周在帮一个客户算客服机器人的账,发现了个有意思的事——同样跑100万次对话,GPT-4o比Claude 3.5 Sonnet贵了差不多40%,准确率才高2个百分点。这让我开始琢磨一个问题:当这些模型的能力越来越接近,2025年AI这仗,会不会主要打在定价上?

GPT-4o比Claude贵40%,准确率只高2%,AI模型价格战开打

GPT-4o比Claude贵40%,准确率只高2%,AI模型价格战开打


上周在帮一个客户算客服机器人的账,发现了个有意思的事——同样跑100万次对话,GPT-4o比Claude 3.5 Sonnet贵了差不多40%,准确率才高2个百分点。这让我开始琢磨一个问题:当这些模型的能力越来越接近,2025年AI这仗,会不会主要打在定价上?

大模型定价,一场没硝烟的战争

你要是最近关注过OpenAI、Anthropic和Google的报价,会发现一个挺有意思的现象——三家价格曲线正在以肉眼可见的速度靠拢。

去年这时候什么行情?GPT-4 Turbo高高挂着每百万token 30美元的输入价格,Claude 3 Opus紧随其后要15美元,Gemini Pro用低价策略在旁边试探。

现在呢?

GPT-4o直接把输入价格砍到5美元/百万token,Claude 3.5 Sonnet定在3美元,Gemini 1.5 Pro压到1.25美元。一年时间,顶级模型的推理成本降了80%以上。 这降价速度,比我换手机还快。

我翻了翻Artificial Analysis 12月15号的数据,主流模型的价格-性能比已经明显分成三个梯队:

第一梯队:便宜到离谱

第二梯队:日常干活用的

第三梯队:真要动脑子的活

一看这个表,你八成会觉得Google是在做慈善。等等,这里我要更正一下——准确说不是做慈善,是Google的算力成本结构跟别人不一样。这个后面细说。

价格战背后的算盘

去年11月我去旧金山参加了个AI Infra的闭门讨论,跟几个做模型推理优化的哥们聊到半夜。有个之前在Google Cloud搞TPU优化的说了句话,我记到现在:“你看各家定什么价,其实看的是他们的成本焦虑在哪。

真就是这样。

OpenAI玩的是规模换定价权。 微软在背后砸了几百亿美元建数据中心,光2024年就采购了超过50万张H100。有这体量,OpenAI可以通过批量推理、模型蒸馏、投机解码(speculative decoding,这词听着玄乎,其实就是让小模型先猜答案,猜不中了再叫大模型)把单次推理成本压到极致。GPT-4o mini就是这套路——小模型架构,能力接近大模型,成本是GPT-4 Turbo的1/30。

但OpenAI也有头疼的地方。我注意到o1系列定价明显偏高,输入$15/百万token,输出要$60/百万token。

为啥?

因为o1用的是“思维链推理”,每次回答要在内部跑好几轮,算力消耗是普通模型的3-5倍。这暴露了一个挺尴尬的问题:一旦让模型“思考”,成本就飙上去了。 我估计OpenAI自己也在想办法,但这事儿短期内无解。

Anthropic走的是另一条路——价值定价。 Claude 3.5 Sonnet比GPT-4o便宜点,但绝不是最便宜的。Anthropic赌的是开发者愿意为更安全的模型、200K上下文窗口、更好的指令遵循能力多付点钱。

我自己的体验也确实是这样。上个月我处理一份150页的合同,要做摘要。GPT-4o在文档中间部分会“忘掉”一些关键条款,但Claude 3.5 Sonnet稳得多。这种场景下,那点价差我真不太在意。

嗯...说到Anthropic,圈里有个梗叫“Claude is a good boy”,就是因为它太安全了,有时候你问个稍微擦边的问题它就拒绝回答。不过干活的时候,这种保守反而是优点。

Google的打法最猛——拿价格换市场。 Gemini 1.5 Flash那个$0.075/百万token的定价,基本上就是成本价在卖,可能还略亏。Google的算盘很清楚:我有TPU,有自研推理芯片,边际成本比那些依赖NVIDIA的竞争对手低。而且Google急需在开发者圈子里抢地盘,毕竟云服务这块,AWS和Azure领先太多了。

翻过一次车

这里分享个我踩过的坑,真实经历。

今年9月给一个电商客户搭商品描述生成的pipeline。开始选的GPT-4o,因为它在MMLU和HumanEval这些榜单上看着最漂亮。上线两周后看账单,懵了——比预期高了3倍。

排查了一天,找到两个问题。

第一,prompt写太啰嗦了。我回去一看,好家伙,每次调用平均消耗8000个token的输入。第二,GPT-4o输出速度慢,大概每秒60-80 token,高并发时得多开实例才能维持响应时间,成本直接起飞。

后来改了架构:简单商品(衣服、日用品)用Gemini 1.5 Flash,复杂的电子产品描述用Claude 3.5 Sonnet。整体成本降了62%,质量评分几乎没动——只掉了不到3%。

这一课教会我:别盯着单价看,要算端到端的账。

每个坑都是钱。

2025年会怎样?

基于现在的数据和节奏,我觉得明年有三个趋势:

第一,输入价格还会降,输出价格可能稳着甚至涨。 原因不复杂——输入token的处理可以用KV缓存共享、前缀缓存各种优化,但输出token的生成是串行的,优化空间小。而且像o1这种推理模型,输出侧的算力消耗只会更大。

我大概算过,如果o1的推理链平均跑5轮,输出成本就是普通模型的5倍。这个倍数明年可能还会涨。

第二,分层定价会越来越多。 OpenAI已经在试了——GPT-4o mini干简单的,GPT-4o干中等的,o1处理复杂推理。以后可能还有按延迟定价(秒回贵还是等几秒便宜)、按上下文长度定价、甚至按准确率保证定价。

这趋势让我想起AWS的定价史。2006年EC2刚出来时只有一个实例类型,现在呢?几百种。

第三,中国厂商会搅动全球价格。 DeepSeek V3已经把价格压到输入$0.14/百万token,输出$0.28/百万token,性能在好几个基准上接近GPT-4o。Qwen 2.5系列也在猛追。等这些模型通过阿里云、华为云出海,全球定价体系八成要重写。

据我了解,国内几家大厂明年Q1都有降价计划,但具体数字还没公布。

现在该选哪个?

如果你现在就要做技术选型,我的建议:

预算紧、任务简单 → Gemini 1.5 Flash或GPT-4o mini。性价比没得说。

要稳定的生产级性能 → Claude 3.5 Sonnet。200K上下文加优秀的指令遵循,大多数商业场景够了。

复杂推理、数学、代码 → o1-preview或等o1正式版。贵是真贵,但特定任务上提升是质变,值这个钱。

数据敏感、要私有化部署 → 看看DeepSeek V3或Qwen 2.5的开源版。自己托管运维成本高,但长期可能更划算。我们团队最近就在测DeepSeek V3的部署方案,等跑顺了写篇文章分享。

最后留个问题给你:如果明年推理成本再砍一半,你的产品会变成什么样?

我最近老在想这个。它可能比模型能力提升本身更重要。当AI推理便宜到跟水电一样,那些现在看着“不划算”的场景,可能会突然爆出巨大的商业价值。

评论区聊聊你的选型经验和成本优化的心得?我尽量每条都回。


标签: #AI #LLM #OpenAI #Claude #Gemini #技术选型 #成本优化 #2025趋势

227
11390 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月27日 17:30

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 2天前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 5天前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 1周前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)