GPT-4o比Claude贵40%,准确率只高2%,AI模型价格战开打
上周在帮一个客户算客服机器人的账,发现了个有意思的事——同样跑100万次对话,GPT-4o比Claude 3.5 Sonnet贵了差不多40%,准确率才高2个百分点。这让我开始琢磨一个问题:当这些模型的能力越来越接近,2025年AI这仗,会不会主要打在定价上?
大模型定价,一场没硝烟的战争
你要是最近关注过OpenAI、Anthropic和Google的报价,会发现一个挺有意思的现象——三家价格曲线正在以肉眼可见的速度靠拢。
去年这时候什么行情?GPT-4 Turbo高高挂着每百万token 30美元的输入价格,Claude 3 Opus紧随其后要15美元,Gemini Pro用低价策略在旁边试探。
现在呢?
GPT-4o直接把输入价格砍到5美元/百万token,Claude 3.5 Sonnet定在3美元,Gemini 1.5 Pro压到1.25美元。一年时间,顶级模型的推理成本降了80%以上。 这降价速度,比我换手机还快。
我翻了翻Artificial Analysis 12月15号的数据,主流模型的价格-性能比已经明显分成三个梯队:
第一梯队:便宜到离谱
- Gemini 1.5 Flash:输入$0.075/百万token,输出$0.30/百万token
- GPT-4o mini:输入$0.15/百万token,输出$0.60/百万token
第二梯队:日常干活用的
- Claude 3.5 Sonnet:输入$3/百万token,输出$15/百万token
- GPT-4o:输入$5/百万token,输出$15/百万token
- Gemini 1.5 Pro:输入$1.25/百万token,输出$5/百万token
第三梯队:真要动脑子的活
- Claude 3 Opus:输入$15/百万token,输出$75/百万token
- o1-preview:输入$15/百万token,输出$60/百万token
一看这个表,你八成会觉得Google是在做慈善。等等,这里我要更正一下——准确说不是做慈善,是Google的算力成本结构跟别人不一样。这个后面细说。
价格战背后的算盘
去年11月我去旧金山参加了个AI Infra的闭门讨论,跟几个做模型推理优化的哥们聊到半夜。有个之前在Google Cloud搞TPU优化的说了句话,我记到现在:“你看各家定什么价,其实看的是他们的成本焦虑在哪。”
真就是这样。
OpenAI玩的是规模换定价权。 微软在背后砸了几百亿美元建数据中心,光2024年就采购了超过50万张H100。有这体量,OpenAI可以通过批量推理、模型蒸馏、投机解码(speculative decoding,这词听着玄乎,其实就是让小模型先猜答案,猜不中了再叫大模型)把单次推理成本压到极致。GPT-4o mini就是这套路——小模型架构,能力接近大模型,成本是GPT-4 Turbo的1/30。
但OpenAI也有头疼的地方。我注意到o1系列定价明显偏高,输入$15/百万token,输出要$60/百万token。
为啥?
因为o1用的是“思维链推理”,每次回答要在内部跑好几轮,算力消耗是普通模型的3-5倍。这暴露了一个挺尴尬的问题:一旦让模型“思考”,成本就飙上去了。 我估计OpenAI自己也在想办法,但这事儿短期内无解。
Anthropic走的是另一条路——价值定价。 Claude 3.5 Sonnet比GPT-4o便宜点,但绝不是最便宜的。Anthropic赌的是开发者愿意为更安全的模型、200K上下文窗口、更好的指令遵循能力多付点钱。
我自己的体验也确实是这样。上个月我处理一份150页的合同,要做摘要。GPT-4o在文档中间部分会“忘掉”一些关键条款,但Claude 3.5 Sonnet稳得多。这种场景下,那点价差我真不太在意。
嗯...说到Anthropic,圈里有个梗叫“Claude is a good boy”,就是因为它太安全了,有时候你问个稍微擦边的问题它就拒绝回答。不过干活的时候,这种保守反而是优点。
Google的打法最猛——拿价格换市场。 Gemini 1.5 Flash那个$0.075/百万token的定价,基本上就是成本价在卖,可能还略亏。Google的算盘很清楚:我有TPU,有自研推理芯片,边际成本比那些依赖NVIDIA的竞争对手低。而且Google急需在开发者圈子里抢地盘,毕竟云服务这块,AWS和Azure领先太多了。
翻过一次车
这里分享个我踩过的坑,真实经历。
今年9月给一个电商客户搭商品描述生成的pipeline。开始选的GPT-4o,因为它在MMLU和HumanEval这些榜单上看着最漂亮。上线两周后看账单,懵了——比预期高了3倍。
排查了一天,找到两个问题。
第一,prompt写太啰嗦了。我回去一看,好家伙,每次调用平均消耗8000个token的输入。第二,GPT-4o输出速度慢,大概每秒60-80 token,高并发时得多开实例才能维持响应时间,成本直接起飞。
后来改了架构:简单商品(衣服、日用品)用Gemini 1.5 Flash,复杂的电子产品描述用Claude 3.5 Sonnet。整体成本降了62%,质量评分几乎没动——只掉了不到3%。
这一课教会我:别盯着单价看,要算端到端的账。
- Prompt长度和结构
- 平均输出token数
- 推理速度(直接影响并发和超时)
- 重试率
- 不同任务的难度怎么分布
每个坑都是钱。
2025年会怎样?
基于现在的数据和节奏,我觉得明年有三个趋势:
第一,输入价格还会降,输出价格可能稳着甚至涨。 原因不复杂——输入token的处理可以用KV缓存共享、前缀缓存各种优化,但输出token的生成是串行的,优化空间小。而且像o1这种推理模型,输出侧的算力消耗只会更大。
我大概算过,如果o1的推理链平均跑5轮,输出成本就是普通模型的5倍。这个倍数明年可能还会涨。
第二,分层定价会越来越多。 OpenAI已经在试了——GPT-4o mini干简单的,GPT-4o干中等的,o1处理复杂推理。以后可能还有按延迟定价(秒回贵还是等几秒便宜)、按上下文长度定价、甚至按准确率保证定价。
这趋势让我想起AWS的定价史。2006年EC2刚出来时只有一个实例类型,现在呢?几百种。
第三,中国厂商会搅动全球价格。 DeepSeek V3已经把价格压到输入$0.14/百万token,输出$0.28/百万token,性能在好几个基准上接近GPT-4o。Qwen 2.5系列也在猛追。等这些模型通过阿里云、华为云出海,全球定价体系八成要重写。
据我了解,国内几家大厂明年Q1都有降价计划,但具体数字还没公布。
现在该选哪个?
如果你现在就要做技术选型,我的建议:
预算紧、任务简单 → Gemini 1.5 Flash或GPT-4o mini。性价比没得说。
要稳定的生产级性能 → Claude 3.5 Sonnet。200K上下文加优秀的指令遵循,大多数商业场景够了。
复杂推理、数学、代码 → o1-preview或等o1正式版。贵是真贵,但特定任务上提升是质变,值这个钱。
数据敏感、要私有化部署 → 看看DeepSeek V3或Qwen 2.5的开源版。自己托管运维成本高,但长期可能更划算。我们团队最近就在测DeepSeek V3的部署方案,等跑顺了写篇文章分享。
最后留个问题给你:如果明年推理成本再砍一半,你的产品会变成什么样?
我最近老在想这个。它可能比模型能力提升本身更重要。当AI推理便宜到跟水电一样,那些现在看着“不划算”的场景,可能会突然爆出巨大的商业价值。
评论区聊聊你的选型经验和成本优化的心得?我尽量每条都回。
标签: #AI #LLM #OpenAI #Claude #Gemini #技术选型 #成本优化 #2025趋势
读者评论 4