我熬夜排查8000美元账单,发现了大模型价格战最脏的真相
2025 大模型 API 价格战:0.0001 元/千 tokens 背后的技术军备竞赛
上周三凌晨两点,我被 PagerDuty 的告警炸醒了。
生产环境 GPT-4o 调用量暴涨 300%,账单预估多出 8000 美元。我眯着眼翻 Grafana,那条成本曲线几乎是垂直的。排查到凌晨四点,发现是某条业务线搞的——他们看到 DeepSeek 降价到每百万 tokens 0.1 元,直接把所有非核心场景切过去了,但代码里有个 fallback 逻辑的 bug,失败请求疯狂回源到 OpenAI。
我当时盯着屏幕,脑子里就一个念头:这帮大模型厂商打价格战,最后熬夜擦屁股的永远是工程师。
价格战打到什么程度了?
先甩组数据。我整理了 2024 年 1 月到 2025 年 3 月主流模型的价格变化:
| 时间 | 模型 | 输入价格(元/百万tokens) | 输出价格 | 降幅 |
|------|------|------------------------|----------|------|
| 2024.01 | GPT-4 Turbo | 72 | 216 | - |
| 2024.05 | DeepSeek V2 | 1 | 2 | 对标降97% |
| 2024.08 | 通义千问 Qwen-Long | 0.5 | 2 | - |
| 2024.12 | 豆包 Doubao-Pro | 0.8 | 2 | - |
| 2025.01 | DeepSeek V3 | 0.1 | 0.3 | 再降90% |
| 2025.02 | 百度文心 4.0 Turbo | 0.12 | 0.36 | 跟进 |
| 2025.03 | 智谱 GLM-4-Flash | 免费 | 免费 | 掀桌子 |
14 个月,从 72 块到免费。这降价速度比我司裁员还快。
等等,这里我要更正一下——上面说的 GLM-4-Flash 免费,其实不是完全没限制。我后来实测发现,免费版有严格的 QPS 限制,大概每秒 5 个请求,超过就直接 429。想放开限制?请升级企业版。所以这个「免费」更像是带钓鱼竿的试用装。
但数字背后还有更多猫腻。我实际压测过这些超低价模型,发现不少厂商玩的是变相限流。比如某个标价 0.1 元/百万 tokens 的模型,并发一超过 50 就开始排队,延迟从 200ms 飙到 30 秒。你以为是捡便宜,实际上是买了个带手刹的法拉利。
技术博弈第一层:推理成本的极限压缩
价格能打到这个程度,底层技术确实有真东西。我前两个月在团队内部做过一次技术调研,把各家降成本的路线梳理了一下。
MoE 架构的工程化落地
DeepSeek V2/V3 是最激进的。他们把 Mixture of Experts 的激活参数压到了总参数的 5% 以下。什么意思呢?模型虽然有 671B 参数,但每次推理只唤醒一小部分专家。就像你公司有 200 个员工,每个项目只需要 10 个人干活,其他人在工位上摸鱼——算力成本直接除以 20。
# 伪代码理解 MoE 的路由逻辑
def moe_forward(x, experts, router):
# 只激活 top-k 个专家
weights, indices = router.top_k(x, k=2)
output = 0
for w, idx in zip(weights, indices):
output += w * experts[idx](x)
return output # 只有 2/160 个专家被激活但这里有个坑。我们生产环境踩过,印象特别深。
MoE 模型的显存占用一点没少,因为所有专家都要加载到 GPU 里等着被叫号。671B 参数的模型,8 卡 H100 勉强跑起来,推理部署成本其实比同效果的 Dense 模型更高。DeepSeek 的 API 能便宜,是因为他们自己扛硬件成本,走的是超大规模集群+高利用率路线。小厂根本玩不起这个。
FP8 量化 + 投机采样
字节的豆包模型在量化上做得比较激进。他们内部用的 FP8 混合精度训练和推理,相比 FP16 直接省了一半显存带宽。再加上投机采样,用小模型先快速生成候选 token,大模型再验证,实际吞吐能提升 2-3 倍。
我在自己的测试环境跑过投机采样的 benchmark:
# vLLM 开启投机采样
python -m vllm.entrypoints.openai.api_server \
--model doubao-pro-32k \
--speculative-model doubao-lite-32k \
--num-speculative-tokens 5 \
--dtype fp8结果单卡 H100 的吞吐从 1200 tokens/s 干到了 3100 tokens/s。这技术不是新东西,但 2024 年下半年才真正工程化成熟。之前各种框架对投机采样的支持都是实验性的,动不动就 OOM 或者精度漂移。我记得 vLLM 0.5.0 之前,开投机采样大概率会在跑 20 分钟后挂掉,日志里一堆 CUDA out of memory。
推理调度优化的暗战
这块最容易被忽略,但其实是成本大头。
大模型 API 的 GPU 利用率普遍不到 50%,因为请求是波峰波谷的。谁能做好 batching 和调度,谁就能把成本打下来。据我了解,某头部厂商通过动态 batching + 请求优先级队列,把 H100 集群的利用率从 42% 提升到了 78%。同样的硬件,能多接近一倍的请求量。降价的底气就是这么来的。
嗯...这个比较复杂,我其实也没完全搞懂他们的调度算法。但大致思路是:把延迟不敏感的离线任务(比如数据标注、评测)和在线请求混部,用离线任务填 GPU 的空闲碎片。听起来简单,做起来全是坑——内存管理、显存碎片、调度延迟,每个都能让你掉一层皮。
技术博弈第二层:模型能力趋同后的差异化困境
说实话,2025 年初这些模型的基座能力已经拉不开代差了。我让团队做过一个内部评测,用 200 道我们业务场景的真实 prompt 去测 GPT-4o、DeepSeek V3、Qwen-Long、豆包 Pro,结果是:
- 代码生成:GPT-4o ≈ DeepSeek V3 > Qwen-Long > 豆包
- 长文本理解:Qwen-Long > DeepSeek V3 > GPT-4o > 豆包
- 中文创作:豆包 ≈ Qwen-Long > DeepSeek V3 > GPT-4o
- 指令遵循:GPT-4o > DeepSeek V3 > 豆包 > Qwen-Long
差异基本在 5% 以内。这就导致一个很现实的问题:当模型能力差不多的时候,价格就是唯一的决策因素。
但这里有一个我踩过的血泪教训。
去年 11 月我们为了省钱,把一个客服摘要场景从 GPT-4o 切到了某个低价模型。评测集上分数只低了 3 个点,结果上线一周后业务方投诉:摘要里开始出现幻觉,把用户没说过的话编进去了。回头看才发现,评测集覆盖的都是常规 case,但线上有 15% 的长尾场景——多人对话、方言转写错误、上下文超长——低价模型在这些 case 上表现断崖式下跌。
所以我现在给团队定的原则是:核心链路用贵的,边缘场景用便宜的,但 fallback 机制必须做好。
# 我们的模型路由配置
routes:
- name: customer_service_summary
primary:
model: qwen-long-32k
max_tokens: 2000
timeout: 15s
fallback:
model: gpt-4o
condition: "primary.error_rate > 0.05 OR primary.latency_p99 > 10s"
cost_limit:
daily: 500 # 美元
action: "alert_and_throttle"这套配置救过我至少三次。上个月有一次 Qwen-Long 的 API 突然大面积超时,fallback 自动切到 GPT-4o,业务侧完全无感。当然账单多了 200 刀,但比起被业务方追杀,这钱花得值。
免费模型的真实意图
智谱 GLM-4-Flash 宣布免费的时候,我第一反应不是「真香」,而是「他们想干嘛」。
后来跟几个做 infra 的朋友聊,大家判断基本一致:免费模型是数据飞轮的入口。你用的越多,他们拿到的真实 prompt 越多,这些数据经过清洗和标注,就能用来训练下一代模型。相当于你用他们的 API,还倒贴数据给他们。
这不是阴谋论。OpenAI 的 terms 里明确写了会收集 API 数据用于训练(企业版可以 opt-out,但默认是开启的),国内厂商的隐私政策我仔细读过几家,措辞都相当模糊。对于 toC 场景可能无所谓,但如果是处理企业敏感数据,我建议还是看清楚协议,或者干脆走私有化部署。
另外还有一个被忽略的点:免费模型的 SLA 基本为零。
我测试过 GLM-4-Flash 的可用性,2 月 17 号到 3 月 19 号这一个月里,有 3 天出现过超过 5 分钟的不可用窗口,而且没有任何提前通知。最长的一次挂了 23 分钟,返回的全是 503 Service Temporarily Unavailable。生产环境敢用的,我只能说心大。
未来格局:我看到的三个趋势
基于这段时间的观察和跟同行交流,我对 2025 年下半年到 2026 年的判断:
推理成本还会降,但降幅会收窄。 硬件层面,H200 和 B100 的铺货会让单卡推理能力再提升 2-3 倍。但算法层面的优化空间在变小,MoE、量化、投机采样这几板斧已经砍得差不多了。我预估到 2025 年底,头部模型的 API 价格会稳定在每百万 tokens 0.05-0.1 元区间,再往下降厂商就要亏现金流了。
模型会分层,价格战从基座转向应用。 现在的情况是基座模型卷价格,但应用层——RAG、Agent、Workflow——还有很大溢价空间。我最近在对接几家企业的 AI 改造需求,发现他们愿意为「开箱即用的行业解决方案」付钱,而不是裸调 API。大概 2025 年下半年,会看到更多垂直场景模型+工具链的打包产品,价格反而会回升。
开源模型的 API 化会倒逼闭源厂商。 DeepSeek 开源的 V3 权重,理论上任何人下载下来自己部署,推理成本可以做到 API 价格的 1/3。现在缺的只是易用性。等到 vLLM、SGLang 这些框架把 MoE 支持做得更成熟,一键部署脚本满天飞的时候,闭源厂商的定价权会被进一步削弱。我猜这也是为什么 OpenAI 和 Google 在疯狂推 Agent 和多模态——纯文本模型的护城河已经没了。
最后说点实在的
作为每天跟 API 打交道的工程师,我对这波价格战的态度是:短期利好,长期警惕。
利好的是创新成本大幅降低。去年我们做内部 hackathon,三天烧了 2000 刀 API 费用,现在同样的项目 50 刀搞定。但警惕的是:依赖单一厂商的廉价 API,等于把命脉交到别人手里。万一哪天他们撑不住涨价或者改协议,你的整个产品可能就崩了。
我的建议很简单:
1. 做好模型抽象层,随时能切换供应商
2. 核心场景保留私有化部署能力,哪怕只用开源小模型
3. 监控成本和质量并重,别光看单价,要看实际业务效果
对了,前几天看到 Anthropic 发了 Claude 3.5 Haiku,价格也砍了一半。这价格战一时半会停不了。
你们现在生产环境在用什么模型?有没有被这波降价影响到?评论区聊聊,我最近在整理各家的真实压测数据,回头可以分享出来。
标签: #大模型API #价格战 #DeepSeek #技术架构 #成本优化 #2025趋势
读者评论 5