按量计费8700元,订阅制能省40%但高峰期会限速
上周我们团队收到账单,GPT-4 API 花了 8700 块,老板直接在群里@我三个问号。隔壁组用某厂的订阅制,一个月固定 2000,用超了还被限速,气得他们在工位骂娘。
这事让我彻底想搞清楚一个问题:大模型 API 到底该按量计费还是走订阅制?
先说结论:没有银弹,但大部分团队都在花冤枉钱。
我的血泪账单
先给你们看看过去半年的花费曲线:
- 3月(产品刚上线):日均调用 200 次,月底账单 1200,感觉还行
- 4月(开始推流):日均调用 800 次,账单跳到 4300,开始肉疼
- 5月(做了个活动):峰值一天 5000 次调用,当月直接 8700
问题出在哪?我们用的是按量计费,但流量波动根本不可控。
那个活动是我们运营临时起意搞的“AI 年度总结”,用户上传数据我们调 GPT-4 生成报告。结果分享率爆炸,一天涌进来 3000 多个新用户。我凌晨两点被报警叫醒,看着费用蹭蹭涨,那种感觉就像忘了关热水器。
后来我算了一笔账:如果当时买的是某厂的订阅制(2000/月,包 5 万次调用),超出的部分按阶梯价走,那个月最多 5000 块。直接省了 40%。
但故事没这么简单。
订阅制的坑,我替你们踩过了
看到上面你是不是觉得无脑上订阅就完了?等等。
我们另一个项目(内部用的数据分析工具)之前买了某大厂的年包订阅,一年 3 万,不限调用次数。听起来很香对吧?
结果用了三个月发现不对劲:API 响应越来越慢。
找他们技术一问,原话是“订阅制用户在资源紧张时优先级低于按量付费用户”。翻译成人话就是:高峰期你排队,大客户先走。
更恶心的是,他们所谓的“不限次数”有个隐藏条款——QPM(每分钟查询数)限制。我们做批量分析的时候,直接被限流,任务从 10 分钟跑成了 2 小时。
等等,这里我要更正一下。刚才说的 QPM 限制,其实不是完全“隐藏”的。我后来翻文档,在第 47 页找到了,原文是“订阅制用户默认 QPM 为 60,如需提升请提交工单”。但提交工单要等 3-5 个工作日,还要提供业务场景说明。嗯...这个就比较微妙了,说白了就是设个门槛让你知难而退。
这个项目后来我们切回了按量计费,虽然每月多花 500 左右,但至少不用看人脸色。
三个真实数据点
我跟几个朋友聊了一圈,收集了他们的情况(数据脱敏处理):
案例 1:创业团队做 AI 客服
- 调用量:日均 3000-5000 次,比较稳定
- 模型:GPT-3.5 为主,少量 GPT-4
- 选择:订阅制,月费 5000
- 如果用按量:大概 7000-9000/月
- **省了约 35%**
案例 2:独立开发者做写作工具
- 调用量:极不稳定,有时一天 0 调用,有时一天 200 次
- 模型:Claude 3 Sonnet
- 选择:按量计费
- 月均花费:300-800 块
- 如果用订阅:最低档也要 1500/月
- **按量完胜**
案例 3:中型 SaaS 做代码审查
- 调用量:工作日高,周末低,波动大
- 模型:GPT-4 重度使用
- 选择:基础订阅(覆盖 60% 用量)+ 按量兜底
- 月均花费:1.2 万
- 如果纯按量:1.8 万左右
- 如果纯订阅(高档):1.5 万但有限速风险
- **混合方案最优**
我觉得案例 3 这种情况其实挺普遍的。据我了解,国内做 SaaS 的团队,只要是 B 端业务,调用模式基本都是这个形状——周一到周五白天是峰值,晚上和周末就掉下来。纯订阅覆盖不了峰值,纯按量又太贵。
我总结的决策框架
踩了这么多坑,我现在帮团队选计费方式就看三个变量:
1. 调用量可预测性
- 稳定的 → 订阅制优先
- 波动大的 → 按量或混合
2. 延迟敏感度
- 实时场景(客服、对话)→ 按量,别省这个钱
- 异步场景(报表、批处理)→ 订阅制可以忍
3. 预算管理方式
- 需要严格控制成本 → 订阅制,超了自动限速
- 可以接受弹性支出 → 按量,但一定要设告警
真得设告警。
我们 5 月那次事故之后,我用 Grafana 搭了个监控面板,设了两道线:日消耗超过 200 块飞书通知,超过 500 块自动切备用模型。到现在没再出过事。
还有个野路子:多供应商策略。
我们现在同时接了三家:主力用 A 厂的订阅制(便宜),高峰期自动切 B 厂的按量(快),C 厂作为灾备。中间件自己写了个简单的路由,基于 litellm 改的,大概 200 行代码。
litellm 这个库 2024 年 10 月之后支持了 fallback 机制,但默认的轮询策略太蠢了。我加了两个规则:一是按 QPM 余量动态分配,二是同模型优先走订阅渠道。具体配置我放 GitHub 了,链接在评论区。
这样下来,月均成本控制在 5000 以内,比之前单用一家省了 40% 多。
最后说点得罪人的话
现在国内这些大厂的定价策略,说白了就是在玩信息差。
按量计费贵得离谱,就是吃准了你“先用后付”的心理。订阅制看起来划算,但 SLA 不透明,限速规则藏在文档第 47 页。
我的建议是:别信他们的定价页,自己跑一周的压测再说。
先用按量计费跑一周,拿到真实的调用数据(频次、token 分布、峰值时段),然后拿着这些数据去跟各家销售谈。记住,所有价格都可以谈,尤其是订阅制。
我们当时拿着数据去谈,某厂直接把订阅价从 3000 砍到 1800,就因为我们能证明“高峰期在凌晨,不跟他们的大客户抢资源”。
2025 年 1 月 Anthropic 发了价目表调整通知,Claude 3.5 Sonnet 的按量价格降了 25%。我猜国内这帮厂商今年也得跟着降,不降就等着被卷死吧。
你们现在用的是哪种计费方式?有没有被坑过的经历?评论区聊聊,我看看是不是只有我们被限流过。
Edit:没想到这么多人问那个路由中间件,我整理一下代码下周发出来,先关注不迷路。
#大模型API #成本优化 #技术选型 #创业踩坑 #API计费
读者评论 2