← 返回资讯
苏晴
资深编辑
已审核

一张图算200还是800token?多模态模型计费规则比你想的复杂

上周我们团队在搞一个图片审核的项目,把市面上几家多模态大模型的API报价拉出来比了一圈。结果你猜怎么着——同样的需求,不同厂商的价格能差出10倍。我当时对着屏幕愣了好几秒,这要是不仔细算,月底账单绝对能吓死人。

一张图算200还是800token?多模态模型计费规则比你想的复杂

一张图算200还是800token?多模态模型计费规则比你想的复杂


上周我们团队在搞一个图片审核的项目,把市面上几家多模态大模型的API报价拉出来比了一圈。结果你猜怎么着——同样的需求,不同厂商的价格能差出10倍。我当时对着屏幕愣了好几秒,这要是不仔细算,月底账单绝对能吓死人。

所以今天咱们就来盘一盘,2025年国内主流多模态大模型API按token计费的真实价格。顺便聊聊我在实际调用中踩过的坑,有些坑真的是一脚一个。


为什么按token计费这么重要?

简单说,多模态模型的输入不只是文字,还包括图片、音频、视频。这些内容被切分成token后,计费逻辑就变得很复杂。

举个例子,一张1024x1024的图片,不同模型可能算成200个token,也可能算成800个token。你如果不搞清楚这个换算规则,预算根本没法做。

我去年11月就犯过这个错。当时用某家模型处理一批产品图,以为图片token按最低档算,结果账单出来翻了3倍。后来查了半天文档才发现,高分辨率模式下图片token是按"图块"累加的,一张大图能吃掉上千token。那个月被领导问预算为什么超了,我只能硬着头皮解释,场面一度非常尴尬。


2025年主流多模态API价格横评

我整理了目前国内开发者用得比较多的几家,价格数据截止到2025年3月15号。不过我得先说清楚——各家随时可能调整,我上周就发现有一家悄悄改了计费规则,所以你们用的时候还是以官网为准。

1. OpenAI(GPT-4o / GPT-4o-mini)

虽然OpenAI不是国内厂商,但很多团队还在用,所以放进来做参照。

,GPT-4o的价格对国内中小团队来说还是偏贵。我们当时测了1000张图的审核任务,用GPT-4o花了将近$18,换成GPT-4o-mini只要$1.2,准确率差不到5%。所以除非你真的需要顶尖推理能力,否则mini版性价比高很多。省下来的钱够请全组喝好几轮奶茶了。

2. 智谱 GLM-4V

智谱是国内多模态做得比较早的,GLM-4V现在也支持图片和视频输入。我记得他们2024年初那波更新挺猛的,当时圈子里都在讨论。

我特别喜欢他们的Flash版本,做原型验证的时候完全不花钱。但正式上线还是得切到Plus,因为Flash的并发限制比较严格,高峰期容易排队。有一次下午三点多调用,直接给我返回了个429,等了快两分钟才恢复。

等等,这里我要更正一下——我上面说的429错误其实不是Flash版的问题,是我当时没处理好重试逻辑,请求堆在一起触发了限流。后来加了指数退避就好了,这个锅不该甩给智谱。

另外智谱有个坑:视频输入是按帧抽取算token的,1分钟视频大概能吃掉15000 token。我们之前没注意这个,传了几个5分钟的视频做测试,一天就烧掉了预算的30%。当时看到那个消耗曲线,整个人都不好了。

3. 阿里通义千问(Qwen-VL)

阿里的Qwen-VL系列最近更新很勤快,价格也比较有竞争力。据我了解他们2024年底发的那版Max模型,在一些benchmark上已经跟GPT-4o打得有来有回了。

注意,Qwen的图片token计算偏"实诚"。同样一张图它算出来的token数比其他家多不少,所以虽然单价看着低,实际总花费要自己跑一遍才知道。

我们当时拿100张电商图做对比测试,Qwen-VL-Plus总花费¥0.47,GLM-4V-Plus花了¥0.38,但Qwen对复杂场景的理解确实更准一些。所以这东西不能光看价格,得结合准确率一起评估。嗯...这个其实比较复杂,因为准确率这个东西跟你的具体场景强相关,别人测出来的数据参考意义有限。

4. 百度文心一言(ERNIE-VilG)

百度的多模态模型在中文场景表现不错,但价格结构稍微复杂一点。我觉得他们那个计费文档写得有点绕,第一次看的时候我反复读了三遍才搞明白。

这个"按张数"的计费方式其实挺有意思的,对于图片数量稳定、分辨率不高的场景反而好算预算。但如果你传的是高清大图,百度内部还是会按分辨率加收费用,文档里写得很隐晦,我是在账单里发现的。当时我还跑去问了他们的技术支持,确认了半天。

5. 讯飞星火

讯飞在多模态上发力比较晚,但价格确实便宜。2024年下半年他们更新了一版模型,能力提升了不少,不过跟前面几家比还是有差距。

这个固定150 token的策略太省心了,做预算的时候完全不用猜。但代价是模型能力确实比前面几家弱一些,复杂场景的图片理解偶尔会翻车。我们测过一个识别商品瑕疵的场景,准确率大概比Qwen低了七八个点。


我踩过的三个坑

坑1:忽略输出token的费用

很多人只看输入价格,觉得"我传图片多,输出就一句话,输出费用可以忽略"。大错特错。

实际上,如果你让模型做详细描述或结构化输出,输出token可能比输入还多。我们有个做商品描述的功能,输入一张图300 token,输出一段JSON描述800 token,输出费用是输入的好几倍。第一次看到那个账单拆分的时候,我才意识到自己之前有多天真。

坑2:测试环境的价格错觉

各家都有免费或极低价的测试档位,但正式API的并发能力和测试档完全不一样。我见过一个团队用免费版测得好好的,上线切到付费版后,因为并发量上去触发了限流,被迫升级到更高价格的实例,预算直接翻倍。那个团队的负责人后来在群里吐槽说"测试环境就是最大的诈骗"。

坑3:图片预处理能省不少钱

这个是我最近才意识到的。很多模型对图片分辨率敏感,你传一张4000x3000的原图,它内部会缩放但照样按大图算token。如果你在客户端先压缩到1024x1024以内,token消耗能降60%以上,而且对准确率影响很小。

我们现在的流程是强制前端用Sharp压缩,配的参数是resize(1024, 1024, {fit: 'inside'}),然后转成WebP格式,质量设85%。这一套下来,每月能省下大概30%的API费用。真金白银的省钱。


选型建议

先说好,这只是我个人的看法,你们参考一下就行:

最后想说,这些价格我写文章的时候还是准的,但大模型API的价格变动比天气还快。建议大家做决策前自己跑一轮真实数据测试。我们团队现在的做法是,每个月初拉一份各家的最新报价,然后跑一个200张图的基准测试,看性价比变化。这个习惯帮我躲过了好几次突然涨价。

你们在用哪家的多模态API?有没有遇到过什么离谱的账单?评论区聊聊呗,说不定能帮大家避避坑 ☕


#多模态大模型 #API价格 #token计费 #开发成本 #2025技术选型 #人工智能

603
10054 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月27日 18:40

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

技术小白 昨天
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 4天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)
A
AI研究员 1周前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 1周前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)