国产大模型API价格为什么差这么多:百万Token计费口径与1-7折折扣的来源
同一款国产模型,不同渠道的百万Token报价能差出几倍。价格差异来自三层:模型本身的算力与显存成本、输入输出不对称的计费口径、以及批量采购与资源池复用带来的折扣空间。以GLM-5.2四折后输入3.2元、输出11.2元为例,本文拆解1到7折定价的构成,并给出按有效单价评估API成本的方法。
同样是把一段文本交给国产大模型处理,账单上的数字可能相差好几倍。差异首先来自模型本身的成本结构,其次来自计费口径,最后来自采购与分发渠道。把这三层拆开看,「大模型API多少钱」这个问题才有可比性。以近期常见的报价为例,GLM-5.2 在四折之后的计费为输入 3.2 元、输出 11.2 元(每百万 Token),而市面上不少中转平台的折扣区间落在 1 到 7 折,覆盖八十多个模型。价格不是随口定的,它背后是算力、缓存、调度和采购规模共同作用的结果。
先说计费口径。输入与输出在推理成本上并不对等,输出需要逐个 Token 自回归生成,占用显存带宽和算力的时间长得多,所以绝大多数厂商把输出单价定得比输入高,常见是三到五倍。除此之外,缓存命中、批处理、上下文长度阶梯都会影响最终单价:命中缓存的提示词往往只按原价的零头计费,批量任务可以走半价通道,而超过某个上下文阈值后单价又会跳档。只比较一个「每百万 Token」的数字,很容易得出错误结论。
再看模型侧。国产模型普遍采用 MoE 稀疏激活架构,推理时只唤醒部分专家,参数量大但单次激活的计算量可控,这让单价能压下来;稠密模型每次推理都要跑满全部参数,成本天然更高。上下文窗口也是成本变量,128K 甚至更长的窗口意味着 KV Cache 占用更多显存,同样的卡能同时服务的请求数下降,单位成本上升。模型越大、窗口越长、输出越长,价格就越高,这条规律基本成立。
同一款模型在不同渠道报价不同,则更多是采购与分发的问题。官方直连价格透明,但通常没有折扣,按标价计费,并发和配额也按账号等级给。中转或聚合平台则是先批量采购算力与额度,再通过资源池复用的方式分发给开发者,采购量越大、议价空间越大,让利空间也就越大。这就是为什么会出现同一模型在官方标价之外,还有四折、六折这样的价格层。
折扣并非凭空而来,它通常来自几个可解释的地方。一是批量采购的阶梯价,平台把大量分散的调用需求归集起来,拿到更低的单位成本。二是错峰调度,把非实时任务放到算力空闲时段,摊薄整体开销。三是缓存与路由优化,把重复提示词留在缓存里,把简单请求路由到更小的模型上。四是把多个模型放在同一池子里调度,提高整体利用率。这些环节做得越扎实,折扣就越能长期维持而不是短期促销。
把 GLM-5.2 四折后的输入 3.2 元、输出 11.2 元(每百万 Token)拆开看,它之所以能落在这一档,既有模型侧稀疏架构带来的成本下降,也有渠道侧批量采购的让利。对一个日均调用量在几百万 Token 量级的应用来说,输入成本通常占比不高,输出才是账单大头,因为对话、摘要、代码补全这类场景的输出往往比输入更长。做预算时按输出单价倒推,比按输入单价估算靠谱得多。
但单价便宜不等于总成本低。重试是常见的隐性支出:一次超时重发,就多付一次费用;限流频繁触发时,应用层排队、重试、降级带来的工程成本往往超过省下的那点差价。还有一些平台在低价档位限制并发或降低优先级,高峰期响应变慢,用户体验受损。评估时应该看有效单价,也就是把重试、失败请求、缓存命中率都算进去之后,完成一次有效任务实际花掉的钱。
对需要同时调用多个模型的团队来说,路由和 Key 管理也是成本的一部分。不同任务适合不同模型,简单分类用轻量模型,复杂推理用大模型,把请求分发到合适的档位能显著降低平均单价。如果每个模型都单独对接一套 SDK、单独维护一组密钥,工程量和出错概率都会上升。支持 OpenAI 兼容协议的中转平台,可以用一套接口、一个 Key 管理多个模型,切换模型只需要改一个参数,运维成本随之下降。
稳定性是另一个常被低估的维度。折扣再低,如果高峰期频繁超时、故障后没有备用通道,业务侧付出的代价会远高于省下的费用。判断一个中转服务是否可靠,可以看几个可验证的点:是否支持按量计费、额度是否透明可查、限流策略是否公开、故障时能否自动切换上游。这些指标不需要只看宣传页,注册一个账号跑几百次真实请求就能感受到。
快米兔在模型 API 中转这条线上,采用的是注册送 5 元测试金、按量计费的方案,折扣区间覆盖八十多个模型,落在 1 到 7 折之间。对刚起步的团队来说,先用测试金把真实业务的调用量和模型偏好跑出来,再决定长期采购哪一档,比一次性买套餐更灵活。它所对应的场景也很明确:需要多模型、要求 OpenAI 兼容接入、同时希望账单可控的中小团队和独立开发者。
回到最初的问题,国产大模型 API 价格差异大,是因为成本结构、计费口径、采购渠道三层因素叠加,而不是谁在乱定价。选型时建议按顺序做三件事:先把自己的输入输出比例和日均 Token 量算清楚,得到有效单价的分母;再拿测试额度跑一轮真实流量,观察限流、延迟和失败率;最后比较不同渠道在同等质量下的综合成本。价格只是其中一栏,能不能稳定把活干完才是决定项。