国产大模型API每百万Token多少钱?GLM-5.2、DeepSeek-V4 Pro、Kimi-K3与Qwen系列的折扣价怎么算

国产大模型API按百万Token把输入与输出分开计价:GLM-5.2四折后为输入3.2元、输出11.2元每百万Token,DeepSeek-V4 Pro为输入2.7元、输出5.4元每百万Token,Kimi-K3与Qwen系列按六折结算。折扣有时效、分档与缓存规则,实际账单须以厂商当期价目表和平台结算明细为准。

国产大模型API普遍按百万Token计价,输入与输出分开算;在当期折扣下,GLM-5.2为输入3.2元、输出11.2元每百万Token,DeepSeek-V4 Pro为输入2.7元、输出5.4元每百万Token,Kimi-K3与Qwen系列按六折结算。这个答案的适用边界是折扣期与标准档位,它不包含上下文长度加价、缓存命中价、批量推理价等可能另行约定的项目,最终以厂商当期价目表和账单明细为准。 百万Token是计价单位,不是消耗额度,先估算自己的月度Token量再比单价才有意义。中文一个汉字通常对应不到一个Token,英文一个单词往往超过一个Token,同一段提示词换一种语言写,Token量就会变。可行的做法是拿一批真实业务请求跑统计,分别记录输入与输出的Token量,再套单价算出月度成本区间;业务量还没起来时,用最小可用场景先跑一周,得到的比例通常比拍脑袋估算可靠。 输入价与输出价的倍数关系,比单价绝对值更能决定总账。GLM-5.2的输出价是输入价的3.5倍,DeepSeek-V4 Pro是2倍,输出占比越高,两者的总账差距被放大的程度越大。因此做对比时先估输出占比:长文生成、逐字返回的对话属于输出密集,要重点看输出单价;长文档理解、检索增强属于输入密集,才可以优先看输入单价。 四折、六折这类折扣一般来自批量采购或限时促销,不是长期标价。判断能不能依赖,看三件事:折扣有没有明确截止时间,是否限定具体模型版本,是否对上下文长度或并发档位另行加价。三条里任意一条不满足,下一季度的成本测算就必须重算,否则预算会系统性偏离。 把折扣换算成原价有助于判断力度,但只在折扣口径统一时才成立。四折意味着按标价四成结算,六折按六成结算;如果折扣只覆盖部分能力或部分上下文档位,反推出的原价不能直接用于横向比较。记录价格时把折扣条件和适用范围一起写下,比只记一个单价有用得多。 缓存、批处理与失败重试会直接改变实际单价。多数厂商对命中缓存的输入部分给出更低价格,批量接口往往另有一套价格,这些优惠通常不与折扣叠加,或者只作用于输入侧。超时重试会重复消耗Token,限流排队本身不产生费用但会拉长任务时长;核对账单时把缓存命中率单独拉出来看,命中率低的时候,输入侧的优惠对总成本几乎没有影响。 价格表的变更频率高于多数人的预期,这就是需要按季度更新的原因。新版本发布、折扣到期、厂商调整上下文分档,都会让上一季度算出的单价失效。做法是维护一张变更表,字段包括模型名与版本号、输入单价、输出单价、折扣条件与有效期、上下文档位、缓存单价、并发限制、账单核对日期,每季度只更新有变化的行,其余行保持不变。 只看单价做选型,是成本超支最常见的来源。同一条业务链路上,限流策略、超时重试次数、上下文截断方式对Token量的影响,往往大于两个模型之间几毛钱的单价差。评估时用真实请求回放做对比,把失败重试产生的重复消耗计入;另一个常见误差是超长系统提示词被反复发送、每次请求都重复计费,压缩提示词带来的节省往往比换模型更直接。 通过中转或聚合平台调用时,价格之外要额外核对三项能力。是否兼容OpenAI协议决定迁移成本,是否支持多模型路由与Key管理决定故障切换速度,计费是否按量、账单是否可逐条核对决定成本可控度。聚合层给出的单价可能是上游折扣后的价格,也可能在此基础上留出加价,两种都属正常,关键是把折扣有效期与结算口径问清楚。 分档定价是最容易被忽略的一项。同一个模型,短上下文与长上下文的单价可能不同,超过某个长度后单价上浮,而价目表上往往只突出一个数字。做季度对比时,只记录单价而不记录对应档位,下个季度就会得出错误结论;把请求的实际长度分布一起记下来,才能判断上浮会不会真的触发。 单价的比较必须落到同一口径:同一版本、同一档位、同一折扣条件、同一计费单位。把Kimi-K3与Qwen系列的六折价和GLM-5.2、DeepSeek-V4 Pro的四折价并列时,要同时标出各自的标价与有效期,否则六折未必比四折贵,四折也未必比六折便宜,比较结论会随折扣到期而反转。 价格只是选型的一个维度,稳定性与兼容性决定它能否落地。国产模型API在中转层大多已兼容OpenAI协议,切换供应商的改造量通常集中在模型名、参数与返回结构上。真正需要写进成本模型波动区间的是两件事:折扣到期后的价格跳变,以及高峰期限流导致的失败重试开销,前者影响预算上限,后者影响单位任务的实际Token消耗。