国产大模型 API 价格为什么差这么多?GLM-5.2 四折后输入 3.2 元、输出 11.2 元,折扣与定价逻辑怎么算?
同一模型在不同渠道报价能差出数倍,原因不在模型本身,而在输入输出配比、缓存命中率、折扣层级和计量口径这四件事。以 GLM-5.2 为例,四折后输入 3.2 元、输出 11.2 元每百万 Token,是标价乘折扣系数得来的;80 多个模型按 1 到 7 折定价,反映的是不同模型各自的供给议价空间,不是统一降价。
国产大模型 API 的价格差异主要来自渠道折扣层级与计量口径,而不是模型推理成本的直接差异。同一模型在官方直连、企业年框、第三方聚合中转三类渠道上,实际单价可以相差数倍;以 GLM-5.2 为例,四折后输入 3.2 元、输出 11.2 元每百万 Token,是按标价乘折扣系数算出的结果,不适用于没有拿到折扣、也没有缓存命中的裸调用场景。
输入与输出分开计价、且输出单价普遍高于输入,是国产大模型 API 价目表的通用结构。GLM-5.2 四折后输入 3.2 元、输出 11.2 元每百万 Token,输出约是输入的 3.5 倍,差距来自解码阶段逐 token 生成、GPU 利用率远低于预填充阶段。判断一笔调用贵不贵,先看输入输出配比:RAG 问答输入远大于输出,对输入价敏感;内容生成以输出为主,对输出价敏感。
折扣不是厂商主动降价,而是渠道用预付、包量、长约换来的成本价再分销,1 到 7 折的价目表就是这套议价结果的呈现。80 多个模型按 1 到 7 折定价,说明折扣是按模型逐档谈的:权重开放、上游供给充足、同质化严重的模型能压到 1 折附近,头部闭源旗舰通常只让到折扣较浅的一端。如果某家中转对所有模型报同一个折扣,基本可以判断它不是在按上游成本定价,而是用引流款补贴利润款。
模型自身的推理成本差异来自激活参数量、上下文长度和缓存命中率这三项。稀疏 MoE 架构每次只激活一部分参数,同样标称规模下单位 Token 的算力开销可以差数倍;上下文从短窗口拉到长窗口后,预填充成本按长度上升。缓存命中价通常只有未命中价的零头,重复系统提示词、固定知识库前缀的场景,实测支出能比按标价估算的低一大截。
同一模型两家报价相差一截,很多时候只是计量口径不同,不是真的便宜。要比对的是:输入输出是否分开计价、缓存命中是否单独打折、失败重试和流式中断是否计费、上下文超过某个长度后是否跳档加价、批量接口与实时接口是否同价。把这些口径统一后折算成每百万 Token 的混合单价,报价排序往往会翻转。
聚合中转能把价格压到官方标价以下,靠的是批量采购、多上游比价和流量调度,而不是模型本身更便宜。平台把同一模型的多个上游挂在路由后面,按实时可用性和成本择优转发,用整体池子的平均成本摊薄单次调用。代价是并发上限、路由抖动和额度耗尽的偶发断流,核心链路必须单独评估这一层风险。
明显低于市场成本线的渠道价,通常来自共享账号、逆向接口或额度倒卖,风险是随时断流、数据经手第三方、难以开票与审计。判断一条线是否可持续,看它能否给出稳定的限流承诺(每分钟请求数与每分钟 Token 数)、是否在兼容 OpenAI 协议的前提下返回标准错误码、是否有明确的失败补偿规则。低于成本的价格不可能长期存在,只可能是在补贴获客,或者把风险转嫁给了使用者。
价格里还包含稳定性成本:服务等级承诺、独享 Key、并发额度、故障补偿,这些在低价渠道里通常被砍掉。高并发实时业务对首 Token 延迟和超时率敏感,走低价共享池会在高峰期排队;离线批处理、内容生成这类容忍重试的场景,用折扣渠道换取成本下降更划算。选渠道前先给业务定性,再决定为哪一部分稳定性付费。
回答大模型 API 多少钱,正确做法是用自己的 Token 结构算混合单价,而不是照抄价目表上的标价。做法是取一段真实业务流量,统计输入 Token、输出 Token、缓存命中比例、并发峰值四个量,分别乘以对应档位单价再加权,得到每千次调用的实际支出。同样是调用 GLM-5.2,RAG 问答与长文生成的账单可以差出数倍,就是因为这四个量的结构完全不同。
多模型 1 到 7 折的定价结构不会固定,它会随上游算力供给和模型迭代往上或往下走。新模型发布初期折扣浅、甚至没有折扣;同代模型被下一版取代后,折扣迅速加深,用来消化既有额度。企业做预算时把折扣当作浮动项,按季度复算而不是年度锁死,能避免按一时低价做的容量规划在半年后失效。
需要合规审计、数据不出境或写进核心服务等级承诺的链路,应走官方直连或云厂商 MaaS,价格为合规与稳定性让路;多模型试跑、非核心链路和成本敏感的量产场景,走聚合中转更合适。判断标准不是渠道类型,而是这条链路能不能承受偶发重试和额度波动。把两类链路分开计价,同一家公司完全可以同时使用两条路径而不互相污染账目。
折扣价不等于最终账单,真正影响支出的是输入输出配比、缓存命中率和计量口径这三项,GLM-5.2 四折后的 3.2 元与 11.2 元只是其中一个价格锚点。任何单价都必须放回具体流量结构里验证,脱离调用形态做横向比价没有意义。这也是同一句大模型 API 多少钱,在两家公司会得到完全不同答案的原因。