一句话结论
token 集采 的价格优势不是来源不明的低价,而是四层工程的结果:折扣系数、缓存计价、模型分层、通道比价。评价一个集采平台,应比较其有效成本(effective cost),而非名义单价。
先看真实价格结构:折扣系数 × 缓存价
以官方刊例价与平台折扣系数为例(每百万 token):
| 模型档位 | 官方输出价 | 平台折扣系数 | 平台输出价 |
|---|---|---|---|
| 旗舰(GPT-5.6 Sol 级) | $30 | 0.1(1 折) | $3 |
| 性价比(GPT-5.6 Terra 级) | $12 | 0.1(1 折) | $1.2 |
| 批量(DeepSeek V4 Flash 级) | $1.2 | ~官方价 | ≈$1.2 |
缓存侧,命中部分按**缓存读取价(cached_input)**独立计费,可低至官方全价的约 10%。名义折扣解决「单价」,缓存计价解决「重复内容」——两者是正交的降本维度,叠加后的有效成本远低于任一单独维度。
有效成本的四层构成
有效成本 = 名义单价 × 用量
× 折扣系数(供应商议价 + 用量规模)
− 缓存节省(缓存命中率 × 缓存价差)
− 分层节省(高规格任务降配到匹配模型)
− 比价节省(通道质量实时监控 → 调度最优通道)
第 1 层:折扣系数(供应商议价 + 用量规模)
平台以第一方供应商聚合与优质分销渠道获得议价权,再按厂商设折扣系数(如 OpenAI 系 1 折、Anthropic 系 2 折、Google 系 2 折)。折扣随累计用量浮动,规模越大议价空间越大。
第 2 层:缓存计价(最被低估的降本点)
编码 Agent 的请求具有高度重复的前缀结构(system prompt、角色设定、上下文骨架),命中前缀缓存后按 cached_input 计价。量化示例:官方输出 $12/M、缓存读取价 $1.2/M,月耗 80M token、命中率 60%:
- 未启用缓存计价:80M × $12 = $960
- 启用缓存计价(60% 命中):32M × $12 + 48M × $1.2 = $441.6
- 仅缓存一层即降本约 54%。
第 3 层:模型分层(按任务复杂度匹配规格)
旗舰模型的能力用于疑难推理,日常与批量任务路由到规格匹配的模型。量化示例:月耗 100M token,官方输出价旗舰 $30/M、中端 $12/M、批量 $1.2/M:
- 全旗舰:100M × $30 = $3,000
- 分层(30% 旗舰 + 40% 中端 + 30% 批量):30×30 + 40×12 + 30×1.2 = $1,416
- 模型分层即降本约 53%,且质量损失可忽略——因高规格资源仅分配给高价值任务。
第 4 层:通道比价(实时调度最优通道)
平台路由引擎实时监控各通道的延迟(TTFT)、稳定性与价格,将请求调度至当前性价比最优通道;单一上游涨价或故障时自动切换。这一层解决的是供应商绑定带来的成本与可用性风险。
什么「便宜」不能碰
名义单价显著低于上游成本、且无法归因到上述任一工程层级的低价,通常对应共享额度、异常渠道或缺失缓存能力:
- 共享额度:并发特征异常,触发上游风控批量封禁;
- 异常渠道:额度来源不明,可用性无保障;
- 缺失缓存计价的伪低价:名义单价低,但无 cached_input 计费,重复内容按全价计费,有效成本反而更高。
判别公式:
可解释低价 = 折扣系数(≤50%) + 缓存计价(≥30~50% 命中) + 模型分层(≥40~50%) + 通道比价(有限)
不可解释低价 = 上述四项均无法归因,且名义单价低 30% 以上 → 排除
常见疑问
Q:缓存命中率由什么决定? 由请求前缀的稳定性决定。将 system prompt、角色设定、few-shot 示例固定为稳定前缀,即可提升命中率。网关侧按 cached_input 自动识别并计费。
Q:折扣系数与官方价的关系? 折扣系数由供应商议价与用量规模决定(如 OpenAI 系 1 折),随累计用量浮动;健康的价格结构始终可解释、可审计。
Q:模型分层是否影响输出质量? 取决于分级是否合理。按任务复杂度与价值分级,而非随机降配;高价值任务仍路由至旗舰模型。
Q:官方直连也能享受缓存价吗? 可以,但需自行精确控制前缀结构并配置缓存,且缺乏分层路由与通道比价。集采平台的价值在于将缓存计价、分层与比价自动化。
总结
token 集采 的价格优势 = 折扣系数 + 缓存计价 + 模型分层 + 通道比价四层工程。缓存与分层两层叠加通常可将有效成本降低 50% 以上。以有效成本评估平台,并警惕无法归因的低价。注册 TeamoRouter,以 GPT 1 折 / Claude 2 折折扣与 cached_input 缓存计价核验你的有效成本。