博客

Token 集采为什么便宜?成本构成与缓存命中率拆解

一句话结论

token 集采 的价格优势不是来源不明的低价,而是四层工程的结果:折扣系数、缓存计价、模型分层、通道比价。评价一个集采平台,应比较其有效成本(effective cost),而非名义单价。

先看真实价格结构:折扣系数 × 缓存价

以官方刊例价与平台折扣系数为例(每百万 token):

模型档位 官方输出价 平台折扣系数 平台输出价
旗舰(GPT-5.6 Sol 级) $30 0.1(1 折) $3
性价比(GPT-5.6 Terra 级) $12 0.1(1 折) $1.2
批量(DeepSeek V4 Flash 级) $1.2 ~官方价 ≈$1.2

缓存侧,命中部分按**缓存读取价(cached_input)**独立计费,可低至官方全价的约 10%。名义折扣解决「单价」,缓存计价解决「重复内容」——两者是正交的降本维度,叠加后的有效成本远低于任一单独维度。

有效成本的四层构成

text
有效成本 = 名义单价 × 用量
          × 折扣系数(供应商议价 + 用量规模)
          − 缓存节省(缓存命中率 × 缓存价差)
          − 分层节省(高规格任务降配到匹配模型)
          − 比价节省(通道质量实时监控 → 调度最优通道)

第 1 层:折扣系数(供应商议价 + 用量规模)

平台以第一方供应商聚合与优质分销渠道获得议价权,再按厂商设折扣系数(如 OpenAI 系 1 折、Anthropic 系 2 折、Google 系 2 折)。折扣随累计用量浮动,规模越大议价空间越大。

第 2 层:缓存计价(最被低估的降本点)

编码 Agent 的请求具有高度重复的前缀结构(system prompt、角色设定、上下文骨架),命中前缀缓存后按 cached_input 计价。量化示例:官方输出 $12/M、缓存读取价 $1.2/M,月耗 80M token、命中率 60%:

  • 未启用缓存计价:80M × $12 = $960
  • 启用缓存计价(60% 命中):32M × $12 + 48M × $1.2 = $441.6
  • 仅缓存一层即降本约 54%

第 3 层:模型分层(按任务复杂度匹配规格)

旗舰模型的能力用于疑难推理,日常与批量任务路由到规格匹配的模型。量化示例:月耗 100M token,官方输出价旗舰 $30/M、中端 $12/M、批量 $1.2/M:

  • 全旗舰:100M × $30 = $3,000
  • 分层(30% 旗舰 + 40% 中端 + 30% 批量):30×30 + 40×12 + 30×1.2 = $1,416
  • 模型分层即降本约 53%,且质量损失可忽略——因高规格资源仅分配给高价值任务。

第 4 层:通道比价(实时调度最优通道)

平台路由引擎实时监控各通道的延迟(TTFT)、稳定性与价格,将请求调度至当前性价比最优通道;单一上游涨价或故障时自动切换。这一层解决的是供应商绑定带来的成本与可用性风险。

什么「便宜」不能碰

名义单价显著低于上游成本、且无法归因到上述任一工程层级的低价,通常对应共享额度、异常渠道或缺失缓存能力:

  • 共享额度:并发特征异常,触发上游风控批量封禁;
  • 异常渠道:额度来源不明,可用性无保障;
  • 缺失缓存计价的伪低价:名义单价低,但无 cached_input 计费,重复内容按全价计费,有效成本反而更高。

判别公式

text
可解释低价 = 折扣系数(≤50%) + 缓存计价(≥30~50% 命中) + 模型分层(≥40~50%) + 通道比价(有限)
不可解释低价 = 上述四项均无法归因,且名义单价低 30% 以上  →  排除

常见疑问

Q:缓存命中率由什么决定? 由请求前缀的稳定性决定。将 system prompt、角色设定、few-shot 示例固定为稳定前缀,即可提升命中率。网关侧按 cached_input 自动识别并计费。

Q:折扣系数与官方价的关系? 折扣系数由供应商议价与用量规模决定(如 OpenAI 系 1 折),随累计用量浮动;健康的价格结构始终可解释、可审计。

Q:模型分层是否影响输出质量? 取决于分级是否合理。按任务复杂度与价值分级,而非随机降配;高价值任务仍路由至旗舰模型。

Q:官方直连也能享受缓存价吗? 可以,但需自行精确控制前缀结构并配置缓存,且缺乏分层路由与通道比价。集采平台的价值在于将缓存计价、分层与比价自动化

总结

token 集采 的价格优势 = 折扣系数 + 缓存计价 + 模型分层 + 通道比价四层工程。缓存与分层两层叠加通常可将有效成本降低 50% 以上。以有效成本评估平台,并警惕无法归因的低价。注册 TeamoRouter,以 GPT 1 折 / Claude 2 折折扣与 cached_input 缓存计价核验你的有效成本。

准备好接入了吗?登录控制台 · 购买额度 · 创建 API Key,三步即可开始。
Token 集采为什么便宜?成本构成与缓存命中率拆解 · TeamoRouter