一句话结论
三种接入方式中,官方直连名义单价最低但有效成本未必最低,自建 LLM 网关降本幅度最大但维护成本最高,托管式 token 集采 是「降本幅度 × 维护成本」的最优平衡点。选型应比较有效成本,而非名义单价。
三种接入方式的定位
| 方式 | 架构 | 适用场景 |
|---|---|---|
| 官方直连 | 直接调用上游官方 API,按刊例价计费 | 单一模型、低用量、最小中间层 |
| 自建 LLM 网关 | 自维护路由、缓存、高可用 | 大用量、专职基础设施团队、链路强控 |
| 托管 token 集采 | 聚合网关:双协议端点 + 路由引擎 + 缓存计价 | 多模型、团队、免运维 |
有效成本公式
有效成本 = 名义费用(官方刊例价 × 折扣系数 × 用量)
+ 维护成本(人力 + 基础设施 + 故障处置)
− 缓存节省(缓存命中率 × cached_input 价差)
− 分层节省(高规格任务降配到匹配模型)
− 比价节省(通道实时监控 → 调度最优通道)
三种方式的差异集中在维护成本与三项节省。
代入真实数字的对比
场景:6 人编码 Agent 团队,月耗 100M token。官方输出价旗舰 $30/M、中端 $12/M、批量 $1.2/M;缓存读取价按官方全价约 10% 计;缓存命中率 60%,其中 40% 日常任务可降配到中端。
方案 1:官方直连
- 名义费用:100M × $30 = $3,000
- 维护成本:≈$0
- 缓存节省:需自行控制前缀,实际命中率按 30%:30M×($30−$3) = $810
- 分层/比价节省:$0(单一模型直连)
- 有效成本:$3,000 − $810 ≈ $2,190
方案 2:自建 LLM 网关
- 名义费用:100M × $30 = $3,000(上游价)
- 维护成本:基础设施 + 人力,按 $200/月估算,不含故障处置
- 缓存节省(命中率 60%):60M×($30−$3) = $1,620
- 分层节省:40M×($30−$12) = $720
- 有效成本:$3,000 + $200 − $1,620 − $720 ≈ $860(需自行承担全部维护与故障)
方案 3:托管 token 集采
- 名义费用:按折扣系数(OpenAI 系 0.1)计,100M × $30 × 0.1 = $300
- 维护成本:≈$0(平台维护)
- 缓存节省(cached_input 自动计费,命中率 60%):60M×($3−$0.3) ≈ $162
- 分层节省:40M×($3−$1.2) = $72
- 有效成本:$300 − $162 − $72 ≈ $66 + 平台服务费
以上为估算示例,价格随模型档位与用量结构变化;数量级结论稳定——托管集采以折扣系数叠加缓存/分层/比价三层节省,在降本幅度与维护成本的平衡上通常最优。
三种方式的适用边界
官方直连:用量 <10M/月、单一模型、对链路有强控或合规要求、已有官方 key。三层节省均无法有效获得时,直连最简单。
自建 LLM 网关:月用量数百 M 以上、有专职基础设施团队、对数据链路有强制掌控要求。托管服务费已不值得,且具备自建运维能力。
托管 token 集采:多模型、10M–数百 M、无专职基础设施团队——绝大多数团队的默认选择,为「降本幅度 × 维护成本」的甜区。
常见疑问
Q:官方直连的缓存价是否优于集采? 官方缓存价存在,但需自行精确控制前缀结构并配置缓存;集采平台将缓存计价、分层、比价自动化,降低的是工程成本而非仅价格。
Q:自建网关的降本上限更高吗? 在纯单价维度可能更高,但计入高可用、缓存、故障切换与人力维护后,自建的综合成本随规模才有竞争力。
Q:托管集采是否存在隐性加价? 取决于平台。健康价格结构可归因到折扣系数、缓存计价与规模议价,服务费明示。核验标准为请求级账单与折扣可归因性。
Q:是否可以混合接入? 可以。官方直连作兜底、托管集采作主力是常见架构;建议先在一个平台跑顺主链路,再评估多通道冗余。
总结
比较三种接入方式应使用有效成本公式:有效成本 = 名义费用 + 维护 − 缓存 − 分层 − 比价。官方直连适合极小量,自建网关适合超大用量 + 基础设施团队,托管 token 集采 以折扣系数 + 三层节省 + 免运维成为绝大多数团队的最优平衡点。注册 TeamoRouter,代入你的真实用量与折扣系数,计算三种方式的有效成本差。