博客

牛来模型(Ox Alpha)是什么?GLM-5.3-Flash 匿名真身全解读

快速回答

牛来模型就是 Ox Alpha,而 Ox Alpha 是智谱 GLM-5.3-Flash 的匿名盲测身份。

2026 年 8 月 20 日起,一款代号 Ox Alpha 的神秘模型以隐身形态登陆 OpenRouter 和 OpenCode,在没有官方背书的情况下靠实力杀到前台:上线首日冲上 OpenRouter 榜首并刷新平台单日用量纪录(达此前峰值的 4 倍),在 OpenCode 终结了 DeepSeek 连续 56 天的霸榜。中文开发者因为 Ox 英文意为"牛",又赶上电影《牛来》走红,干脆叫它"牛来大模型"。

8 月 26 日晚,智谱(北京)正式揭晓:Ox Alpha 就是它当晚开源的新模型 GLM-5.3-Flash(320B-A18B),MIT 协议,GLM-5 系列首个原生多模态模型。

要点速览:

  • 身份:Ox Alpha(牛来)= GLM-5.3-Flash
  • 规格:总参 320B、激活 18B、92→45 层、104 万 token 超长上下文
  • 性能:AA 综合智能指数 57 分,与 Anthropic Claude Opus 4.8 持平,超过 DeepSeek V4 Pro 的 53 分
  • 战绩:匿名 6 天全球消耗约 62 万亿 token,单周占 OpenRouter 近 20% 流量,使用量超 DeepSeek 一倍以上
  • 价格:国内输入 ¥0.8 / 输出 ¥2.8(每百万 token),约为 GLM-5.3 的十分之一;国际 $0.3 / $1.2,约为 Claude Opus 4.8 官方价的四十分之一
  • 怎么用:TeamoRouter 已接入 glm-5.3-flash 与福利版 glm-5.3-flash-free(每天 200 次免费请求)

下面是完整拆解。

从"牛来"到 GLM-5.3-Flash:一场六天的匿名盲测

Ox Alpha 不是一上来就暴露身份的。它经历了一场为期六天、完全匿名的全球盲测,这也是 2026 年最具戏剧性的一次模型发布。

8 月 20 日:隐身上线

Ox Alpha 以匿名模型身份悄悄登陆 OpenRouter 和 OpenCode 两个平台。开发者只知道它叫 Ox Alpha,不知道它来自哪家公司、用了什么架构——只能靠真实效果投票。这种"用脚投票"的盲测方式,一旦表现不行,就会在没有任何官方解释的情况下消失。

首日:登顶 + 破纪录

上线第一天,Ox Alpha 就冲上 OpenRouter 榜首,并刷新了平台单日用量纪录——达到此前峰值的 4 倍。这是非常罕见的现象:不是靠营销推量,而是真实用户在试用后主动把流量涌进来。

在 OpenCode 终结 DeepSeek 的 56 天连冠

在 OpenCode 平台上,Ox Alpha 直接终结了 DeepSeek 连续 56 天霸榜的纪录。DeepSeek 自年初以来几乎就是开源模型的流量王者,被一个无名模型挤下榜首,立刻在开发者社区引爆讨论。

六天消耗约 62 万亿 token

从 8 月 20 日到 8 月 26 日官宣,Ox Alpha 六天全球消耗约 62 万亿 token,单周占 OpenRouter 近 20% 的流量,使用量超过 DeepSeek 一倍以上。在模型圈,这个用量规模几乎等于"一个行业级爆款"的入场券。

8 月 26 日晚:身份揭晓

智谱官宣:Ox Alpha 就是当晚正式上线并开源的 GLM-5.3-Flash。谜底揭开的瞬间,社区发现"原来牛来大模型是国产的智谱",热度进一步引爆。智谱(02513.HK)发布后收涨 12.62%,市值重返 5000 亿港元。

这次匿名盲测为什么特别

Ox Alpha 走红的路径,和过去几年的模型发布完全不一样。

过去一款新模型上线,通常伴随铺天盖地的官方宣传、基准测试榜单、创始人对谈。开发者被说服的方式是"品牌 + 数据"。而 Ox Alpha 什么都没有——它是一张没有署名的面孔,登录在 OpenRouter 和 OpenCode 上,唯一能验证它实力的方式,就是真实跑一跑。

结果证明,"用脚投票"比任何营销都有效。开发者不会因为一个名字好听就疯狂调 API,却会因为一个模型真的又快又好用,把流量从其他模型上搬过来。六天 62 万亿 token 的消耗量,就是最真实的用户评价。

这背后还有一个更值得注意的信号:模型之间的差距正在被缩小到"凭实力说话"的程度。 当一个匿名模型能靠真实体验登顶、刷新纪录,说明用户越来越不关心"这是谁家的",只关心"它能不能解决我的问题"。对开发者来说,这反而是好事——选模型的标准变得更纯粹了。

为什么叫"牛来"

"牛来"这个外号有两层巧合:

  • Ox 在英文里就是"牛"的意思,模型名自带牛属性。
  • 恰逢电影《牛来》走红,中文开发者顺口把它称作"牛来大模型"。

于是"Ox Alpha = 牛来"就成了中文社区最流行的叫法。现在你在中文技术社区里搜"牛来模型",指的基本就是它。

GLM-5.3-Flash 硬参数表

项目 参数
总参数量 320B(3200 亿)
激活参数量 18B(180 亿)
层数 92 → 45
上下文长度 104 万 token
多模态 文本 / 图片 / 视频 / 文件输入
AA 综合智能指数 57(与 Claude Opus 4.8 持平)
架构 稀疏注意力 + 线性注意力融合,新增流形约束超连接(mHC)
开源协议 MIT
推理芯片 全部流量由 10 万张国产芯片集群承载

几个值得注意的解读:

  1. 320B-A18B 是典型的 MoE 结构:总参 3200 亿、每次只激活 180 亿,意味着它拥有旗舰级的"知识储备",但单次推理只跑一小部分参数,成本被压到很低。
  2. 层数从 92 压到 45:配合稀疏 + 线性混合注意力,换来的是更长的上下文和更低的推理开销,这是它能做到 104 万 token 上下文的关键。
  3. AA 指数 57 分:Artificial Analysis 的综合智能指数 57 分,与 Anthropic Claude Opus 4.8 持平,高于 GLM-5.2 和 DeepSeek V4 Pro 的 53 分。也就是说,在开源阵营里,它是目前智能指数最高的那一档。

价格有多狠

GLM-5.3-Flash 的价格策略比它的性能更激进。

国内定价(每百万 token)

项目 价格
输入 ¥0.8
输出 ¥2.8

这个价格约为 GLM-5.3 的 十分之一;限时半价后更是只有约 二十分之一

国际定价(每百万 token)

项目 价格
输入 $0.3
输出 $1.2(半价期间 $0.6)

约为 Claude Opus 4.8 官方价的 四十分之一;智谱官方口径称,综合账单甚至低于调价后的 DeepSeek V4-Flash。

翻译成人话:国产开源模型的智能指数追平了全球最贵的闭源旗舰,价格却只有它的四十分之一。 这正是 Ox Alpha 能在匿名盲测里靠真实体验冲上榜首的根本原因——性能和价格的双重碾压。

和 DeepSeek V4 / Claude Opus 4.8 的一句话对比

  • vs DeepSeek V4 Pro:AA 指数 57 > 53,匿名期在 OpenRouter 的使用量超 DeepSeek 一倍以上;两者都是"便宜到接近免费"的开源路线,GLM-5.3-Flash 官方口径综合账单更低。
  • vs Claude Opus 4.8:AA 指数同为 57,智能上打平;但国际价格只有 Opus 4.8 官方价的约四十分之一,开源且可自部署。

简单说:闭源旗舰的性能,开源的价格。 更详细的国产三强横评(GLM-5.3 / DeepSeek V4 / Kimi K3)见GLM-5.3 vs DeepSeek V4 vs Kimi K3:2026 国产大模型三强横评

怎么用起来:TeamoRouter 上直接调

TeamoRouter 已经接入 GLM-5.3 系列,模型 ID 为 glm-5.3-flashglm-5.3glm-5.2,另有福利版 glm-5.3-flash-free(每天 200 次免费请求)。GLM 走 OpenAI 兼容格式,用 /v1/chat/completions/v1/responses 仅支持 GPT 系列,GLM 不能用)。

一个 Key 就能同时路由 Claude / GPT / DeepSeek / Kimi / GLM / Gemini / Grok,统一计费。示例(curl):

bash
curl https://api.teamorouter.cn/v1/chat/completions \
  -H "Authorization: Bearer sk-teamo-你的Key" \
  -H "content-type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "max_tokens": 1024,
    "messages": [{"role": "user", "content": "用一段话介绍 GLM-5.3-Flash"}]
  }'

Python(openai SDK):

python
from openai import OpenAI

client = OpenAI(
    api_key="sk-teamo-你的Key",
    base_url="https://api.teamorouter.cn/v1",
)

resp = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "用一段话介绍 GLM-5.3-Flash"}],
)
print(resp.choices[0].message.content)

想先白嫖额度、不花一分钱跑起来,直接看GLM-5.3-Flash 免费额度怎么领:每天 200 次

这对开发者意味着什么

GLM-5.3-Flash 的出现,把"最强开源模型"和"最便宜的旗舰 API"这两件事合并到了一起:

  1. 开源不再是"差一点"的代名词。 AA 指数 57 分与 Claude Opus 4.8 持平,MIT 开源,意味着你可以用开源模型达到闭源旗舰的智能水平。
  2. 价格战进入新阶段。 国际价格约为 Claude Opus 4.8 官方价的四十分之一,国内定价更是把门槛拉低到几乎可以忽略。开发者第一次可以用"随便跑"的心态去调用一个旗舰级模型。
  3. 国产芯片规模化落地。 10 万张国产芯片承载全部推理流量,说明国产算力已经能扛住全球级流量,这对依赖海外算力的开发者是个重要的替代信号。
  4. 多模态成为默认配置。 104 万 token 上下文 + 原生文本/图片/视频/文件输入,让"一个模型干所有事"成为可能。

对普通开发者,最直接的动作就是:注册一个 TeamoRouter Key,把 glm-5.3-flash(或免费版 glm-5.3-flash-free)接进你现有的 Claude Code、Codex 或任何 OpenAI 兼容工具,用一两天感受一下这个"牛来"到底有多能打。

常见问题(FAQ)

Ox Alpha 和 GLM-5.3-Flash 是同一个模型吗?

是。Ox Alpha 是智谱在 8 月 20 日放出的匿名盲测身份,8 月 26 日官宣它就是 GLM-5.3-Flash。两者是同一个模型的前后两个名字。

牛来模型为什么叫"牛来"?

Ox 英文意为"牛",恰好电影《牛来》走红,中文开发者就戏称它为"牛来大模型"。

GLM-5.3-Flash 是开源的吗?

是。智谱 8 月 26 日以 MIT 协议开源,可以自部署、自托管,这也是它价格能压到极低的原因之一。

怎么在 TeamoRouter 上免费使用?

用福利版模型 ID glm-5.3-flash-free,每天 200 次免费请求。额度耗尽后切换付费版 glm-5.3-flash 即可,同一个 Key 不用换。

GLM-5.3-Flash 和 GLM-5.3 有什么区别?

GLM-5.3 是旗舰档,GLM-5.3-Flash 是高效档(就是 Ox Alpha),价格只有 GLM-5.3 的约十分之一。绝大多数场景用 Flash 就够。

总结

牛来模型(Ox Alpha)是 2026 年 8 月最值得关注的一次国产模型爆发:用六天匿名盲测证明了自己,用 320B-A18B + AA 57 分证明了实力,用 ¥0.8/¥2.8 的价格证明了性价比。 现在它已经接入 TeamoRouter,一个 Key 即可免费 200 次/天试用、付费无缝切换。

注册 TeamoRouter,立刻把牛来模型(GLM-5.3-Flash)接入你的 Claude Code、Codex 或任何 OpenAI 兼容工具。

准备好接入了吗?登录控制台 · 购买额度 · 创建 API Key,三步即可开始。
牛来模型(Ox Alpha)是什么?GLM-5.3-Flash 匿名真身全解读 · TeamoRouter