快速回答
GLM-5.3 是智谱(北京)2026 年 8 月发布的旗舰模型系列,包含 GLM-5.3 与 GLM-5.3-Flash 两个档位。其中 GLM-5.3-Flash 就是此前在海外匿名盲测爆火的 Ox Alpha(中文社区叫"牛来模型")。
8 月 26 日晚,智谱正式上线并开源 GLM-5.3-Flash(320B-A18B),MIT 协议,同时证实 8 月 20 日起匿名登录 OpenRouter 和 OpenCode 的 Ox Alpha 就是它的真实身份。这是 GLM-5 系列的首个原生多模态模型。
要点速览:
- 系列构成:GLM-5.3(旗舰档)+ GLM-5.3-Flash(高效档,即 Ox Alpha)
- 规格:总参 320B、激活 18B、92→45 层、104 万 token 上下文
- 性能:AA 综合智能指数 57 分,与 Claude Opus 4.8 持平,超过 DeepSeek V4 Pro 的 53 分
- 多模态:文本 / 图片 / 视频 / 文件输入
- 架构:开源前沿模型首款融合稀疏注意力 + 线性注意力,新增流形约束超连接(mHC)
- 推理:全部流量由 10 万张国产芯片集群承载
- 价格:国内每百万 token 输入 ¥0.8 / 输出 ¥2.8,约为 GLM-5.3 的十分之一;国际 $0.3 / $1.2,约为 Claude Opus 4.8 官方价的四十分之一
GLM-5.3 系列定位
智谱的 GLM 系列是国产大模型的代表性家族,GLM-5.3 则是 2026 年的旗舰换代。整个系列的定位可以这样理解:
GLM-5.2(上一代旗舰)
│
▼
GLM-5.3(2026 旗舰,更强、更贵)
│
├── GLM-5.3:全能力旗舰档,主打完整的多模态与深度推理
│
└── GLM-5.3-Flash:高效开源档(= Ox Alpha / 牛来),
320B-A18B,价格约为 GLM-5.3 的十分之一,
开源(MIT),是当下最受关注的档位
两档分工明确:GLM-5.3 是能力上限,GLM-5.3-Flash 是性价比与开源主力。 绝大多数开发者和团队真正会大量使用的是 Flash——它既是 2026 年 8 月最火的模型事件主角,也是接入门槛最低的档位。
硬参数表
| 项目 | GLM-5.3-Flash |
|---|---|
| 总参数量 | 320B(3200 亿) |
| 激活参数量 | 18B(180 亿) |
| 层数 | 92 → 45 |
| 上下文长度 | 104 万 token |
| 多模态 | 文本 / 图片 / 视频 / 文件输入 |
| AA 综合智能指数 | 57(与 Claude Opus 4.8 持平) |
| 架构 | 稀疏注意力 + 线性注意力融合 + 流形约束超连接(mHC) |
| 开源协议 | MIT |
三个关键解读:
- MoE 结构(320B-A18B):总参 3200 亿、每次激活 180 亿,知识容量达到旗舰级,但单次推理成本被 MoE 机制大幅压低——这正是它能卖到"十分之一价格"的底层原因。
- 92→45 层:相比标准 Transformer 的深堆叠,它把层数压到 45,配合混合注意力架构,换来更长上下文和更低显存开销,支撑 104 万 token 超长上下文。
- 混合注意力 + mHC:这是公开前沿模型里首次把稀疏注意力与线性注意力融合到一起的架构,并新增了流形约束超连接(mHC),让长序列上的信息传递更高效。
多模态能力:原生视觉,自主判断
GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型,支持:
- 文本:常规对话、代码、写作
- 图片:读取并理解图片内容
- 视频:视频输入理解
- 文件:文档 / 文件输入处理
和"文本模型硬接视觉接口"不同,原生多模态意味着视觉理解被整合进模型主干,模型可以自主判断是否调用视觉能力,而不是依赖外部工具拼接。104 万 token 的超长上下文让它可以同时处理大段文本 + 多张图片/多段视频,这是它在长内容分析场景的优势。
价格策略:把旗舰价格打下来
GLM-5.3-Flash 的定价策略是"用架构换成本,用成本换规模"。
国内定价(每百万 token)
| 项目 | 价格 |
|---|---|
| 输入 | ¥0.8 |
| 输出 | ¥2.8 |
约为 GLM-5.3 的 十分之一;限时半价后约 二十分之一。
国际定价(每百万 token)
| 项目 | 价格 |
|---|---|
| 输入 | $0.3 |
| 输出 | $1.2(半价期间 $0.6) |
约为 Claude Opus 4.8 官方价的 四十分之一;智谱官方口径称,综合账单低于调价后的 DeepSeek V4-Flash。
对比一下:DeepSeek V4 Flash 的官方价约 $0.14 / $0.28(每百万 token)。GLM-5.3-Flash 用更高的智能指数(57 vs 53)去打近乎同价位区间的市场,同时用 104 万上下文和原生多模态做差异化。
国产芯片集群:10 万张规模化推理
智谱这次做了一个很关键的决定:GLM-5.3-Flash 的全部推理流量由 10 万张国产芯片集群承载,这是智谱首次大规模用国产芯片做推理。
这件事的意义有两层:
- 供应链自主:不依赖海外高端芯片,规模化验证了国产芯片在旗舰模型推理上的可行性。
- 成本结构:自建国产芯片集群的算力成本显著更低,这是它能报出 ¥0.8/¥2.8 这种价格、并且敢把 62 万亿 token 的匿名流量扛下来的底气。
GLM-5.3 系列为什么值得关注
把这次发布放进 2026 年国产大模型的坐标里看,GLM-5.3 系列至少做到了三件有标志意义的事:
第一,开源模型的智能天花板被抬高一档。 AA 综合智能指数 57 分追平 Claude Opus 4.8,超过 DeepSeek V4 Pro 的 53 分。在此之前,开源模型和闭源旗舰之间总有一条模糊的界线,GLM-5.3-Flash 把这条线再次拉近了——而且是 MIT 协议,可以自由自部署。
第二,架构创新真正落地。 稀疏注意力 + 线性注意力的融合,加上流形约束超连接(mHC),不是宣传口号,而是直接转化为 104 万 token 的上下文、45 层的轻量堆叠和极低的推理成本。它证明了"降低算力开销"和"保持智能"可以同时成立。
第三,国产算力走完规模化验证。 10 万张国产芯片承载全部推理流量,是国产芯片第一次在全球级流量下跑旗舰模型。这一步如果稳定,国产大模型在成本上对海外方案的替代会进一步加速。
对开发者来说,GLM-5.3 系列的实际意义是:又多了一个"便宜、能打、能自己部署"的国产主力选项,而且它在多模态和超长上下文上都有独到优势。
怎么选:GLM-5.3 还是 GLM-5.3-Flash
多数场景直接选 Flash,不必犹豫:
- 日常开发、Agent 主力、代码生成、文档处理:用
glm-5.3-flash。AA 57 分,价格只有 GLM-5.3 的约十分之一,性价比最高。 - 需要更高能力上限、更完整的多模态深度推理:考虑
glm-5.3。它是全能力旗舰档,适合对质量极度敏感、预算充足的任务。 - 想先免费跑起来:用
glm-5.3-flash-free,每天 200 次免费请求,零成本验证。
怎么用 GLM-5.3
官方渠道:ZCode + GLM Coding Plan
智谱官方把 GLM-5.3 系列接入了自家 ZCode 编码平台,开放 API;同时推出 GLM Coding Plan,每日限量发放一万张体验卡。走官方渠道需要抢卡、且在智谱平台内使用。
统一网关:TeamoRouter
如果你想把 GLM-5.3-Flash 接进 Claude Code、Codex 或其他 OpenAI 兼容工具,并和 Claude / GPT / DeepSeek / Kimi 用同一个 Key 统一路由,走 TeamoRouter 更省事。模型 ID:glm-5.3-flash、glm-5.3-flash-free(福利版,每天 200 次)、glm-5.3、glm-5.2。
GLM 走 OpenAI 兼容格式(/v1/chat/completions),base URL https://api.teamorouter.cn/v1,Key 格式 sk-teamo-你的Key:
curl https://api.teamorouter.cn/v1/chat/completions \
-H "Authorization: Bearer sk-teamo-你的Key" \
-H "content-type: application/json" \
-d '{
"model": "glm-5.3-flash",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "解释一下什么是 MoE 架构"}]
}'
Python(openai SDK):
from openai import OpenAI
client = OpenAI(
api_key="sk-teamo-你的Key",
base_url="https://api.teamorouter.cn/v1",
)
resp = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "解释一下什么是 MoE 架构"}],
)
print(resp.choices[0].message.content)
注意:/v1/responses 仅支持 GPT 系列,GLM 要用 /v1/chat/completions。
想白嫖额度,用 glm-5.3-flash-free(每天 200 次),教程见GLM-5.3-Flash 免费额度怎么领。
常见问题(FAQ)
GLM-5.3 和 GLM-5.3-Flash 哪个更好?
GLM-5.3 是旗舰档,能力上限更高;GLM-5.3-Flash(Ox Alpha)是高效开源档,智能指数 57 分与 Claude Opus 4.8 持平,价格约为 GLM-5.3 的十分之一。日常开发、Agent 场景绝大多数用 Flash 就够。
GLM-5.3-Flash 是开源的吗?
是。8 月 26 日以 MIT 协议开源,支持自部署。
Ox Alpha 和 GLM-5.3-Flash 是什么关系?
同一个模型。Ox Alpha 是匿名盲测时的代号(中文昵称"牛来"),GLM-5.3-Flash 是官宣后的正式名称。
GLM-5.3-Flash 支持多模态吗?
支持。文本 / 图片 / 视频 / 文件输入,是 GLM-5 系列首个原生多模态模型,可自主判断调用视觉能力。
怎么在国内免代理调用 GLM-5.3?
用 TeamoRouter 统一网关,国内直连、支付宝按量,一个 sk-teamo- 开头的 Key 即可调用 GLM / Claude / GPT / DeepSeek / Kimi 等多家的模型。
GLM-5.3 和 DeepSeek V4 到底哪个强?
综合智能 GLM-5.3-Flash 领先(AA 57 vs 53),生态成熟度 DeepSeek 更久。完整的六维横评(参数、性能、上下文、多模态、价格、生态)见GLM-5.3 vs DeepSeek V4 vs Kimi K3。
GLM-5.3-Flash 有免费额度吗?
有。TeamoRouter 福利版 glm-5.3-flash-free 每天 200 次免费请求,注册即领,领取与配置教程见GLM-5.3-Flash 免费额度怎么领。
为什么大家都叫它"牛来模型"?
因为它的匿名代号是 Ox Alpha,Ox 英文意为"牛",又赶上电影《牛来》走红,中文开发者就戏称它"牛来大模型"。想听完整故事,见牛来模型(Ox Alpha)是什么。
总结
GLM-5.3 系列是智谱 2026 年 8 月的旗舰之作,而 GLM-5.3-Flash(Ox Alpha / 牛来)是其中的明星:320B-A18B、AA 57 分、104 万上下文、原生多模态、MIT 开源、¥0.8/¥2.8 的定价、10 万张国产芯片承载。它既是当下智能最强的开源模型之一,也是性价比最激进的一个。通过 TeamoRouter,一个 Key 就能把它接入你的全部工具链。
注册 TeamoRouter,接入 GLM-5.3 / GLM-5.3-Flash,一个 Key 统一路由 Claude / GPT / DeepSeek / Kimi / GLM。