
GLM-5.3-Flash 是什么?Ox Alpha 真身、价格与使用教程全解
GLM-5.3-Flash 是智谱 2026 年 8 月 26 日发布并开源的原生多模态模型,即 OpenRouter 匿名爆火的 Ox Alpha 真身。本文讲清它的能力实测、价格与使用教程。
GLM-5.3-Flash 是什么?Ox Alpha 真身、价格与使用教程全解
GLM-5.3-Flash 是智谱(Z.ai)2026 年 8 月 26 日正式发布并开源的原生多模态大模型,也是过去一周在 OpenRouter 上匿名爆火的 Ox Alpha 的真身。它拥有 320B 总参数(激活仅 18B)、1M 上下文窗口,支持文本、图片、视频、文件输入,API 价格只有旗舰 GLM-5.3 的十分之一:国内输入 ¥0.4 / 输出 ¥1.4 每百万 tokens(限时五折)。这篇 GLM-5.3-Flash 全解,讲清它的能力实测、真实价格、免费渠道和调用教程。
本文数据核查于 2026 年 8 月 26 日(模型发布当天):模型参数与定价取自智谱开放平台官方页面;OpenRouter 价格经其公开 API 实测返回;开源状态经 HuggingFace 仓库核实;社区反馈综合自 X、Reddit、Hacker News 与 IT之家评论区,全部可溯源。
TL;DR:三句话结论
赶时间的读者直接看结论:
- 是什么:GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型(Ox Alpha 真身),320B 总参数 / 18B 激活,1M 上下文,能看图、看视频、写代码,权重已按 MIT 协议开源。
- 能力:编程和 Agent 能力大幅超过 GLM-5.2(DeepSWE 63.4 对 46.2),逼近 Claude Opus 4.8(63.4 对 58.0);视觉编码(看截图写前端、看蓝图建 3D)是它的独家卖点。
- 怎么选:价格是 GLM-5.3 的 1/10、Claude Opus 4.8 的约 1/100。高频编码、多模态需求、成本敏感,选 Flash;极限文本推理难题留给 GLM-5.3,预算充足的团队再考虑 Claude。
GLM-5.3-Flash 是什么?
GLM-5.3-Flash 是智谱 AI 于 2026 年 8 月 26 日发布的 GLM-5 系列首个原生多模态模型,官方给它的定位是「普惠的全球前沿模型」——用极致低成本的架构,提供超越上代旗舰 GLM-5.2 的智能水平。
几个关键事实:
- 发布时间:2026 年 8 月 26 日,技术博客见 z.ai/blog/glm-5.3-flash,国内接入走智谱开放平台;
- 参数规模:总参数 320B,激活参数仅 18B(MoE 架构),是首个采用稀疏注意力 + 线性注意力混合架构的开源前沿模型;
- 多模态:原生支持文本、图片、视频、文件四种输入,视觉能力被直接融入编码循环;
- 上下文:1M(100 万)tokens,最大输出 128K;
- 开源:权重当天上传 HuggingFace,MIT 协议,支持 SGLang、vLLM、TokenSpeed 本地部署;
- 身份:发布前它以匿名模型 Ox Alpha 的身份在 OpenRouter 免费公测了一周,是当周全球讨论度最高的模型(下文详述)。
一句话定位:这是目前「每块钱能买到的智能」最多的多模态模型——Artificial Analysis 智能指数 v4.1.1 拿到 57 分,单任务成本仅 $0.045,官方称这个智能水平此前要花约 10 倍的价格才能获得。

Ox Alpha 真身确认:一场教科书式的匿名发布
如果你过去一周刷过 AI 资讯,大概率见过「Ox Alpha 牛来大模型」——8 月 20 日晚,OpenRouter 上线了一个匿名模型(ID:stealth/ox-alpha),免费一周、1M 上下文、支持视频输入,DeepSWE 编程基准一度传出 80% 的成绩,全网猜了五天它是谁家的。
8 月 26 日答案揭晓:智谱官方在发布博客中直接确认,Ox Alpha 就是 GLM-5.3-Flash 的匿名测试版,原文写道:「发布前,我们以 ox-alpha 的身份在 OpenCode 和 OpenRouter 上匿名测试了 GLM-5.3-Flash,收集用户反馈。它迅速成为当周最受欢迎的模型——所有这些流量都跑在中国 AI 芯片上。」
完整时间线:
| 日期 | 事件 |
|---|---|
| 8 月 14 日 | 智谱发布旗舰 GLM-5.3(纯文本,编程开源 SOTA) |
| 8 月 20 日晚 | Ox Alpha 匿名上线 OpenRouter,免费一周;OpenCode 宣布免费接入,号称日产能 100T tokens |
| 8 月 20–24 日 | 社区「开盒」:tokenizer 探针 11/11 匹配 GLM、60 项指标比对满分、视频编码器与 GLM-5V-Turbo 逐 token 一致、token 计数与 GLM-5.3 恒定相差 75 |
| 8 月 25 日 | 我们发文判断「Ox Alpha 是 GLM-5.3 家族的多模态变体」:Ox Alpha vs GLM-5.3 深度对比实测 |
| 8 月 26 日 | 智谱发布 GLM-5.3-Flash 并官方认领 Ox Alpha,同日开源权重;据 IT之家报道,智谱在回应彭博社询问时证实了这一猜测 |
这已经是 OpenRouter stealth 玩法的固定剧本:此前的 Pony Alpha 是智谱 GLM-5、Hunter/Healer Alpha 是小米 MiMo、Elephant Alpha 是蚂蚁 Ling——清一色中国实验室,匿名免费试用换社区自发传播和真实压力测试,三方共赢。
顺带一提命名梗:智谱向媒体确认 Ox 的命名灵感来自当时热映的国产电影《牛来》;而 Ox(牛)+ Pony(上一代代号,马)=「牛马」,中文社区已经玩坏了。匿名期间它曾冲上 OpenRouter 日榜第一,社区统计五天累计处理约 2 万亿 tokens——这也解释了为什么免费期它的速度只有 30–50 tokens/秒:用的人实在太多了。
GLM-5.3-Flash 参数与架构:1/10 价格是怎么来的
GLM-5.3-Flash 的便宜不是「缩水」,而是架构层面的重新设计。核心规格一览:
| 项目 | GLM-5.3-Flash | 对比 GLM-5.3 |
|---|---|---|
| 总参数 / 激活参数 | 320B / 18B | 744B / 40B(GLM-5 基座) |
| 上下文窗口 | 1M tokens | 1M tokens |
| 最大输出 | 128K tokens | 128K tokens |
| 输入模态 | 文本 + 图片 + 视频 + 文件 | 仅文本 |
| 注意力计算量 | 基准 | 比 GLM-5.3 低 3.01 倍 |
| KV 缓存大小 | 基准 | 比 GLM-5.3 低 4.44 倍 |
| 推理档位 | low / high / max(默认 max) | 相同 |
| 开源协议 | MIT | 承诺开源(8 月底前后) |
三个值得关注的架构细节(讲人话版):
- 稀疏注意力 + 线性注意力混合:这是首个采用该混合架构的开源前沿模型。线性注意力负责低成本地记住局部上下文,稀疏注意力负责按需检索全局信息——两者配合,让 1M 长上下文的服务成本大幅下降。对比同代模型,它的单 token 注意力计算量是最低的。
- 激活参数减半:与 GLM-4.5 系列相比,总参数相当(320B 对 355B),但激活参数从 32B 降到 18B,层数从 92 减到 45——同等智能水平下,推理需要的算力直接砍半。
- 跑在国产芯片上:免费公测一周的全部流量,都由国产 AI 芯片集群承载。官方基于 SGLang 自建推理引擎(有趣的是,这个引擎的优化工作本身由 GLM-5.3 驱动的 infra agent 加速完成),端到端服务性能提升 3 倍,单 token 成本已与主流 NVIDIA GPU 相当——这也是它能定出 1/10 价格的底层原因之一。
GLM-5.3-Flash 能力实测:编程、Agent、多模态全解析
先看官方公布的完整基准成绩(数据引自智谱官方博客,横评对象为各厂商当前主力型号):
| 基准(考察方向) | GLM-5.3-Flash | GLM-5.2 | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|
| Terminal Bench 2.1(终端任务) | 84.3 | 81.0 | 85.0 | 87.4 | 85.8 |
| DeepSWE v1.1(真实仓库修 Bug) | 63.4 | 46.2 | 58.0 | 69.6 | 65.3 |
| AutomationBench(自动化任务) | 48.8 | 26.2 | 41.0 | 37.2 | 52.3 |
| Toolathlon Verified(工具调用) | 78.4 | 59.9 | 76.2 | 74.9 | - |
| Agents' Last Exam(长程 Agent) | 26.3 | 20.4 | 27.0 | 28.0 | - |
| OfficeQA Pro(办公文档) | 62.4 | - | 48.9 | - | - |
| MVbench(视频理解) | 77.8 | - | 67.1 | 75.0 | 82.2 |
逐项拆解,结论比总分更有价值:
1. 相对 GLM-5.2 是碾压式升级。 DeepSWE 从 46.2 涨到 63.4(+17.2),AutomationBench 从 26.2 涨到 48.8(+22.6)。如果你还在用 GLM-5.2 或同价位模型,这代 Flash 值得直接切换。
2. 编程能力逼近 Claude Opus 4.8。 真实仓库修 Bug 的 DeepSWE 上反超 Opus 4.8 五个百分点;在智谱内部 Z.ai Code Bench(Claude Code 2.1.207 环境跑)的 max 档位上拿到 29.0,几乎追平同环境下的 Opus 4.8(29.5)。与自家旗舰 GLM-5.3 相比(DeepSWE 66.9、Terminal Bench 88.2),Flash 达到旗舰约 95% 的编码水平,价格却只有 1/10。
3. 多模态是真正的独家卖点。 视觉能力被原生融入编码循环:它可以主动「看」渲染结果、截图和界面反馈,自我检查并迭代。两个官方展示的极端案例:没有任何外部素材,自主运行 16 个小时在 Blender 里搭出一套约 400 平方米的专业主厨自宅与测试厨房;从页面截图直接复刻出可运行的 Next.js 工程,自动逐页截图对比修正。办公场景同样受益——OfficeQA Pro 拿到 62.4,比 Opus 4.8 的 48.9 高出 13.5 分,做 PPTX/PDF/XLSX 成品交付时它能自己检查排版溢出和遮挡。
4. 客观说缺点(社区一手反馈)。 匿名公测期间的热度让它被神化了,实际短板包括:当初刷屏的「DeepSWE 80%」是 10 道题的小样本,全量是 63.4;Bach Benchmark 乐谱生成全军覆没;TNG 的测试发现它比 GLM-5.3 多了一层对齐税(alignment tax),部分人格类基准分数更低;免费期间速度只有 30–50 tokens/秒,国内用户吐槽「白嫖老断」「更慢更智能」。转为正式付费服务后,速度表现需要重新观察。
一句话总结:编码摸到第一梯队门槛、多模态是差异化加分项、没有碾压级优势——但看一眼价格,这些缺点都可以原谅。
GLM-5.3-Flash 价格:输入 0.4 元、输出 1.4 元贵不贵
国内智谱开放平台定价(每百万 tokens,2026 年 8 月 26 日实时核查):
| 模型 | 输入 | 输出 | 缓存命中 | 上下文 |
|---|---|---|---|---|
| GLM-5.3-Flash | ¥0.4(原价 ¥0.8) | ¥1.4(原价 ¥2.8) | ¥0.115 | 1M |
| GLM-5.3 | ¥8 | ¥28 | ¥2 | 1M |
| GLM-5.2 | ¥8 | ¥28 | ¥2 | 1M |
| GLM-4.7-Flash | 免费 | 免费 | 免费 | 200K |
两点说明:「5 折限时两周」 截止到 9 月 9 日前后,之后恢复原价 ¥0.8/¥2.8(即便原价也正好是 GLM-5.3 的 1/10);国际版 z.ai 与 OpenRouter 同步五折($0.075/$0.25,同样 9 月 9 日截止),折算下来国内定价还略便宜一点。

单看数字没感觉,做个原创测算。假设一个典型编码任务:输入 10 万 tokens(含代码库上下文),输出 3 万 tokens(生成代码 + 思考过程),无缓存:
| 模型 | 单任务成本 | 相对 Flash |
|---|---|---|
| GLM-5.3-Flash(五折价) | ¥0.08 | 1x |
| GLM-5.3-Flash(原价) | ¥0.16 | 2x |
| GLM-5.3 | ¥1.64 | 20x |
| Claude Opus 4.8 | ¥8.88 | 约 108x |
翻译一下:同样的预算,Flash 能跑约 100 倍于 Claude Opus 4.8 的任务量。一个每天跑 20 个编码任务的重度用户,用 Flash 每月 API 成本不到 40 元;换成 Opus 4.8 是 3,900 元。对个人开发者和中小团队,这就是「用不用得起新一代模型」的分界线。
想进一步省钱的四个渠道:
- 新用户免费额度:智谱开放平台新用户注册送 2,000 万 tokens 资源包,足够把 Flash 的编码和多模态能力都摸一遍;
- GLM Coding Plan 订阅:Flash 已全量上线订阅套餐,可用额度是 GLM-5.3 的 3 倍,非高峰时段(工作日 14:00–18:00 之外 + 周末全天)积分消耗减半——套餐详情和 Lite ¥118 / Pro ¥538 的选择建议,见我们此前的 GLM Coding Plan 订阅详解;
- 永久免费替代:GLM-4.7-Flash 完全免费,适合开发调试和低频任务;
- 本地部署:MIT 协议开源,私有化部署无任何商用限制,详见下文教程一节。
想白嫖多家国产模型的读者,还可以参考我们的 DeepSeek V4 Pro 免费渠道实测指南。
GLM-5.3-Flash 怎么用:API、订阅与本地部署教程
方式一:API 直调(按量计费)
第一步:注册智谱开放平台,控制台创建 API Key(新用户自动获赠 2,000 万 tokens)。
第二步:调用 Chat Completion 接口,模型 ID 填 glm-5.3-flash,端点 https://open.bigmodel.cn/api/paas/v4,同时兼容 OpenAI 与 Anthropic 协议。官方推荐参数:temperature: 1、top_p: 0.95、reasoning_effort: max。
图片理解的写法(在 messages[].content[] 中加 image_url 内容块,多图就加多个块):
from zai import ZhipuAiClient
client = ZhipuAiClient(api_key="YOUR_API_KEY")
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://你的图片地址.png"}},
{"type": "text", "text": "把这个页面截图复刻成可运行的 Next.js 组件"}
]
}],
thinking={"type": "enabled"}, # 只支持 enabled,思考不可关闭
reasoning_effort="max", # low / high / max,默认 max
temperature=1.0,
top_p=0.95,
max_tokens=65536,
)
print(response.choices[0].message.content)
方式二:接入编程工具(订阅用户)
订阅 GLM Coding Plan 后,在 Claude Code、Cline、OpenCode、ZCode 等 20+ 官方支持的工具中都能直接使用,Flash 额度为 GLM-5.3 的 3 倍。以 Claude Code 为例,把 baseurl 指向 https://open.bigmodel.cn/api/anthropic 并填入 API Key 即可。在官方 ZCode 中还能解锁它的 Browser Use / Computer Use 能力——模型自己点开网页、看渲染结果、修 Bug 的完整闭环。
方式三:OpenRouter 国际通道
OpenRouter 上的匿名入口 stealth/ox-alpha 已随揭晓下线,替换为正式的 z-ai/glm-5.3-flash(我们 8 月 26 日经其 API 实测:输入 $0.075 / 输出 $0.25 每百万 tokens,1M 上下文)。海外开发者或需要统一网关聚合多家模型的场景适用,接入方法与此前 Ox Alpha 的接入教程完全一致,只是模型 ID 换了。
方式四:本地部署(免费但吃显存)
权重在 HuggingFace:zai-org/GLM-5.3-Flash,MIT 协议。官方目前支持 SGLang、vLLM、TokenSpeed 三个推理框架,提供了 FP8 量化版本。注意 320B 总参数的模型满血部署需要多卡服务器;个人设备建议直接用 API,五折价格下本地部署的电费未必更划算。

四个容易踩的坑
- 思考不可关闭:
thinking.type只接受enabled,想省 token 用reasoning_effort: "low",别想着关思考; - 视频输入按秒计费:视频约每秒消耗 147 tokens(2 秒短视频 ≈ 296 tokens),长视频理解注意成本;
- 套餐与 API 别混用:订阅额度只能在官方指定工具里用,自建应用调 API 走按量计费,报「1113 余额不足」多半是 baseurl 配错;
- 海外还有匿名版幻觉:网上大量「Ox Alpha 免费用」的教程已过时,免费窗口 8 月 27 日前后结束,现在走正式入口。
GLM-5.3-Flash vs GLM-5.3:怎么选
两兄弟同天在架(GLM-5.3 8 月 14 日发布、Flash 8 月 26 日发布),选择逻辑其实很清晰:
| 维度 | GLM-5.3-Flash | GLM-5.3(旗舰) |
|---|---|---|
| 定位 | 普惠多模态 | 极限推理 |
| 输入模态 | 文本 + 图片 + 视频 + 文件 | 仅文本 |
| API 价格(输入/输出) | ¥0.4 / ¥1.4 | ¥8 / ¥28 |
| DeepSWE v1.1 | 63.4 | 66.9 |
| Terminal Bench 2.1 | 84.3 | 88.2 |
| Agents' Last Exam | 26.3 | 28.5 |
| Coding Plan 可用额度 | 3x | 1x |
| 开源 | 已开源(MIT) | 承诺 8 月底开源 |
选择建议:
- 日常工程任务、高频调用、看预算:选 Flash。95% 的旗舰编码能力、1/10 的价格、还送多模态和 3 倍订阅额度;
- 极限难题、纯文本深度推理:选 GLM-5.3。最难的架构级任务上旗舰仍领先 3–4 分,且网络安全(漏洞挖掘)能力是旗舰独有强项;
- 需要看图/看视频干活:只能选 Flash,旗舰不支持视觉输入。
旗舰版的完整评测(包括与 Claude Fable 5、GPT-5.6 Sol 的对比和 Coding Plan 套餐选择),见我们此前的 GLM-5.3 深度评测。

总结:GLM-5.3-Flash 适合谁用
分人群给结论:
- 个人开发者 / 学生:首选。五折期间单次编码任务成本不到一毛钱,新用户 2,000 万免费 tokens 起步, ¥118/月的 Lite 套餐额度直接给到 3 倍;
- 中小团队 / 创业公司:强烈推荐。同样预算下迭代次数比 Claude 多两个数量级,多模态能力还能顺手解决「截图转代码」「文档成品交付」这类此前要人工兜底的场景;
- 有多模态需求的工程师:前端复刻、游戏原型、3D 场景、视频理解剪辑、Computer Use——这些「模型自己看效果自己改」的任务,它是当前价格内唯一的前沿级选择;
- 需要私有化部署的企业:MIT 协议 + 混合注意力架构对推理硬件友好,FP8 权重开箱可用。
GLM-5.3-Flash 的发布把「前沿智能」的价格打到了一个新的低位,而 Ox Alpha 这场教科书式的匿名营销,会让它成为 2026 年下半年被讨论最多的国产模型之一。更多模型评测与 AI 编程工具横评,欢迎持续关注 XIA345 AI 指南。
数据来源:本文基准与架构数据引自 智谱 GLM-5.3-Flash 官方技术博客与官方模型文档;国内定价于 2026 年 8 月 26 日核查自智谱开放平台定价页;OpenRouter 价格经其公开 API 实测;开源状态经 HuggingFace 仓库核实;媒体报道引自 IT之家。价格以各官方页面实时数据为准。
常见问题
GLM-5.3-Flash 免费吗?
不免费,但极其便宜。API 按量计费:输入 ¥0.4 / 输出 ¥1.4 每百万 tokens(限时五折至 9 月 9 日,原价 ¥0.8/¥2.8)。免费途径有三条:智谱开放平台新用户注册送 2,000 万 tokens;GLM Coding Plan 订阅用户可直接使用且额度是 GLM-5.3 的 3 倍;MIT 协议开源,可本地部署。此前 OpenRouter 上 Ox Alpha 的免费公测窗口已于 8 月 27 日前后结束。
GLM-5.3-Flash 和 GLM-5.3 有什么区别?
三个核心区别:一是模态,Flash 原生支持图片、视频、文件输入,GLM-5.3 仅支持文本;二是价格,Flash 是 GLM-5.3 的 1/10(¥0.4/¥1.4 对 ¥8/¥28);三是定位,Flash 主打普惠和高性价比(编程能力约为旗舰的 95%),GLM-5.3 主打极限推理和网络安全能力。订阅套餐里 Flash 的可用额度是 GLM-5.3 的 3 倍。
Ox Alpha 是 GLM-5.3-Flash 吗?
是。智谱在 2026 年 8 月 26 日的官方发布博客中明确确认:发布前以 ox-alpha 的代号在 OpenCode 和 OpenRouter 上匿名测试了 GLM-5.3-Flash。此前社区通过 tokenizer 指纹(11/11 匹配)、60 项指标比对、视频编码器行为等多条独立路径得出了相同结论,完整证据链见我们的 [Ox Alpha vs GLM-5.3 对比实测](/ai-guide/ox-alpha-vs-glm-5-3)。
GLM-5.3-Flash 支持图片和视频输入吗?
支持。它是 GLM-5 系列首个原生多模态模型,输入支持文本、图片、视频和文件四种模态,API 写法是在 messages 的 content 数组里添加 image_url 内容块。视频约按每秒 147 tokens 计费。视觉能力不止是「看图回答」——它能看渲染截图自我纠错、看界面操作电脑(CUA)、看长视频做剪辑整理。
GLM-5.3-Flash 怎么调用?
国内走智谱开放平台:端点 https://open.bigmodel.cn/api/paas/v4 ,模型 ID 填 glm-5.3-flash,兼容 OpenAI 和 Anthropic 协议,Python SDK 用 zai-sdk;海外走 z.ai 或 OpenRouter(模型 ID:z-ai/glm-5.3-flash,$0.075/$0.25 每百万 tokens)。推荐参数:temperature 1、top_p 0.95、reasoning_effort max。订阅 GLM Coding Plan 后也可在 Claude Code、Cline、ZCode 等 20+ 工具中直接使用。
GLM-5.3-Flash 开源了吗?能本地部署吗?
已开源。2026 年 8 月 26 日发布当天,权重上传至 HuggingFace(zai-org/GLM-5.3-Flash),采用 MIT 协议,商用无限制。本地部署目前官方支持 SGLang、vLLM 和 TokenSpeed 三个推理框架,并提供 FP8 量化版本;注意满血部署 320B 模型需要多卡服务器,个人设备建议直接用 API。

京ICP备2024094994号-29