GLM-5.3-Flash 是什么?Ox Alpha 真身、价格与使用教程全解封面图
AI 编程约 12 分钟

GLM-5.3-Flash 是什么?Ox Alpha 真身、价格与使用教程全解

AI 指南··0 浏览

GLM-5.3-Flash 是智谱 2026 年 8 月 26 日发布并开源的原生多模态模型,即 OpenRouter 匿名爆火的 Ox Alpha 真身。本文讲清它的能力实测、价格与使用教程。

GLM-5.3-Flash 是什么?Ox Alpha 真身、价格与使用教程全解

GLM-5.3-Flash 是智谱(Z.ai)2026 年 8 月 26 日正式发布并开源的原生多模态大模型,也是过去一周在 OpenRouter 上匿名爆火的 Ox Alpha 的真身。它拥有 320B 总参数(激活仅 18B)、1M 上下文窗口,支持文本、图片、视频、文件输入,API 价格只有旗舰 GLM-5.3 的十分之一:国内输入 ¥0.4 / 输出 ¥1.4 每百万 tokens(限时五折)。这篇 GLM-5.3-Flash 全解,讲清它的能力实测、真实价格、免费渠道和调用教程。

本文数据核查于 2026 年 8 月 26 日(模型发布当天):模型参数与定价取自智谱开放平台官方页面;OpenRouter 价格经其公开 API 实测返回;开源状态经 HuggingFace 仓库核实;社区反馈综合自 X、Reddit、Hacker News 与 IT之家评论区,全部可溯源。

TL;DR:三句话结论

赶时间的读者直接看结论:

  1. 是什么:GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型(Ox Alpha 真身),320B 总参数 / 18B 激活,1M 上下文,能看图、看视频、写代码,权重已按 MIT 协议开源。
  2. 能力:编程和 Agent 能力大幅超过 GLM-5.2(DeepSWE 63.4 对 46.2),逼近 Claude Opus 4.8(63.4 对 58.0);视觉编码(看截图写前端、看蓝图建 3D)是它的独家卖点。
  3. 怎么选:价格是 GLM-5.3 的 1/10、Claude Opus 4.8 的约 1/100。高频编码、多模态需求、成本敏感,选 Flash;极限文本推理难题留给 GLM-5.3,预算充足的团队再考虑 Claude。

GLM-5.3-Flash 是什么?

GLM-5.3-Flash 是智谱 AI 于 2026 年 8 月 26 日发布的 GLM-5 系列首个原生多模态模型,官方给它的定位是「普惠的全球前沿模型」——用极致低成本的架构,提供超越上代旗舰 GLM-5.2 的智能水平。

几个关键事实:

  • 发布时间:2026 年 8 月 26 日,技术博客见 z.ai/blog/glm-5.3-flash,国内接入走智谱开放平台
  • 参数规模:总参数 320B,激活参数仅 18B(MoE 架构),是首个采用稀疏注意力 + 线性注意力混合架构的开源前沿模型;
  • 多模态:原生支持文本、图片、视频、文件四种输入,视觉能力被直接融入编码循环;
  • 上下文:1M(100 万)tokens,最大输出 128K;
  • 开源:权重当天上传 HuggingFace,MIT 协议,支持 SGLang、vLLM、TokenSpeed 本地部署;
  • 身份:发布前它以匿名模型 Ox Alpha 的身份在 OpenRouter 免费公测了一周,是当周全球讨论度最高的模型(下文详述)。

一句话定位:这是目前「每块钱能买到的智能」最多的多模态模型——Artificial Analysis 智能指数 v4.1.1 拿到 57 分,单任务成本仅 $0.045,官方称这个智能水平此前要花约 10 倍的价格才能获得。

GLM-5.3-Flash 智谱官方发布博客页面

Ox Alpha 真身确认:一场教科书式的匿名发布

如果你过去一周刷过 AI 资讯,大概率见过「Ox Alpha 牛来大模型」——8 月 20 日晚,OpenRouter 上线了一个匿名模型(ID:stealth/ox-alpha),免费一周、1M 上下文、支持视频输入,DeepSWE 编程基准一度传出 80% 的成绩,全网猜了五天它是谁家的。

8 月 26 日答案揭晓:智谱官方在发布博客中直接确认,Ox Alpha 就是 GLM-5.3-Flash 的匿名测试版,原文写道:「发布前,我们以 ox-alpha 的身份在 OpenCode 和 OpenRouter 上匿名测试了 GLM-5.3-Flash,收集用户反馈。它迅速成为当周最受欢迎的模型——所有这些流量都跑在中国 AI 芯片上。」

完整时间线:

日期 事件
8 月 14 日 智谱发布旗舰 GLM-5.3(纯文本,编程开源 SOTA)
8 月 20 日晚 Ox Alpha 匿名上线 OpenRouter,免费一周;OpenCode 宣布免费接入,号称日产能 100T tokens
8 月 20–24 日 社区「开盒」:tokenizer 探针 11/11 匹配 GLM、60 项指标比对满分、视频编码器与 GLM-5V-Turbo 逐 token 一致、token 计数与 GLM-5.3 恒定相差 75
8 月 25 日 我们发文判断「Ox Alpha 是 GLM-5.3 家族的多模态变体」:Ox Alpha vs GLM-5.3 深度对比实测
8 月 26 日 智谱发布 GLM-5.3-Flash 并官方认领 Ox Alpha,同日开源权重;据 IT之家报道,智谱在回应彭博社询问时证实了这一猜测

这已经是 OpenRouter stealth 玩法的固定剧本:此前的 Pony Alpha 是智谱 GLM-5、Hunter/Healer Alpha 是小米 MiMo、Elephant Alpha 是蚂蚁 Ling——清一色中国实验室,匿名免费试用换社区自发传播和真实压力测试,三方共赢。

顺带一提命名梗:智谱向媒体确认 Ox 的命名灵感来自当时热映的国产电影《牛来》;而 Ox(牛)+ Pony(上一代代号,马)=「牛马」,中文社区已经玩坏了。匿名期间它曾冲上 OpenRouter 日榜第一,社区统计五天累计处理约 2 万亿 tokens——这也解释了为什么免费期它的速度只有 30–50 tokens/秒:用的人实在太多了。

GLM-5.3-Flash 参数与架构:1/10 价格是怎么来的

GLM-5.3-Flash 的便宜不是「缩水」,而是架构层面的重新设计。核心规格一览:

项目 GLM-5.3-Flash 对比 GLM-5.3
总参数 / 激活参数 320B / 18B 744B / 40B(GLM-5 基座)
上下文窗口 1M tokens 1M tokens
最大输出 128K tokens 128K tokens
输入模态 文本 + 图片 + 视频 + 文件 仅文本
注意力计算量 基准 比 GLM-5.3 低 3.01 倍
KV 缓存大小 基准 比 GLM-5.3 低 4.44 倍
推理档位 low / high / max(默认 max) 相同
开源协议 MIT 承诺开源(8 月底前后)

三个值得关注的架构细节(讲人话版):

  1. 稀疏注意力 + 线性注意力混合:这是首个采用该混合架构的开源前沿模型。线性注意力负责低成本地记住局部上下文,稀疏注意力负责按需检索全局信息——两者配合,让 1M 长上下文的服务成本大幅下降。对比同代模型,它的单 token 注意力计算量是最低的。
  2. 激活参数减半:与 GLM-4.5 系列相比,总参数相当(320B 对 355B),但激活参数从 32B 降到 18B,层数从 92 减到 45——同等智能水平下,推理需要的算力直接砍半。
  3. 跑在国产芯片上:免费公测一周的全部流量,都由国产 AI 芯片集群承载。官方基于 SGLang 自建推理引擎(有趣的是,这个引擎的优化工作本身由 GLM-5.3 驱动的 infra agent 加速完成),端到端服务性能提升 3 倍,单 token 成本已与主流 NVIDIA GPU 相当——这也是它能定出 1/10 价格的底层原因之一。

GLM-5.3-Flash 能力实测:编程、Agent、多模态全解析

先看官方公布的完整基准成绩(数据引自智谱官方博客,横评对象为各厂商当前主力型号):

基准(考察方向) GLM-5.3-Flash GLM-5.2 Opus 4.8 GPT-5.6 Terra Gemini 3.7 Flash
Terminal Bench 2.1(终端任务) 84.3 81.0 85.0 87.4 85.8
DeepSWE v1.1(真实仓库修 Bug) 63.4 46.2 58.0 69.6 65.3
AutomationBench(自动化任务) 48.8 26.2 41.0 37.2 52.3
Toolathlon Verified(工具调用) 78.4 59.9 76.2 74.9 -
Agents' Last Exam(长程 Agent) 26.3 20.4 27.0 28.0 -
OfficeQA Pro(办公文档) 62.4 - 48.9 - -
MVbench(视频理解) 77.8 - 67.1 75.0 82.2

逐项拆解,结论比总分更有价值:

1. 相对 GLM-5.2 是碾压式升级。 DeepSWE 从 46.2 涨到 63.4(+17.2),AutomationBench 从 26.2 涨到 48.8(+22.6)。如果你还在用 GLM-5.2 或同价位模型,这代 Flash 值得直接切换。

2. 编程能力逼近 Claude Opus 4.8。 真实仓库修 Bug 的 DeepSWE 上反超 Opus 4.8 五个百分点;在智谱内部 Z.ai Code Bench(Claude Code 2.1.207 环境跑)的 max 档位上拿到 29.0,几乎追平同环境下的 Opus 4.8(29.5)。与自家旗舰 GLM-5.3 相比(DeepSWE 66.9、Terminal Bench 88.2),Flash 达到旗舰约 95% 的编码水平,价格却只有 1/10。

3. 多模态是真正的独家卖点。 视觉能力被原生融入编码循环:它可以主动「看」渲染结果、截图和界面反馈,自我检查并迭代。两个官方展示的极端案例:没有任何外部素材,自主运行 16 个小时在 Blender 里搭出一套约 400 平方米的专业主厨自宅与测试厨房;从页面截图直接复刻出可运行的 Next.js 工程,自动逐页截图对比修正。办公场景同样受益——OfficeQA Pro 拿到 62.4,比 Opus 4.8 的 48.9 高出 13.5 分,做 PPTX/PDF/XLSX 成品交付时它能自己检查排版溢出和遮挡。

4. 客观说缺点(社区一手反馈)。 匿名公测期间的热度让它被神化了,实际短板包括:当初刷屏的「DeepSWE 80%」是 10 道题的小样本,全量是 63.4;Bach Benchmark 乐谱生成全军覆没;TNG 的测试发现它比 GLM-5.3 多了一层对齐税(alignment tax),部分人格类基准分数更低;免费期间速度只有 30–50 tokens/秒,国内用户吐槽「白嫖老断」「更慢更智能」。转为正式付费服务后,速度表现需要重新观察。

一句话总结:编码摸到第一梯队门槛、多模态是差异化加分项、没有碾压级优势——但看一眼价格,这些缺点都可以原谅。

GLM-5.3-Flash 价格:输入 0.4 元、输出 1.4 元贵不贵

国内智谱开放平台定价(每百万 tokens,2026 年 8 月 26 日实时核查):

模型 输入 输出 缓存命中 上下文
GLM-5.3-Flash ¥0.4(原价 ¥0.8) ¥1.4(原价 ¥2.8) ¥0.115 1M
GLM-5.3 ¥8 ¥28 ¥2 1M
GLM-5.2 ¥8 ¥28 ¥2 1M
GLM-4.7-Flash 免费 免费 免费 200K

两点说明:「5 折限时两周」 截止到 9 月 9 日前后,之后恢复原价 ¥0.8/¥2.8(即便原价也正好是 GLM-5.3 的 1/10);国际版 z.ai 与 OpenRouter 同步五折($0.075/$0.25,同样 9 月 9 日截止),折算下来国内定价还略便宜一点。

智谱开放平台 GLM-5.3-Flash 定价页:输入 0.4 元、输出 1.4 元每百万 tokens

单看数字没感觉,做个原创测算。假设一个典型编码任务:输入 10 万 tokens(含代码库上下文),输出 3 万 tokens(生成代码 + 思考过程),无缓存:

模型 单任务成本 相对 Flash
GLM-5.3-Flash(五折价) ¥0.08 1x
GLM-5.3-Flash(原价) ¥0.16 2x
GLM-5.3 ¥1.64 20x
Claude Opus 4.8 ¥8.88 约 108x

翻译一下:同样的预算,Flash 能跑约 100 倍于 Claude Opus 4.8 的任务量。一个每天跑 20 个编码任务的重度用户,用 Flash 每月 API 成本不到 40 元;换成 Opus 4.8 是 3,900 元。对个人开发者和中小团队,这就是「用不用得起新一代模型」的分界线。

想进一步省钱的四个渠道:

  1. 新用户免费额度:智谱开放平台新用户注册送 2,000 万 tokens 资源包,足够把 Flash 的编码和多模态能力都摸一遍;
  2. GLM Coding Plan 订阅:Flash 已全量上线订阅套餐,可用额度是 GLM-5.3 的 3 倍,非高峰时段(工作日 14:00–18:00 之外 + 周末全天)积分消耗减半——套餐详情和 Lite ¥118 / Pro ¥538 的选择建议,见我们此前的 GLM Coding Plan 订阅详解
  3. 永久免费替代:GLM-4.7-Flash 完全免费,适合开发调试和低频任务;
  4. 本地部署:MIT 协议开源,私有化部署无任何商用限制,详见下文教程一节。

想白嫖多家国产模型的读者,还可以参考我们的 DeepSeek V4 Pro 免费渠道实测指南

GLM-5.3-Flash 怎么用:API、订阅与本地部署教程

方式一:API 直调(按量计费)

第一步:注册智谱开放平台,控制台创建 API Key(新用户自动获赠 2,000 万 tokens)。

第二步:调用 Chat Completion 接口,模型 ID 填 glm-5.3-flash,端点 https://open.bigmodel.cn/api/paas/v4,同时兼容 OpenAI 与 Anthropic 协议。官方推荐参数:temperature: 1top_p: 0.95reasoning_effort: max

图片理解的写法(在 messages[].content[] 中加 image_url 内容块,多图就加多个块):

from zai import ZhipuAiClient

client = ZhipuAiClient(api_key="YOUR_API_KEY")
response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "image_url", "image_url": {"url": "https://你的图片地址.png"}},
            {"type": "text", "text": "把这个页面截图复刻成可运行的 Next.js 组件"}
        ]
    }],
    thinking={"type": "enabled"},   # 只支持 enabled,思考不可关闭
    reasoning_effort="max",          # low / high / max,默认 max
    temperature=1.0,
    top_p=0.95,
    max_tokens=65536,
)
print(response.choices[0].message.content)

方式二:接入编程工具(订阅用户)

订阅 GLM Coding Plan 后,在 Claude Code、Cline、OpenCode、ZCode 等 20+ 官方支持的工具中都能直接使用,Flash 额度为 GLM-5.3 的 3 倍。以 Claude Code 为例,把 baseurl 指向 https://open.bigmodel.cn/api/anthropic 并填入 API Key 即可。在官方 ZCode 中还能解锁它的 Browser Use / Computer Use 能力——模型自己点开网页、看渲染结果、修 Bug 的完整闭环。

方式三:OpenRouter 国际通道

OpenRouter 上的匿名入口 stealth/ox-alpha 已随揭晓下线,替换为正式的 z-ai/glm-5.3-flash(我们 8 月 26 日经其 API 实测:输入 $0.075 / 输出 $0.25 每百万 tokens,1M 上下文)。海外开发者或需要统一网关聚合多家模型的场景适用,接入方法与此前 Ox Alpha 的接入教程完全一致,只是模型 ID 换了。

方式四:本地部署(免费但吃显存)

权重在 HuggingFace:zai-org/GLM-5.3-Flash,MIT 协议。官方目前支持 SGLang、vLLM、TokenSpeed 三个推理框架,提供了 FP8 量化版本。注意 320B 总参数的模型满血部署需要多卡服务器;个人设备建议直接用 API,五折价格下本地部署的电费未必更划算。

GLM-5.3-Flash HuggingFace 开源模型卡:MIT 协议开放下载

四个容易踩的坑

  • 思考不可关闭thinking.type 只接受 enabled,想省 token 用 reasoning_effort: "low",别想着关思考;
  • 视频输入按秒计费:视频约每秒消耗 147 tokens(2 秒短视频 ≈ 296 tokens),长视频理解注意成本;
  • 套餐与 API 别混用:订阅额度只能在官方指定工具里用,自建应用调 API 走按量计费,报「1113 余额不足」多半是 baseurl 配错;
  • 海外还有匿名版幻觉:网上大量「Ox Alpha 免费用」的教程已过时,免费窗口 8 月 27 日前后结束,现在走正式入口。

GLM-5.3-Flash vs GLM-5.3:怎么选

两兄弟同天在架(GLM-5.3 8 月 14 日发布、Flash 8 月 26 日发布),选择逻辑其实很清晰:

维度 GLM-5.3-Flash GLM-5.3(旗舰)
定位 普惠多模态 极限推理
输入模态 文本 + 图片 + 视频 + 文件 仅文本
API 价格(输入/输出) ¥0.4 / ¥1.4 ¥8 / ¥28
DeepSWE v1.1 63.4 66.9
Terminal Bench 2.1 84.3 88.2
Agents' Last Exam 26.3 28.5
Coding Plan 可用额度 3x 1x
开源 已开源(MIT) 承诺 8 月底开源

选择建议:

  • 日常工程任务、高频调用、看预算:选 Flash。95% 的旗舰编码能力、1/10 的价格、还送多模态和 3 倍订阅额度;
  • 极限难题、纯文本深度推理:选 GLM-5.3。最难的架构级任务上旗舰仍领先 3–4 分,且网络安全(漏洞挖掘)能力是旗舰独有强项;
  • 需要看图/看视频干活:只能选 Flash,旗舰不支持视觉输入。

旗舰版的完整评测(包括与 Claude Fable 5、GPT-5.6 Sol 的对比和 Coding Plan 套餐选择),见我们此前的 GLM-5.3 深度评测

OpenRouter 上 z-ai/glm-5.3-flash 正式模型页:输入 0.075 美元输出 0.25 美元每百万 tokens

总结:GLM-5.3-Flash 适合谁用

分人群给结论:

  • 个人开发者 / 学生:首选。五折期间单次编码任务成本不到一毛钱,新用户 2,000 万免费 tokens 起步, ¥118/月的 Lite 套餐额度直接给到 3 倍;
  • 中小团队 / 创业公司:强烈推荐。同样预算下迭代次数比 Claude 多两个数量级,多模态能力还能顺手解决「截图转代码」「文档成品交付」这类此前要人工兜底的场景;
  • 有多模态需求的工程师:前端复刻、游戏原型、3D 场景、视频理解剪辑、Computer Use——这些「模型自己看效果自己改」的任务,它是当前价格内唯一的前沿级选择;
  • 需要私有化部署的企业:MIT 协议 + 混合注意力架构对推理硬件友好,FP8 权重开箱可用。

GLM-5.3-Flash 的发布把「前沿智能」的价格打到了一个新的低位,而 Ox Alpha 这场教科书式的匿名营销,会让它成为 2026 年下半年被讨论最多的国产模型之一。更多模型评测与 AI 编程工具横评,欢迎持续关注 XIA345 AI 指南

数据来源:本文基准与架构数据引自 智谱 GLM-5.3-Flash 官方技术博客官方模型文档;国内定价于 2026 年 8 月 26 日核查自智谱开放平台定价页;OpenRouter 价格经其公开 API 实测;开源状态经 HuggingFace 仓库核实;媒体报道引自 IT之家。价格以各官方页面实时数据为准。

常见问题

GLM-5.3-Flash 免费吗?

不免费,但极其便宜。API 按量计费:输入 ¥0.4 / 输出 ¥1.4 每百万 tokens(限时五折至 9 月 9 日,原价 ¥0.8/¥2.8)。免费途径有三条:智谱开放平台新用户注册送 2,000 万 tokens;GLM Coding Plan 订阅用户可直接使用且额度是 GLM-5.3 的 3 倍;MIT 协议开源,可本地部署。此前 OpenRouter 上 Ox Alpha 的免费公测窗口已于 8 月 27 日前后结束。

GLM-5.3-Flash 和 GLM-5.3 有什么区别?

三个核心区别:一是模态,Flash 原生支持图片、视频、文件输入,GLM-5.3 仅支持文本;二是价格,Flash 是 GLM-5.3 的 1/10(¥0.4/¥1.4 对 ¥8/¥28);三是定位,Flash 主打普惠和高性价比(编程能力约为旗舰的 95%),GLM-5.3 主打极限推理和网络安全能力。订阅套餐里 Flash 的可用额度是 GLM-5.3 的 3 倍。

Ox Alpha 是 GLM-5.3-Flash 吗?

是。智谱在 2026 年 8 月 26 日的官方发布博客中明确确认:发布前以 ox-alpha 的代号在 OpenCode 和 OpenRouter 上匿名测试了 GLM-5.3-Flash。此前社区通过 tokenizer 指纹(11/11 匹配)、60 项指标比对、视频编码器行为等多条独立路径得出了相同结论,完整证据链见我们的 [Ox Alpha vs GLM-5.3 对比实测](/ai-guide/ox-alpha-vs-glm-5-3)。

GLM-5.3-Flash 支持图片和视频输入吗?

支持。它是 GLM-5 系列首个原生多模态模型,输入支持文本、图片、视频和文件四种模态,API 写法是在 messages 的 content 数组里添加 image_url 内容块。视频约按每秒 147 tokens 计费。视觉能力不止是「看图回答」——它能看渲染截图自我纠错、看界面操作电脑(CUA)、看长视频做剪辑整理。

GLM-5.3-Flash 怎么调用?

国内走智谱开放平台:端点 https://open.bigmodel.cn/api/paas/v4 ,模型 ID 填 glm-5.3-flash,兼容 OpenAI 和 Anthropic 协议,Python SDK 用 zai-sdk;海外走 z.ai 或 OpenRouter(模型 ID:z-ai/glm-5.3-flash,$0.075/$0.25 每百万 tokens)。推荐参数:temperature 1、top_p 0.95、reasoning_effort max。订阅 GLM Coding Plan 后也可在 Claude Code、Cline、ZCode 等 20+ 工具中直接使用。

GLM-5.3-Flash 开源了吗?能本地部署吗?

已开源。2026 年 8 月 26 日发布当天,权重上传至 HuggingFace(zai-org/GLM-5.3-Flash),采用 MIT 协议,商用无限制。本地部署目前官方支持 SGLang、vLLM 和 TokenSpeed 三个推理框架,并提供 FP8 量化版本;注意满血部署 320B 模型需要多卡服务器,个人设备建议直接用 API。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-29

© 2026 AI345 · All Rights Reserved

用户服务协议·隐私政策