
GLM-5.3 深度评测:能力、价格与 Claude/GPT 对比(2026 实测数据)
GLM-5.3 是智谱 2026 年 8 月 14 日发布的开源旗舰模型:编程能力开源 SOTA、1M 上下文、涌现级网络安全能力。这篇深度评测用官方基准实测数据讲清它的真实水平,API 输入 ¥8/输出 ¥28 的价格成本测算,以及与 Claude Opus 4.8、GPT-5.6、Kimi K3 的详细对比和 Coding Plan 订阅建议。
GLM-5.3 深度评测:能力、价格与 Claude/GPT 对比
GLM-5.3 是智谱 2026 年 8 月 14 日发布的开源旗舰模型:编程能力开源 SOTA、1M 上下文、API 输入 8 元 / 输出 28 元每百万 tokens——输出价格约为 Claude Opus 4.8 的 1/6、GPT-5.6 Sol 的 1/5。这篇 GLM-5.3 深度评测,用官方基准实测数据、完整的 API 价格测算和三方对比表,讲清它的真实水平、值不值、以及怎么选。
最后更新:2026 年 8 月。本文数据来自智谱官方技术博客、开放平台定价页,以及 Claude / OpenAI 官方定价文档,全部为可溯源的一手信息。
TL;DR:三句话结论
赶时间的读者直接看结论:
- 能力:GLM-5.3 是当前编程能力最强的开源权重模型,Terminal Bench 3.0、Agents' Last Exam 开源第一;综合编码实力与 Claude Opus 4.8 互有胜负,落后于 Claude Fable 5 和 GPT-5.6 Sol。
- 价格:API 输入 ¥8 / 输出 ¥28 每百万 tokens,一次典型编码任务成本约 ¥1.6,是 Claude Opus 4.8 的 1/5;订阅 GLM Coding Plan Pro ¥538/月即可重度使用。
- 怎么选:预算敏感的开发者和团队,GLM-5.3 是性价比天花板;追求绝对前沿、不在乎成本,仍选 Claude Fable 5 或 GPT-5.6 Sol。
GLM-5.3 是什么?
GLM-5.3 是智谱 AI(Z.ai)于 2026 年 8 月 14 日发布的旗舰大语言模型,面向复杂软件工程与长程 Agent 任务,是当前编程能力最强的开源权重模型。它与 GLM-5.2 使用同一基座模型,全部提升来自后训练(post-training scaling)——官方在训练环境上持续加大投入,让模型从"做编程题"进化到"承担完整的专业工作单元"。
几个关键事实:
- 发布时间:2026 年 8 月 14 日,博客原文见 z.ai/blog/glm-5.3;
- 开源:官方承诺发布两周后(即 8 月底前后)开放权重下载,目前处于安全评估阶段;
- 上下文:1M(100 万)tokens,可一次性装入一个中型项目的全部源码;
- 定位:编程 + Agent + 网络安全,三项能力在本次升级中提升最猛;
- 获取方式:智谱开放平台 API 按量付费,或订阅 GLM Coding Plan 在 Claude Code 等 20+ 编码工具中使用。
一句话定位:这是国产模型第一次在"编程"这个最硬核的赛道上,把开源模型推到与闭源旗舰正面掰手腕的位置。
GLM-5.3 能力实测:编程、Agent、安全三大基准全解析
先看官方公布的完整基准成绩。下表整理自智谱官方博客,对比对象包括 Claude Opus 4.8、Claude Fable 5、GPT-5.6 Sol、Kimi K3、DeepSeek-V4 Pro 和 Qwen3.8-Max:
| 基准(考察方向) | GLM-5.3 | GLM-5.2 | Kimi K3 | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1(终端任务) | 88.2 | 81.0 | 88.3 | 85.0 | 88.0 | 88.8 |
| Terminal Bench 3.0(高难终端任务) | 28.3 | 4.6 | 17.4 | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1(真实仓库修 Bug) | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 | 72.7 |
| FrontierSWE(前沿软件工程) | 78.1 | 67.5 | - | 66.5 | 88.2 | - |
| Toolathlon Verified(工具调用) | 73.0 | 59.9 | 76.5 | 76.2 | 74.7 | 74.9 |
| Agents' Last Exam(长程 Agent) | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 | 28.6 |
| CyberGym(漏洞发现) | 84.5 | 77.2 | 80.0 | 78.1 | 83.8 | 83.6 |
| ExploitBench(漏洞利用推理) | 54.4 | 24.4 | 32.2 | 40.0 | 78.0 | 76.5 |
| HLE w/ Tools(人类最后考试) | 62.5 | 54.7 | 59.8 | 57.9 | 63.9 | 64.5 |

逐项拆解这些数据,能得出几个比"总分"更有价值的结论:
1. 编程:开源第一,与 Opus 4.8 互有胜负。 在真实仓库修 Bug 的 DeepSWE v1.1 上,GLM-5.3 拿到 66.9,领先 Opus 4.8 的 58.0 约 9 个百分点;FrontierSWE 上 78.1 对 66.5 同样明显领先。但在更难的 SWE-Marathon(42.5 对 48.8)和 Terminal Bench 3.0(28.3 对 21.1 领先,但对 GPT-5.6 Sol 的 34.6 落后)上,闭源前沿仍占优。结论:日常工程任务 GLM-5.3 已经够到 Opus 档,极限难题仍有差距。
2. 相对上代的提升幅度是恐怖的。 Terminal Bench 3.0 从 4.6 涨到 28.3(6.2 倍),DeepSWE 从 46.2 到 66.9,AutomationBench 从 26.2 到 48.2。同一基座、纯靠后训练做到这个幅度,是这代发布最值得研究的技术信号——意味着智谱找到了一条可持续的 Scaling 路线(官方开源的 slime 后训练框架就是配套产物)。
3. 安全能力是"意外涌现"。 CyberGym 漏洞发现 84.5 分,全场第一,超过 GPT-5.6 Sol(83.6)和 Fable 5(83.8)。更硬核的是实战战绩:智谱与国内安全团队合作,让模型扫描真实代码库,在 269 个开源项目中发现 2,436 个漏洞(含 1,097 个中高危),最老的一个漏洞从 1981 年潜伏至今,平均"年龄"26.6 年。这些发现全部记录在公开的 Z.ai 安全披露台账 中,可逐条查验。对安全工程师来说,这是目前最值得用的漏洞挖掘模型之一。
4. Token 效率是被低估的杀手锏。 在智谱内部基准 Z.ai Code Bench 上,GLM-5.3 用约 5 万输出 tokens 达到 31.4% 任务完成率,而 Opus 4.8 需要 12 万 tokens 才做到 29.5%。翻译一下:完成率每提高 1 个百分点,GLM-5.3 的输出成本约 ¥0.045,Opus 4.8 约 ¥0.72,相差约 16 倍。同样的预算,GLM-5.3 能跑完 16 倍的迭代量。

GLM-5.3 API 价格:输入 8 元、输出 28 元到底贵不贵
先给官方定价(智谱开放平台,每百万 tokens):
| 计费项 | GLM-5.3 | GLM-5.2 | GLM-5.1(32K 内) | GLM-4.7-Flash |
|---|---|---|---|---|
| 输入 | ¥8 | ¥8 | ¥6 | 免费 |
| 输出 | ¥28 | ¥28 | ¥24 | 免费 |
| 缓存命中 | ¥2 | ¥2 | ¥1.3 | 免费 |
| 缓存存储 | 限时免费 | 限时免费 | 限时免费 | 免费 |
| 上下文 | 1M | 1M | 1M | 200K |
单看绝对数字没感觉,把它放到全球旗舰模型里对比(美元按 1:7.1 折算):
| 模型 | 输入(折人民币) | 输出(折人民币) | GLM-5.3 相对价格 |
|---|---|---|---|
| GLM-5.3 | ¥8 | ¥28 | — |
| Claude Sonnet 5 | ¥14.2 | ¥71.0 | 输出为其 39% |
| GPT-5.6 Terra | ¥14.2 | ¥85.2 | 输出为其 33% |
| GPT-5.6 Sol | ¥28.4 | ¥142.0 | 输出为其 1/5 |
| Claude Opus 4.8 | ¥35.5 | ¥177.5 | 输出为其 1/6.3 |
| Claude Fable 5 | ¥71.0 | ¥355.0 | 输出为其 1/12.7 |

再看一个更贴近真实使用的测算。假设一个典型编码任务:输入 10 万 tokens(含代码库上下文),输出 3 万 tokens(生成代码 + 思考过程),无缓存:
| 模型 | 单任务成本 | 相对 GLM-5.3 |
|---|---|---|
| GLM-5.3 | ¥1.64 | 1x |
| Claude Sonnet 5 | ¥3.55 | 2.2x |
| GPT-5.6 Terra | ¥3.98 | 2.4x |
| GPT-5.6 Sol | ¥7.10 | 4.3x |
| Claude Opus 4.8 | ¥8.88 | 5.4x |
| Claude Fable 5 | ¥17.75 | 10.8x |
一个每天跑 20 个任务的重度用户(每月按 22 个工作日算):GLM-5.3 API 月成本约 ¥722;换 Claude Opus 4.8 约 ¥3,907;而订阅 GLM Coding Plan Pro(¥538/月)可以覆盖同等甚至更高的用量。这就是国产模型价格战的意义——旗舰能力,中端价格。
免费额度方面:智谱新用户注册送 2,000 万 tokens 资源包,足够免费体验相当长时间;预算紧张的话,GLM-4.7-Flash 完全免费,适合做开发调试和低频任务。想白嫖多家国产模型的读者,可以参考我们之前的 DeepSeek V4 Pro 免费渠道实测指南。
GLM-5.3 vs Claude:Opus 4.8、Fable 5 差距多大
Claude 是 GLM-5.3 最直接的对标对象,分两档说:
vs Claude Opus 4.8($5/$25,同价位段的上一代旗舰):日常工程编码 GLM-5.3 反超(DeepSWE +9 分、FrontierSWE +11.6 分),价格只有对方的 1/5~1/6,性价比完胜;极限难题(SWE-Marathon)Opus 仍领先 6 分。顺带一提,Anthropic 新一代模型也在路上——Claude 新模型代号已遭泄露,预算敏感的用户不妨等一等再做决定。
vs Claude Fable 5($10/$50,当前闭源编程天花板):差距是真实存在的——FrontierSWE 落后 10 分、ExploitBench 落后 23.6 分、Z.ai Code Bench 完成率落后 5 个百分点。但换个角度:Fable 5 输出价 ¥355/百万 tokens,是 GLM-5.3 的 12.7 倍。用 1/12 的价格拿到 85%~90% 的能力,这笔账大多数团队都算得清。
一句话总结:个人开发者和中小团队选 GLM-5.3,不差钱且追求极限质量的大厂选 Fable 5。 如果你已经在 Claude Code 生态里,还有第三条路——直接订阅 GLM Coding Plan,让 Claude Code 这个壳跑 GLM-5.3 的芯,工程化能力照用不误,具体见下文订阅详解。
GLM-5.3 vs GPT-5.6:Sol、Terra、Luna 怎么比
OpenAI 的 GPT-5.6 家族分三档,与 GLM-5.3 的关系很清晰:
| 对比 | 结论 |
|---|---|
| GLM-5.3 vs GPT-5.6 Sol($4/$20 促销价) | Sol 全面小幅领先:Terminal Bench 3.0(34.6 对 28.3)、DeepSWE(72.7 对 66.9)、HLE(64.5 对 62.5)。但 Sol 价格是 GLM-5.3 的 3.5~5 倍,且促销价 2026 年 11 月 21 日后不确定 |
| GLM-5.3 vs GPT-5.6 Terra($2/$12) | GLM-5.3 能力更强(Terminal Bench 3.0 领先 10.9 分),输出价 ¥28 对 ¥85.2,还便宜 67% |
| GLM-5.3 vs GPT-5.6 Luna($0.2/$1.2) | Luna 是轻量模型,能力不在一个档位,仅适合海量低成本场景 |
值得注意的一点:GPT-5.6 Sol 的能力优势集中在最难的基准上,日常编码任务两者的差距远小于榜单差距。如果你主要做 Web 开发、脚本、常规重构,GLM-5.3 和 Sol 的实际体验差距很小,账单差距很大。想深入了解 OpenAI 阵营编程工具的,可以看我们的 OpenAI Codex 完整使用指南。
GLM-5.3 vs Kimi K3、DeepSeek V4:国产旗舰横评
国产阵营内部,GLM-5.3 的位置也很清楚:
| 基准 | GLM-5.3 | Kimi K3 | DeepSeek-V4 Pro | Qwen3.8-Max |
|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 88.3 | 87.9 | 86.6 |
| Terminal Bench 3.0 | 28.3 | 17.4 | - | - |
| DeepSWE v1.1 | 66.9 | 67.5 | 62.7 | 56.6 |
| CyberGym | 84.5 | 80.0 | 83.3 | 78.5 |
| Toolathlon | 73.0 | 76.5 | 74.1 | 72.5 |
- vs Kimi K3:整体五五开,GLM-5.3 在高难终端任务和安全上大幅领先(Terminal Bench 3.0 领先 10.9 分),Kimi K3 在工具调用上略优。
- vs DeepSeek-V4 Pro:编程和安全维度 GLM-5.3 领先,DeepSeek 的传统优势在通用对话和数学推理,定位不同。
- vs Qwen3.8-Max:各基准全面领先 4~8 分。
加上 GLM-5.3 将开源权重(Kimi K3 尚未明确开源计划),需要私有化部署的团队,GLM-5.3 基本是当前唯一解。另外,此前在 OpenRouter 上火爆一时的匿名模型 Ox Alpha,社区就主流猜测与智谱有关——智谱的模型能力已经获得海外社区的自来水式关注。
GLM Coding Plan 值不值:Lite/Pro/Max 订阅详解
API 按量付费之外,智谱还提供订阅制的 GLM Coding Plan(类似 Claude Code 的订阅模式),所有套餐均支持 GLM-5.3:
| 套餐 | 月费 | 连续包月 | 额度(每 5 小时 / 每周) | 适合人群 |
|---|---|---|---|---|
| Lite | ¥118 | ¥94.4 | 2,000 / 10,000 积分 | 小型项目轻量迭代 |
| Pro | ¥538 | ¥430.4 | 12,000 / 60,000 积分 | 中型项目日常开发 |
| Max | ¥1,078 | ¥862.4 | 28,000 / 140,000 积分 | 大型项目深度开发 |
连续包季 8 折、包年 7 折。折算成美元:Lite 约 $16.6、Pro 约 $75.6、Max 约 $151.5——对比 Claude Pro $20/月、Claude Max $100~200/月,ChatGPT Plus $20/月、Pro $200/月。
几个官方文档里不显眼但很关键的细节:
- 积分怎么算:GLM-5.3 的抵扣系数是输入 6.9、缓存命中 1.7、输出 24(每万 tokens)。Pro 的 60,000 周积分,按官方口径在缓存命中率 95% 时约等于 2.9~5.8 亿 tokens/周,重度使用完全够。
- 非高峰半价:工作日 14:00–18:00(UTC+8)之外,模型调用积分消耗减半。把批量任务挪到晚上和周末跑,额度直接翻倍。
- 套餐只能在指定工具里用:Claude Code、Cline、Kilo Code、OpenCode、OpenClaw、TRAE、CodeBuddy、Crush、ZCode 等 20+ 官方支持的工具。在自建应用里调 API 不能用套餐额度,会走按量计费或直接报"1113 余额不足"。
- 历史模型自动升级:订阅套餐里调用 GLM-5.2 / GLM-5.1 会自动切换到 GLM-5.3,不用改配置。
- 老订阅用户的临时限制:订阅过 Coding Plan(含已过期)的账号,目前暂时只能通过 OpenAI Chat Completion 协议调用模型 API,官方称近期会优化。
对比结论:GLM Coding Plan Pro 是当前全球性价比最高的 AI 编程订阅——额度数倍于同价位竞品,模型能力是开源 SOTA,还附带联网搜索、网页读取、开源仓库检索等 MCP 工具和 GLM in Excel 权益。已经用 Claude Code 的团队,配置一行 baseurl 就能无缝切换(见下节)。
GLM-5.3 怎么调用:三步接入教程
第一步:获取 API Key。 注册 智谱开放平台,新用户自动获赠 2,000 万 tokens,在控制台创建 API Key。
第二步:直接调 API(按量计费场景)。 端点为 https://open.bigmodel.cn/api/paas/v4/chat/completions,同时兼容 OpenAI 和 Anthropic 协议,Python SDK 用 zai-sdk:
from zai import ZhipuAiClient
client = ZhipuAiClient(api_key="YOUR_API_KEY")
response = client.chat.completions.create(
model="glm-5.3",
messages=[
{"role": "system", "content": "你是一名资深全栈工程师"},
{"role": "user", "content": "帮我实现一个博客网站的首页与文章详情页"}
],
thinking={"type": "enabled"}, # 只支持 enabled,不可关闭思考
reasoning_effort="max", # 推理强度:low / high / max,默认 max
max_tokens=65536,
temperature=1.0,
)
print(response.choices[0].message.content)
第三步:接入编码工具(订阅用户场景)。 以 Claude Code 为例,把 baseurl 指向 https://open.bigmodel.cn/api/anthropic 并填入 API Key 即可;其他工具(Cline、Kilo Code 等)使用 https://open.bigmodel.cn/api/coding/paas/v4。官方还提供一键安装命令 npx @z_ai/coding-helper。
三个容易踩的坑:
- 思考模式不可关闭:GLM-5.3 移除了"禁用思考"选项,
thinking.type只接受enabled。想要省 token,用reasoning_effort: "low"降低推理强度,而不是关思考。 - max_tokens 上限 65,536:配合 1M 上下文输入没有问题,但生成超长文件时注意分段。
- 别和套餐额度搞混:报错"1113 余额不足"通常是因为在非指定工具里用了套餐账号,或 baseurl 配错。
详细的 Claude Code 工程化玩法(先计划再动手、TDD 门控、经验沉淀),推荐搭配我们的 Everything Claude Code(ECC)工程化配置指南,把 GLM-5.3 的能力压榨到极致。
总结:GLM-5.3 适合谁用
分人群给结论:
- 个人开发者 / 学生:首选。新用户 2,000 万免费 tokens 起步,¥118/月的 Lite 或按量付费都远比 Claude 便宜,能力却在自己写代码这件事上不输 Opus 4.8。
- 中小团队 / 创业公司:强烈推荐。Pro 套餐 ¥538/月覆盖团队主力开发,成本约为主力竞品的 1/3~1/5;两周后权重开源,未来还有私有化部署的退路。
- 大厂 / 对质量极致敏感:GLM-5.3 适合做高频、大批量的工程任务层(单元测试生成、批量重构、代码审查),最难的架构级任务留给 Claude Fable 5 或 GPT-5.6 Sol,双模型组合是当前最优的成本质量平衡。
- 安全工程师:直接用。CyberGym 全场第一 + 真实漏洞挖掘战绩(2,436 个漏洞、269 个项目),这是目前最强的漏洞发现模型,没有之一。
GLM-5.3 的发布标志着国产开源模型第一次在编程赛道站上第一梯队,而它 1/5~1/6 的价格,会实打实地改变很多团队的 AI 编程预算表。更多 AI 编程工具的横评和教程,欢迎持续关注 XIA345 AI 指南。
数据来源:本文基准数据引自 智谱 GLM-5.3 官方博客与官方模型文档;智谱定价引自开放平台定价页;Claude 定价引自 Anthropic 官方定价文档;GPT 定价引自 OpenAI 官方定价页。价格按 1 美元 ≈ 7.1 元人民币折算,以各官方页面实时价格为准。
常见问题
GLM-5.3 免费吗?
不完全免费。GLM-5.3 API 按量计费(输入 ¥8 / 输出 ¥28 每百万 tokens);但智谱新用户注册即送 2,000 万 tokens 免费资源包,平台的体验中心也可以免费试用模型。需要永久免费选项的用户,GLM-4.7-Flash 完全免费。
GLM-5.3 和 Claude Opus 4.8 哪个好?
日常软件工程任务(修 Bug、重构、真实仓库开发)GLM-5.3 领先约 9~11 分,极限难题 Opus 4.8 仍领先;价格上 GLM-5.3 是对方的 1/5~1/6。综合性价比选 GLM-5.3,追求单点极致质量且预算充足选 Claude(当前最强为 Fable 5)。
GLM-5.3 什么时候开源?
官方在 2026 年 8 月 14 日的发布博客中承诺:安全评估与加固完成后,发布两周内开放权重,即 2026 年 8 月底前后可在 HuggingFace 等渠道下载。届时 GLM-5.3 将成为可私有化部署的最强编程模型。
GLM-5.3 能在 Claude Code 里用吗?
可以。订阅 GLM Coding Plan 后,将 Claude Code 的 baseurl 配置为 `https://open.bigmodel.cn/api/anthropic` 即可用套餐额度调用 GLM-5.3。官方支持的工具还有 Cline、Kilo Code、OpenCode、OpenClaw、TRAE、CodeBuddy、ZCode 等 20 余款。
GLM-5.3 的思考模式能关掉吗?
不能。GLM-5.3 取消了禁用思考的选项,`thinking.type` 仅支持 `enabled`;想控制 token 消耗,应使用 `reasoning_effort` 参数在 low / high / max 三档之间调节(默认 max)。这是它和 GLM-5.2 在 API 层面的一个不兼容变更,迁移代码时需要注意。
GLM-5.3 支持多长的上下文?
1M(100 万)tokens 上下文,与 GLM-5.2 持平。按 GLM 系列词表约 1 token ≈ 1.6 个汉字换算,约相当于 160 万汉字,可一次性处理中型项目全量源码、超长文档或数小时对话历史。

京ICP备2024094994号-29