GLM-5.3 深度评测:能力、价格与 Claude/GPT 对比(2026 实测数据)封面图
AI 编程约 14 分钟

GLM-5.3 深度评测:能力、价格与 Claude/GPT 对比(2026 实测数据)

AI 指南··0 浏览

GLM-5.3 是智谱 2026 年 8 月 14 日发布的开源旗舰模型:编程能力开源 SOTA、1M 上下文、涌现级网络安全能力。这篇深度评测用官方基准实测数据讲清它的真实水平,API 输入 ¥8/输出 ¥28 的价格成本测算,以及与 Claude Opus 4.8、GPT-5.6、Kimi K3 的详细对比和 Coding Plan 订阅建议。

GLM-5.3 深度评测:能力、价格与 Claude/GPT 对比

GLM-5.3 是智谱 2026 年 8 月 14 日发布的开源旗舰模型:编程能力开源 SOTA、1M 上下文、API 输入 8 元 / 输出 28 元每百万 tokens——输出价格约为 Claude Opus 4.8 的 1/6、GPT-5.6 Sol 的 1/5。这篇 GLM-5.3 深度评测,用官方基准实测数据、完整的 API 价格测算和三方对比表,讲清它的真实水平、值不值、以及怎么选。

最后更新:2026 年 8 月。本文数据来自智谱官方技术博客、开放平台定价页,以及 Claude / OpenAI 官方定价文档,全部为可溯源的一手信息。

TL;DR:三句话结论

赶时间的读者直接看结论:

  1. 能力:GLM-5.3 是当前编程能力最强的开源权重模型,Terminal Bench 3.0、Agents' Last Exam 开源第一;综合编码实力与 Claude Opus 4.8 互有胜负,落后于 Claude Fable 5 和 GPT-5.6 Sol。
  2. 价格:API 输入 ¥8 / 输出 ¥28 每百万 tokens,一次典型编码任务成本约 ¥1.6,是 Claude Opus 4.8 的 1/5;订阅 GLM Coding Plan Pro ¥538/月即可重度使用。
  3. 怎么选:预算敏感的开发者和团队,GLM-5.3 是性价比天花板;追求绝对前沿、不在乎成本,仍选 Claude Fable 5 或 GPT-5.6 Sol。

GLM-5.3 是什么?

GLM-5.3 是智谱 AI(Z.ai)于 2026 年 8 月 14 日发布的旗舰大语言模型,面向复杂软件工程与长程 Agent 任务,是当前编程能力最强的开源权重模型。它与 GLM-5.2 使用同一基座模型,全部提升来自后训练(post-training scaling)——官方在训练环境上持续加大投入,让模型从"做编程题"进化到"承担完整的专业工作单元"。

几个关键事实:

  • 发布时间:2026 年 8 月 14 日,博客原文见 z.ai/blog/glm-5.3
  • 开源:官方承诺发布两周后(即 8 月底前后)开放权重下载,目前处于安全评估阶段;
  • 上下文:1M(100 万)tokens,可一次性装入一个中型项目的全部源码;
  • 定位:编程 + Agent + 网络安全,三项能力在本次升级中提升最猛;
  • 获取方式智谱开放平台 API 按量付费,或订阅 GLM Coding Plan 在 Claude Code 等 20+ 编码工具中使用。

一句话定位:这是国产模型第一次在"编程"这个最硬核的赛道上,把开源模型推到与闭源旗舰正面掰手腕的位置。

GLM-5.3 能力实测:编程、Agent、安全三大基准全解析

先看官方公布的完整基准成绩。下表整理自智谱官方博客,对比对象包括 Claude Opus 4.8、Claude Fable 5、GPT-5.6 Sol、Kimi K3、DeepSeek-V4 Pro 和 Qwen3.8-Max:

基准(考察方向) GLM-5.3 GLM-5.2 Kimi K3 Claude Opus 4.8 Claude Fable 5 GPT-5.6 Sol
Terminal Bench 2.1(终端任务) 88.2 81.0 88.3 85.0 88.0 88.8
Terminal Bench 3.0(高难终端任务) 28.3 4.6 17.4 21.1 33.7 34.6
DeepSWE v1.1(真实仓库修 Bug) 66.9 46.2 67.5 58.0 69.7 72.7
FrontierSWE(前沿软件工程) 78.1 67.5 - 66.5 88.2 -
Toolathlon Verified(工具调用) 73.0 59.9 76.5 76.2 74.7 74.9
Agents' Last Exam(长程 Agent) 28.5 23.8 27.6 25.7 23.8 28.6
CyberGym(漏洞发现) 84.5 77.2 80.0 78.1 83.8 83.6
ExploitBench(漏洞利用推理) 54.4 24.4 32.2 40.0 78.0 76.5
HLE w/ Tools(人类最后考试) 62.5 54.7 59.8 57.9 63.9 64.5

GLM-5.3 与 Claude Opus 4.8、GPT-5.6 Sol、Kimi K3 四大核心基准实测得分对比柱状图

逐项拆解这些数据,能得出几个比"总分"更有价值的结论:

1. 编程:开源第一,与 Opus 4.8 互有胜负。 在真实仓库修 Bug 的 DeepSWE v1.1 上,GLM-5.3 拿到 66.9,领先 Opus 4.8 的 58.0 约 9 个百分点;FrontierSWE 上 78.1 对 66.5 同样明显领先。但在更难的 SWE-Marathon(42.5 对 48.8)和 Terminal Bench 3.0(28.3 对 21.1 领先,但对 GPT-5.6 Sol 的 34.6 落后)上,闭源前沿仍占优。结论:日常工程任务 GLM-5.3 已经够到 Opus 档,极限难题仍有差距。

2. 相对上代的提升幅度是恐怖的。 Terminal Bench 3.0 从 4.6 涨到 28.3(6.2 倍),DeepSWE 从 46.2 到 66.9,AutomationBench 从 26.2 到 48.2。同一基座、纯靠后训练做到这个幅度,是这代发布最值得研究的技术信号——意味着智谱找到了一条可持续的 Scaling 路线(官方开源的 slime 后训练框架就是配套产物)。

3. 安全能力是"意外涌现"。 CyberGym 漏洞发现 84.5 分,全场第一,超过 GPT-5.6 Sol(83.6)和 Fable 5(83.8)。更硬核的是实战战绩:智谱与国内安全团队合作,让模型扫描真实代码库,在 269 个开源项目中发现 2,436 个漏洞(含 1,097 个中高危),最老的一个漏洞从 1981 年潜伏至今,平均"年龄"26.6 年。这些发现全部记录在公开的 Z.ai 安全披露台账 中,可逐条查验。对安全工程师来说,这是目前最值得用的漏洞挖掘模型之一。

4. Token 效率是被低估的杀手锏。 在智谱内部基准 Z.ai Code Bench 上,GLM-5.3 用约 5 万输出 tokens 达到 31.4% 任务完成率,而 Opus 4.8 需要 12 万 tokens 才做到 29.5%。翻译一下:完成率每提高 1 个百分点,GLM-5.3 的输出成本约 ¥0.045,Opus 4.8 约 ¥0.72,相差约 16 倍。同样的预算,GLM-5.3 能跑完 16 倍的迭代量。

GLM-5.3 token 效率实测:Z.ai Code Bench 上任务完成率与输出 tokens 消耗对比

GLM-5.3 API 价格:输入 8 元、输出 28 元到底贵不贵

先给官方定价(智谱开放平台,每百万 tokens):

计费项 GLM-5.3 GLM-5.2 GLM-5.1(32K 内) GLM-4.7-Flash
输入 ¥8 ¥8 ¥6 免费
输出 ¥28 ¥28 ¥24 免费
缓存命中 ¥2 ¥2 ¥1.3 免费
缓存存储 限时免费 限时免费 限时免费 免费
上下文 1M 1M 1M 200K

单看绝对数字没感觉,把它放到全球旗舰模型里对比(美元按 1:7.1 折算):

模型 输入(折人民币) 输出(折人民币) GLM-5.3 相对价格
GLM-5.3 ¥8 ¥28
Claude Sonnet 5 ¥14.2 ¥71.0 输出为其 39%
GPT-5.6 Terra ¥14.2 ¥85.2 输出为其 33%
GPT-5.6 Sol ¥28.4 ¥142.0 输出为其 1/5
Claude Opus 4.8 ¥35.5 ¥177.5 输出为其 1/6.3
Claude Fable 5 ¥71.0 ¥355.0 输出为其 1/12.7

GLM-5.3 API 价格对比:与 Claude Opus 4.8、GPT-5.6 Sol 等旗舰模型的输入输出价格条形图

再看一个更贴近真实使用的测算。假设一个典型编码任务:输入 10 万 tokens(含代码库上下文),输出 3 万 tokens(生成代码 + 思考过程),无缓存:

模型 单任务成本 相对 GLM-5.3
GLM-5.3 ¥1.64 1x
Claude Sonnet 5 ¥3.55 2.2x
GPT-5.6 Terra ¥3.98 2.4x
GPT-5.6 Sol ¥7.10 4.3x
Claude Opus 4.8 ¥8.88 5.4x
Claude Fable 5 ¥17.75 10.8x

一个每天跑 20 个任务的重度用户(每月按 22 个工作日算):GLM-5.3 API 月成本约 ¥722;换 Claude Opus 4.8 约 ¥3,907;而订阅 GLM Coding Plan Pro(¥538/月)可以覆盖同等甚至更高的用量。这就是国产模型价格战的意义——旗舰能力,中端价格

免费额度方面:智谱新用户注册送 2,000 万 tokens 资源包,足够免费体验相当长时间;预算紧张的话,GLM-4.7-Flash 完全免费,适合做开发调试和低频任务。想白嫖多家国产模型的读者,可以参考我们之前的 DeepSeek V4 Pro 免费渠道实测指南

GLM-5.3 vs Claude:Opus 4.8、Fable 5 差距多大

Claude 是 GLM-5.3 最直接的对标对象,分两档说:

vs Claude Opus 4.8($5/$25,同价位段的上一代旗舰):日常工程编码 GLM-5.3 反超(DeepSWE +9 分、FrontierSWE +11.6 分),价格只有对方的 1/5~1/6,性价比完胜;极限难题(SWE-Marathon)Opus 仍领先 6 分。顺带一提,Anthropic 新一代模型也在路上——Claude 新模型代号已遭泄露,预算敏感的用户不妨等一等再做决定。

vs Claude Fable 5($10/$50,当前闭源编程天花板):差距是真实存在的——FrontierSWE 落后 10 分、ExploitBench 落后 23.6 分、Z.ai Code Bench 完成率落后 5 个百分点。但换个角度:Fable 5 输出价 ¥355/百万 tokens,是 GLM-5.3 的 12.7 倍。用 1/12 的价格拿到 85%~90% 的能力,这笔账大多数团队都算得清。

一句话总结:个人开发者和中小团队选 GLM-5.3,不差钱且追求极限质量的大厂选 Fable 5。 如果你已经在 Claude Code 生态里,还有第三条路——直接订阅 GLM Coding Plan,让 Claude Code 这个壳跑 GLM-5.3 的芯,工程化能力照用不误,具体见下文订阅详解。

GLM-5.3 vs GPT-5.6:Sol、Terra、Luna 怎么比

OpenAI 的 GPT-5.6 家族分三档,与 GLM-5.3 的关系很清晰:

对比 结论
GLM-5.3 vs GPT-5.6 Sol($4/$20 促销价) Sol 全面小幅领先:Terminal Bench 3.0(34.6 对 28.3)、DeepSWE(72.7 对 66.9)、HLE(64.5 对 62.5)。但 Sol 价格是 GLM-5.3 的 3.5~5 倍,且促销价 2026 年 11 月 21 日后不确定
GLM-5.3 vs GPT-5.6 Terra($2/$12) GLM-5.3 能力更强(Terminal Bench 3.0 领先 10.9 分),输出价 ¥28 对 ¥85.2,还便宜 67%
GLM-5.3 vs GPT-5.6 Luna($0.2/$1.2) Luna 是轻量模型,能力不在一个档位,仅适合海量低成本场景

值得注意的一点:GPT-5.6 Sol 的能力优势集中在最难的基准上,日常编码任务两者的差距远小于榜单差距。如果你主要做 Web 开发、脚本、常规重构,GLM-5.3 和 Sol 的实际体验差距很小,账单差距很大。想深入了解 OpenAI 阵营编程工具的,可以看我们的 OpenAI Codex 完整使用指南

GLM-5.3 vs Kimi K3、DeepSeek V4:国产旗舰横评

国产阵营内部,GLM-5.3 的位置也很清楚:

基准 GLM-5.3 Kimi K3 DeepSeek-V4 Pro Qwen3.8-Max
Terminal Bench 2.1 88.2 88.3 87.9 86.6
Terminal Bench 3.0 28.3 17.4 - -
DeepSWE v1.1 66.9 67.5 62.7 56.6
CyberGym 84.5 80.0 83.3 78.5
Toolathlon 73.0 76.5 74.1 72.5
  • vs Kimi K3:整体五五开,GLM-5.3 在高难终端任务和安全上大幅领先(Terminal Bench 3.0 领先 10.9 分),Kimi K3 在工具调用上略优。
  • vs DeepSeek-V4 Pro:编程和安全维度 GLM-5.3 领先,DeepSeek 的传统优势在通用对话和数学推理,定位不同。
  • vs Qwen3.8-Max:各基准全面领先 4~8 分。

加上 GLM-5.3 将开源权重(Kimi K3 尚未明确开源计划),需要私有化部署的团队,GLM-5.3 基本是当前唯一解。另外,此前在 OpenRouter 上火爆一时的匿名模型 Ox Alpha,社区就主流猜测与智谱有关——智谱的模型能力已经获得海外社区的自来水式关注。

GLM Coding Plan 值不值:Lite/Pro/Max 订阅详解

API 按量付费之外,智谱还提供订阅制的 GLM Coding Plan(类似 Claude Code 的订阅模式),所有套餐均支持 GLM-5.3:

套餐 月费 连续包月 额度(每 5 小时 / 每周) 适合人群
Lite ¥118 ¥94.4 2,000 / 10,000 积分 小型项目轻量迭代
Pro ¥538 ¥430.4 12,000 / 60,000 积分 中型项目日常开发
Max ¥1,078 ¥862.4 28,000 / 140,000 积分 大型项目深度开发

连续包季 8 折、包年 7 折。折算成美元:Lite 约 $16.6、Pro 约 $75.6、Max 约 $151.5——对比 Claude Pro $20/月、Claude Max $100~200/月,ChatGPT Plus $20/月、Pro $200/月。

几个官方文档里不显眼但很关键的细节:

  1. 积分怎么算:GLM-5.3 的抵扣系数是输入 6.9、缓存命中 1.7、输出 24(每万 tokens)。Pro 的 60,000 周积分,按官方口径在缓存命中率 95% 时约等于 2.9~5.8 亿 tokens/周,重度使用完全够。
  2. 非高峰半价:工作日 14:00–18:00(UTC+8)之外,模型调用积分消耗减半。把批量任务挪到晚上和周末跑,额度直接翻倍。
  3. 套餐只能在指定工具里用:Claude Code、Cline、Kilo Code、OpenCode、OpenClaw、TRAE、CodeBuddy、Crush、ZCode 等 20+ 官方支持的工具。在自建应用里调 API 不能用套餐额度,会走按量计费或直接报"1113 余额不足"。
  4. 历史模型自动升级:订阅套餐里调用 GLM-5.2 / GLM-5.1 会自动切换到 GLM-5.3,不用改配置。
  5. 老订阅用户的临时限制:订阅过 Coding Plan(含已过期)的账号,目前暂时只能通过 OpenAI Chat Completion 协议调用模型 API,官方称近期会优化。

对比结论:GLM Coding Plan Pro 是当前全球性价比最高的 AI 编程订阅——额度数倍于同价位竞品,模型能力是开源 SOTA,还附带联网搜索、网页读取、开源仓库检索等 MCP 工具和 GLM in Excel 权益。已经用 Claude Code 的团队,配置一行 baseurl 就能无缝切换(见下节)。

GLM-5.3 怎么调用:三步接入教程

第一步:获取 API Key。 注册 智谱开放平台,新用户自动获赠 2,000 万 tokens,在控制台创建 API Key。

第二步:直接调 API(按量计费场景)。 端点为 https://open.bigmodel.cn/api/paas/v4/chat/completions,同时兼容 OpenAI 和 Anthropic 协议,Python SDK 用 zai-sdk

from zai import ZhipuAiClient

client = ZhipuAiClient(api_key="YOUR_API_KEY")
response = client.chat.completions.create(
    model="glm-5.3",
    messages=[
        {"role": "system", "content": "你是一名资深全栈工程师"},
        {"role": "user", "content": "帮我实现一个博客网站的首页与文章详情页"}
    ],
    thinking={"type": "enabled"},   # 只支持 enabled,不可关闭思考
    reasoning_effort="max",          # 推理强度:low / high / max,默认 max
    max_tokens=65536,
    temperature=1.0,
)
print(response.choices[0].message.content)

第三步:接入编码工具(订阅用户场景)。 以 Claude Code 为例,把 baseurl 指向 https://open.bigmodel.cn/api/anthropic 并填入 API Key 即可;其他工具(Cline、Kilo Code 等)使用 https://open.bigmodel.cn/api/coding/paas/v4。官方还提供一键安装命令 npx @z_ai/coding-helper

三个容易踩的坑:

  • 思考模式不可关闭:GLM-5.3 移除了"禁用思考"选项,thinking.type 只接受 enabled。想要省 token,用 reasoning_effort: "low" 降低推理强度,而不是关思考。
  • max_tokens 上限 65,536:配合 1M 上下文输入没有问题,但生成超长文件时注意分段。
  • 别和套餐额度搞混:报错"1113 余额不足"通常是因为在非指定工具里用了套餐账号,或 baseurl 配错。

详细的 Claude Code 工程化玩法(先计划再动手、TDD 门控、经验沉淀),推荐搭配我们的 Everything Claude Code(ECC)工程化配置指南,把 GLM-5.3 的能力压榨到极致。

总结:GLM-5.3 适合谁用

分人群给结论:

  • 个人开发者 / 学生:首选。新用户 2,000 万免费 tokens 起步,¥118/月的 Lite 或按量付费都远比 Claude 便宜,能力却在自己写代码这件事上不输 Opus 4.8。
  • 中小团队 / 创业公司:强烈推荐。Pro 套餐 ¥538/月覆盖团队主力开发,成本约为主力竞品的 1/3~1/5;两周后权重开源,未来还有私有化部署的退路。
  • 大厂 / 对质量极致敏感:GLM-5.3 适合做高频、大批量的工程任务层(单元测试生成、批量重构、代码审查),最难的架构级任务留给 Claude Fable 5 或 GPT-5.6 Sol,双模型组合是当前最优的成本质量平衡。
  • 安全工程师:直接用。CyberGym 全场第一 + 真实漏洞挖掘战绩(2,436 个漏洞、269 个项目),这是目前最强的漏洞发现模型,没有之一。

GLM-5.3 的发布标志着国产开源模型第一次在编程赛道站上第一梯队,而它 1/5~1/6 的价格,会实打实地改变很多团队的 AI 编程预算表。更多 AI 编程工具的横评和教程,欢迎持续关注 XIA345 AI 指南

数据来源:本文基准数据引自 智谱 GLM-5.3 官方博客官方模型文档;智谱定价引自开放平台定价页;Claude 定价引自 Anthropic 官方定价文档;GPT 定价引自 OpenAI 官方定价页。价格按 1 美元 ≈ 7.1 元人民币折算,以各官方页面实时价格为准。

常见问题

GLM-5.3 免费吗?

不完全免费。GLM-5.3 API 按量计费(输入 ¥8 / 输出 ¥28 每百万 tokens);但智谱新用户注册即送 2,000 万 tokens 免费资源包,平台的体验中心也可以免费试用模型。需要永久免费选项的用户,GLM-4.7-Flash 完全免费。

GLM-5.3 和 Claude Opus 4.8 哪个好?

日常软件工程任务(修 Bug、重构、真实仓库开发)GLM-5.3 领先约 9~11 分,极限难题 Opus 4.8 仍领先;价格上 GLM-5.3 是对方的 1/5~1/6。综合性价比选 GLM-5.3,追求单点极致质量且预算充足选 Claude(当前最强为 Fable 5)。

GLM-5.3 什么时候开源?

官方在 2026 年 8 月 14 日的发布博客中承诺:安全评估与加固完成后,发布两周内开放权重,即 2026 年 8 月底前后可在 HuggingFace 等渠道下载。届时 GLM-5.3 将成为可私有化部署的最强编程模型。

GLM-5.3 能在 Claude Code 里用吗?

可以。订阅 GLM Coding Plan 后,将 Claude Code 的 baseurl 配置为 `https://open.bigmodel.cn/api/anthropic` 即可用套餐额度调用 GLM-5.3。官方支持的工具还有 Cline、Kilo Code、OpenCode、OpenClaw、TRAE、CodeBuddy、ZCode 等 20 余款。

GLM-5.3 的思考模式能关掉吗?

不能。GLM-5.3 取消了禁用思考的选项,`thinking.type` 仅支持 `enabled`;想控制 token 消耗,应使用 `reasoning_effort` 参数在 low / high / max 三档之间调节(默认 max)。这是它和 GLM-5.2 在 API 层面的一个不兼容变更,迁移代码时需要注意。

GLM-5.3 支持多长的上下文?

1M(100 万)tokens 上下文,与 GLM-5.2 持平。按 GLM 系列词表约 1 token ≈ 1.6 个汉字换算,约相当于 160 万汉字,可一次性处理中型项目全量源码、超长文档或数小时对话历史。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-29

© 2026 AI345 · All Rights Reserved

用户服务协议·隐私政策