
Claude Opus 5 降智了吗?现象记录、原因分析与应对方法(2026 年 8 月)
Claude Opus 5 降智是真的吗?本文记录 2025–2026 两波降智事件的完整时间线,拆解 Anthropic 官方承认的 3 个 Bug 与 Opus 5 不稳定问题,并给出 6 步自测排查法与应对清单,帮你快速分清是官方的锅还是自己的问题。
最后更新:2026 年 8 月。本文信息来自 Anthropic 官方 Postmortem 与工程团队公开回应、开发者社区一手排查记录(X / GitHub / Hacker News),以及机器之心、量子位、新智元等媒体的交叉报道,全部可溯源。封面及文中信息图均为 XIA345 原创制作。
TL;DR:三句话结论
赶时间的读者直接看结论:
- 降智是真的,官方已经认账:2026 年 4 月 23 日,Anthropic 发布官方复盘《A postmortem of three recent issues》,承认 Claude Code 存在 3 个导致「降智」的 Bug;8 月 24 日,Claude Code 工程师 Thariq Shihipar 又公开承认 Opus 5「表现忽高忽低、不稳定」,修复是团队当前最高优先级。
- 大部分降智出在运行框架层,不是模型本体:官方明确表示模型本身未退化、Claude API 未受影响,问题集中在 Claude Code 与 Agent SDK 的运行框架(Harness)——推理等级降档、缓存 Bug 清空思考记录、提示词长度限制,三件事叠加造成了「广泛且不一致」的体验下滑。
- 用户能做的:先用本文的「6 步自测法」排除自身问题(版本、缓存、长会话),确认是官方侧问题后,错峰使用或临时切换备选模型,并关注官方修复动态,别在自己代码里瞎折腾一下午。
Claude Opus 5 降智了吗?先给答案
是真的,但情况和大多数人想的不一样。
Opus 5 是 Anthropic 于 2026 年 7 月 24 日发布的旗舰模型,接替 Opus 4.8,拥有 100 万 token 上下文,定价与上一代持平(输入 $5 / 输出 $25 每百万 token),并成为 Claude Max 的默认模型。发布时的成绩单相当亮眼:综合得分 82.72、SWE-bench Pro 79.2%、Terminal-Bench 86.7%。
但发布不到一个月,2026 年 8 月 23 日,开发者 argofowl 在排查一下午后,从 API 请求日志里发现 Claude Code 2.1.237 及以上版本把「high」推理档位读成了 10 out of 100——界面显示的明明是最高档。随后科技博主 Chubby 直言「Opus 5 现在感觉像是一次显著的降级」:敷衍了事、频犯低级错误、被指出问题后只会机械回复「你说得对,是我疏忽了」。
面对追问,Claude Code 工程师 Thariq Shihipar 公开承认:Opus 5 是一个「表现很不稳定」的模型,忽高忽低,团队内部正在以最高优先级解决。
所以结论分两层:
- 「Claude 整体偷偷降智」——部分属实,官方承认了 3 个框架层 Bug 和 A/B 测试不透明的问题;
- 「Opus 5 模型本体被偷偷削弱」——目前没有证据,官方口径是模型与 API 未变,问题出在运行框架与模型本身的稳定性波动上。
「降智」是什么意思?
「降智」是中文 AI 社区的说法,指同一个模型在没有换版本、没有改设置的情况下,回答质量肉眼可见地下滑:变笨、变懒、变啰嗦,或者忘记之前说过的话。
对应到英文社区,大家说的是 "Claude got dumber"、"lobotomized"(被切除脑叶),还有人造了一个新词——AI shrinkflation(AI 缩水通胀):同样的价格,你拿到的是稀释过的产品。
需要区分的是:降智 ≠ 模型能力退化。2026 年 4 月官方复盘已经说明,多数「降智」来自产品层的 Bug 和实验(推理档位、缓存、提示词),模型权重本身并没有被动过手脚。但对用户来说,体验上没有区别——你关心的是「今天的 Claude 不好用了」,而不是 Bug 出在哪一层。
现象记录:用户遇到的 5 种典型「降智」表现
综合 GitHub Issues、Hacker News、X 和 Reddit 的用户反馈,「降智」主要有这 5 种表现:
- 越聊越傻:长会话里逐渐忘记自己在做什么,重复之前的步骤,工具调用混乱——这是缓存 Bug 的典型症状(详见下文原因分析)。
- 道歉循环:被指出没按指令执行后,只会回复「你说得对,是我疏忽了」,然后继续犯同样的错,翻来覆去没完没了。
- 造 Bug 修 Bug:自己制造 bug,再耗费大量时间去修,同一任务中反复自我纠正,效率极低。
- 敷衍偷懒:回答明显变短,跳过关键步骤,选「最简单的修复」而不是正确的修复。
- 啰嗦抬杠:解释一大堆不干活,或者在不需要确认的地方反复停下来问。
最有分量的一份证据来自 AMD AI 组高级总监 Stella Laurenzo 在 2026 年 4 月发布的硬核审计报告:她分析了 6852 份会话文件、17871 个思考块、超过 23 万次工具调用,发现从 2026 年 2 月开始,模型的推理深度出现断崖式下滑,且模型明显倾向陷入「推理循环」(reasoning loops)。

把两波事件拉成一条时间线看,你会发现「降智」不是一次孤立事故,而是反复出现的模式:2025 年 8 月 Anthropic 就发过一次类似复盘(影响 Opus 4.0/4.1),2026 年 4 月又来一次,8 月 Opus 5 时代再次爆发。
原因分析一:官方承认的 3 个 Bug(2026 年 4 月)
2026 年 4 月 23 日,Anthropic 在官方博客发布《A postmortem of three recent issues》,把过去两个月的「降智」拆解为三个独立问题:

Bug ① 推理等级偷偷降档(3 月 4 日上线,4 月 7 日撤回)
为了降低部分用户在高档位下的超长延迟,官方把 Claude Code 的默认推理强度从「high」调成「medium」,但界面仍然显示「high」。用户以为自己在用满血版,实际拿到的是降档货。4 月 7 日,在用户反馈「宁愿要更高智能」后官方撤回了改动,但撤回过程又影响了 Sonnet 4.6。
Bug ② 缓存 Bug 清空思考记录(3 月 26 日上线,4 月 10 日修复)
本意是优化:会话闲置超过 1 小时后,重新进入时清理旧的「思考」内容。结果代码有 Bug,清理操作在后续每一轮对话中都会触发——Claude 继续干活,但逐渐忘了自己为什么要干这件事。健忘、重复、工具调用乱飞都是这个 Bug 的症状。更糟的是,思考记录被反复清除导致每次请求缓存未命中,token 消耗反而飙升。这个 Bug 花了 15 天才修好。
Bug ③ 一句提示词砸了输出质量(4 月 16 日上线,4 月 20 日回滚)
官方在系统提示词里加了一条「降低冗长度」的指令:「工具调用之间的文字不超过 25 个词,最终回复不超过 100 个词」。这条指令与其他提示词改动叠加后,限制了模型处理复杂任务时的思考深度,直接导致编码质量下降,Opus 4.6 和 4.7 都掉了约 3% 的性能,四天后紧急回滚。
官方的关键澄清:这三个问题作用于不同的用户流量切片、在不同时间段生效,叠加起来的效果就是 Claude Code「持续、不均匀地变差」,但谁也说不清哪里不对。同时官方强调——模型本身没有能力退化,Claude API 未受影响,问题出在 Claude Code 和 Agent SDK 的运行框架(Harness)层,基于该 SDK 的 Cowork 同样受影响。作为补偿,所有用户的使用额度被重置。
原因分析二:A/B 测试不透明,「high」变成 10(2026 年 8 月最新)
8 月的新一轮风波,主角换成了 Opus 5 时代的 Claude Code。
开发者 argofowl 花了整整一个下午排查「Claude 突然变笨」:先怀疑是 t3 code 崩了,又怀疑自己的代码有 Bug,最后甚至怀疑自己把 Mac 搞坏了。直到打开 API 的真实请求日志,里面赫然写着一个数字——「10」。而他明明选的是最高档「high」。
事后查明:从 Claude Code 2.1.237 开始,模型把「high」推理程度读成了 10 out of 100,而这个数字恰好是过去「low」档对应的值。细扒发现,Anthropic 把 2.1.236 及以上版本的 Fable 5 会话纳入了一个「压缩 effort 数值刻度」的实验——大概率是 A/B 测试,所以不是人人都会撞上。老版本会话和 Opus 5 不受这个实验影响。
Claude Code 工程师 Thariq Shihipar 的回应很快:这只是在 Claude Code 里预先测试 API 的服务配置,改的是 effort 的数值映射方式,「你选的 effort 就是你拿到的 effort」,团队做了深入评测确认不影响模型性能。
但开发者真正的痛点在于:你把我拉进了实验组,却不打算告诉我。 更新日志里一个字没写。正如 36 氪报道里说的:模型强一点弱一点还能忍,「那我这一下午到底在 debug 什么?是在调自己的代码,还是在调你的 A/B 测试?」
这件事撕开了行业的一个暗伤:同一个模型名称之下,服务端可能随时进行 A/B 测试、更换量化方案、调整模型路由。传统软件有版本号、更新日志和回滚机制,而大模型的版本更新是最不透明的黑箱——人们手里唯一的仪表盘,只剩下自己的体感。
原因分析三:Opus 5 模型本身不稳定(官方承认)
解决了 effort 刻度问题后,博主 Chubby 继续追问,Thariq 给出了更直白的承认:Opus 5 是个「表现很不稳定」的模型,忽高忽低,团队内部正以最高优先级解决。
这解释了很多 Opus 5 用户的困惑——为什么同一道题,上午做出来是满分,下午就敷衍了事。这不是你的错觉,也不全是框架 Bug,模型本身的输出稳定性确实存在波动。
对使用者的启示:在官方修复落地前,重要任务建议多跑几次取最优结果,或者在关键节点切换其他模型交叉验证,而不是默认单次输出就是最终答案。
原因分析四:跑分与体感脱钩,为什么你觉得变笨了但跑分没变
Opus 5 身上同时存在两种截然相反的评价:
- 跑分侧:综合 82.72、SWE-bench Pro 79.2%、Terminal-Bench 86.7%,几乎无可挑剔;
- 体感侧:「啰嗦」「偷懒」「爱抬杠」「显著降级」。
为什么?三个原因:
- 基准测试是单轮、干净上下文的短任务,而真实使用是长会话、多工具调用、带历史包袱的复杂工程——恰好是缓存 Bug 和长上下文退化影响最大的场景。
- 准确率指标测不出「推理深度」。审计报告发现的是推理深度下滑和推理循环,这在不考核思考过程的基准里几乎不可见。
- A/B 测试按流量切片生效,跑分机构测到的可能是对照组,你日常用到的可能是实验组。
一个佐证是 BridgeMind 的 BridgeBench 测试曾显示 Opus 4.6 准确率从 83.3% 掉到 68.3%、排名从第 2 跌到第 10——虽然这份测试后来被批评方法论有问题(前后测试的任务数量不一样),但「跑分永远向上、体感一路向下」的叙事已经传开了。
所以当你觉得自己用的模型「变笨了但评测都说没变」时,不一定是错觉:你的使用场景,可能恰好落在基准测试覆盖不到、而官方实验覆盖到的位置。
如何自测 Claude 是否降智:6 步排查法
怀疑降智时,按这个顺序排查,避免浪费一下午:

第 1 步:固定题目跑基准。 准备 3–5 道固定测试题(至少 1 道复杂工程题),存成模板。发现变笨的当天立刻跑一遍,和历史输出对比。这是唯一能客观量化的手段。
第 2 步:查版本号。 执行 claude --version,到 GitHub Releases 看近期更新日志。8 月这次事件的分界线就是 2.1.237——降级或升级版本可以快速验证问题是否与版本相关。
第 3 步:查 API 真实请求。 有 API 权限就抓请求日志,看 effort / thinking 参数的实际值。argofowl 正是靠这一招发现「high 变成 10」的。眼见为实,别信界面显示。
第 4 步:开新会话排除缓存。 新建会话、清理旧上下文再测。长会话本身就会导致质量下滑(上下文腐蚀),别把「聊太长」误判成「降智」。
第 5 步:看社区实锤。 搜索 GitHub Issues、Hacker News、X 上的最新讨论。如果大量用户在同一时段吐槽同样的问题,基本可以确认是官方侧问题,而不是你的环境问题。
第 6 步:错峰 + 备胎。 使用高峰期质量波动更明显,可以错峰重试;关键任务准备第二模型做对照或兜底(详见下一节)。
一条经验法则:同一道题、同一版本、新会话里稳定复现质量下滑,且社区同期有同样反馈——那就不是你的问题。等官方修复或切换模型,别在自己的代码里瞎折腾。
Claude 降智了怎么办?应对方法清单
按「确认是谁的问题」分三种情况处理:
情况一:确认是官方 Bug(社区同反馈 + 固定题复现)
- 到 GitHub 仓库提 Issue 或在已有 Issue 下补充你的复现案例,信息越具体越有用;
- 关注官方工程账号的修复动态,重大 Bug 一般会伴随额度重置等补偿;
- 期间降低对该模型的依赖度,重要任务延后或分流。
情况二:自身使用方式导致的「伪降智」
- 控制会话长度,长任务拆分会话,善用
/compact之类的上下文压缩; - 升级到最新版客户端(Bug 修复通常随版本发布);
- 检查自己的系统提示词 / CLAUDE.md 是否引入了类似「限制回复长度」的指令——官方 4 月那次翻车就是一条 25 词限制引起的。
情况三:需要长期稳定的工程方案
- 建立「双模型流水线」:主力模型 + 备选模型,关键产物交叉验证。目前社区常见组合是 Claude Code 搭配 Codex,或搭配高性价比的开源模型方案;
- 国产模型里,编程能力已进入第一梯队:GLM-5.3 的 Terminal Bench 3.0 等基准达到开源第一,输出价格约为 Claude Opus 的 1/6,可作为成本友好的备选,详见我们此前的评测《GLM-5.3 深度评测:能力、价格与 Claude/GPT 对比》;
- 想系统性了解 Claude 模型线的下一步动向,可以看这篇《Claude 新模型泄露:claude-marshmallow-eap 和 claude-melon-eap 是什么?》;
- 更多 AI 编程工具的横向对比,可在 XIA345 AI 导航 中查找。
常见问题 FAQ
问:Claude Opus 5 降智是真的吗?官方承认了吗?
答:是真的,且官方已两次认账。2026 年 4 月 23 日 Anthropic 发布官方复盘,承认 Claude Code 存在 3 个导致降智的 Bug(推理等级降档、缓存清空思考记录、25 词提示词限制);8 月 24 日工程师 Thariq Shihipar 又公开承认 Opus 5 本身「表现忽高忽低、不稳定」,修复是团队最高优先级。
问:Claude 降智会影响 API 用户吗?
答:4 月官方复盘明确表示模型本身未退化、Claude API 未受影响,问题集中在 Claude Code 和 Agent SDK 的运行框架层。也就是说:直接调 API 的用户基本不受这三个 Bug 影响;用 Claude Code、Cowork 或基于 Agent SDK 的工具时才会中招。
问:Claude Code 显示 high 但实际是 10,是怎么回事?
答:这是 2026 年 8 月曝光的「effort 刻度压缩」实验:Claude Code 2.1.236+ 的部分 Fable 5 会话被纳入实验组,数值映射方式改变导致日志里显示 10。官方回应称不影响实际性能(你选的档位就是你拿到的档位),但更新日志未披露。怀疑自己中招,可以降级客户端版本验证。
问:Claude 降智了怎么恢复?
答:分两步。先按 6 步自测法确认是不是官方问题;如果是自身使用问题,开新会话、升级客户端版本、精简系统提示词通常能立刻改善。如果是官方 Bug(社区同期大量反馈),只能等官方修复——历史上三次重大降智都在 4–15 天内被修复或回滚。
问:Opus 5 和 Fable 5 哪个更稳定?
答:目前都没有完全稳定:Fable 5 会话撞上过 effort 刻度实验,Opus 5 被官方承认输出稳定性波动。差异在于 Opus 5 定价约为 Fable 5 的一半且是 Claude Max 默认模型,而 Fable 5 综合能力更强。追求稳定输出的关键任务,建议两个模型交叉验证,或多轮取样。
问:遇到降智可以要求补偿吗?
答:可以预期但有不确定性。2026 年 4 月的降智事件中,Anthropic 重置了所有用户的使用额度作为补偿。不过有网友指出重置有时与正常的周期重置重合,实际价值有限。如果降智影响了付费订阅的核心使用,可通过官方渠道反馈。
总结
回到最初的问题:Claude Opus 5 降智了吗?
降智是真的,官方也已承认——但它不是一个简单的「模型被调笨了」的故事,而是三个框架层 Bug、一场不透明的 A/B 测试、一个稳定性待修复的新模型,外加跑分与体感长期脱钩,共同演出的一场罗生门。
对普通用户,记住三件事就够了:
- 先自测再下结论——固定题目、查版本、看日志,区分官方问题和自身问题;
- 别把鸡蛋放在一个模型里——关键任务准备备选模型,这也是 4 月事件后 HN 评论区里被重复最多的一句忠告;
- 盯官方动态——Anthropic 的 postmortem 透明度在业内算好的,修复通常以天为单位推进。
本文会随事件进展持续更新。更多 AI 工具的深度评测与教程,欢迎收藏 XIA345 AI 指南 栏目。
参考来源:
- Anthropic 官方复盘:A postmortem of three recent issues
- Anthropic 官方:Claude Opus 5 发布页
- Hacker News 讨论:相关帖子
- 新智元 / 36 氪(2026-08-24)、机器之心(2026-04-24)、量子位(2026-04-25)相关报道

京ICP备2024094994号-29