
Claude 新模型泄露:claude-marshmallow-eap 和 claude-melon-eap 是什么?实测表现与上线时间预测
2026 年 8 月 24 日,两个从未公开的 Claude 模型代号 claude-marshmallow-eap(棉花糖)和 claude-melon-eap(甜瓜)在 Anthropic API 中被开发者发现。它们是什么、实测强不强、是不是 Opus 5.1 和新 Haiku、什么时候能用?一篇讲清。
claude-marshmallow-eap 和 claude-melon-eap 是 Anthropic 尚未发布、正在小范围内测的两个 Claude 新模型代号,2026 年 8 月 24 日被开发者在 API 中意外发现。社区普遍猜测:前者是 Claude Opus 5.1,后者可能是新一代 Haiku 或 Sonnet 小版本更新。
如果你刚刷到「Claude 棉花糖」「Claude 甜瓜」这两个奇怪的名字,想弄清楚它们到底是什么——一句话版本:这是 Anthropic 两个内测模型的代号,分别叫 Marshmallow(棉花糖)和 Melon(甜瓜),代号后缀 -eap 是 Early Access Program(早期访问计划)的缩写,说明模型已经造出来、正在给一小批开发者试用,距离正式发布大概率不远了。
这件事发生在 2026 年 8 月 24 日。截至发文,Anthropic 官方既没承认也没否认,没有任何定价、模型卡和发布时间信息。本文把已知事实、早期实测、模型定位分析和上线预测一次讲清楚,并告诉你现在该不该等、要不要换模型。
claude-marshmallow-eap 和 claude-melon-eap 是什么?
先给一个可以直接引用的定义:
claude-marshmallow-eap 和 claude-melon-eap 是 Anthropic 两个未发布 Claude 模型的内部代号。-eap 后缀(Early Access Program,早期访问计划)表明它们是正式上线前供少数开发者试用的内测版本——也就是说,模型本体真实存在,不是空穴来风的 rumor。
关键信息速览:
| 项目 | claude-marshmallow-eap(棉花糖) | claude-melon-eap(甜瓜) |
|---|---|---|
| 性质 | 未发布内测模型代号 | 未发布内测模型代号 |
| 社区主流猜测 | Claude Opus 5.1(Opus 5 的修正版) | 新一代 Haiku,或 Sonnet 档小更新 |
| 早期实测表现 | 更强,对话自然度好于 Opus 5 | 稍弱,但同样有不错表现 |
| 是否旗舰级 | 否,未达到 Fable 级别 | 否,未达到 Fable 级别 |
| 现在能否调用 | 暂不能,无公开 API ID | 暂不能,无公开 API ID |
| 发现渠道 | Anthropic API、Discord 社区 | 同左 |
「棉花糖」和「甜瓜」这些代号怎么来的
Anthropic 的习惯是:未发布的模型用食物类代号,正式发布时再换成正式名称。之前的先例包括蜂蜜(Honeycomb)、神话(Mythos)等。也有社区用户提到还见过 mangosteen(山竹)、horchata(米浆)等其他代号,但这一说法目前只有单一来源,未经证实。
另外值得注意的是,Anthropic 的内部构建版本过去更多用动物命名(比如耳廓狐 Fennec、袋狸 Numbat)。这次连续出现食物系代号,有分析认为可能意味着内部开启了一条新的模型分支——不过这属于推测,官方从未解释过命名规则。
泄露时间线:24 小时内发生了什么
这次泄露的信息密度很高,短短一天内经历了「发现 → 爆料 → 实测流出 → 全网发酵」四个阶段:
- 8 月 24 日凌晨:有开发者在使用 Anthropic API 时发现了
claude-marshmallow-eap和claude-melon-eap两个从未公开的模型标识,相关截图随后流传到 Discord 社区。 - 8 月 24 日上午:X(Twitter)账号 Lentils80 发布「Scoop」爆料帖,确认 Anthropic 正在测试这两个模型,24 小时内获得约 9 万次浏览和数百转发。
- 随后数小时:科技资讯媒体和加密社区媒体跟进报道;开发者 kimmonismus 等人放出了疑似来自两个模型的实际输出内容。
- 8 月 24 日晚间:中文社区开始发酵,知乎、36 氪、新智元等陆续发布解读,「Claude 棉花糖」「Claude 甜瓜」成为热词。

原始爆料帖的核心内容有三点(来源:Lentils80 的 X 帖子):
- Anthropic 正在测试名为 claude-marshmallow-eap 和 claude-melon-eap 的两个新模型;
- 「棉花糖」表现比「甜瓜」更好,对话体验甚至好于现在的 Opus 5;
- 但两个模型都不是 Fable 级别(Fable 是 Anthropic 目前的最强旗舰)。
早期实测:Marshmallow 和 Melon 表现怎么样?
目前流出的「评测」全部来自内测开发者的非正式测试,样本很小,参考价值有限,但信息本身很有意思。
实测一:3D 空间任务表现突出
拿到模型输出样本的开发者发现,两个模型被大量用于 3D 强化学习(RL)类任务——比如在 3D 场景中摆放建筑物,模型给出的布局「相当不错」。这被解读为 Anthropic 在重点测试模型的空间理解和推理能力,也可能是下一代模型的主打能力方向之一。
实测二:Medium 推理档位就有好结果
科技分析师 kimmonismus 的评价是:新模型「即使开到 Medium(中等)推理强度,结果也相当不错」,并猜测其中较强的那个就是 Opus 5.1。
为什么这句话重要?因为 Opus 5 的核心槽点恰恰是表现不稳定——推理强度拉满才好用,调低就明显掉链子(下文详说)。如果新模型在 Medium 档就能稳定输出高质量结果,等于直接修复了 Opus 5 被批评最多的短板,还能帮用户省下大量推理 token 费用。
实测三:思考 token 消耗巨大
爆料者也提到一个反面观察:两个模型的思考(thinking)token 消耗非常大,测试中多次撞到 max-tokens 上限。如果正式发布时仍是这样,实际使用成本可能不低,这一点需要等正式版验证。
汇总:早期口碑一览
| 观察点 | 结论 | 可信度 |
|---|---|---|
| Marshmallow 强于 Melon | 多个来源一致 | 较高 |
| 对话自然度好于 Opus 5 | 爆料者主观感受 | 中等 |
| Medium 推理档位表现好 | 单一分析师测试 | 中等 |
| 未达 Fable 旗舰级别 | 多个来源一致 | 较高 |
| 思考 token 消耗大 | 爆料者实测 | 中等 |
| 3D 任务能力突出 | 少量输出样本 | 偏低,待验证 |
再次强调:以上全部是未经官方确认的社区信息。在 Anthropic 发布模型卡和基准测试之前,任何「跑分」都只能当参考。
两个新模型到底是什么定位?
要判断 Marshmallow 和 Melon 在产品线里的位置,先看 Claude 当前的模型家族(截至 2026 年 8 月):
| 模型 | 输入/输出价格(每百万 token) | 上下文 | 上线时间 | 定位 |
|---|---|---|---|---|
| Claude Fable 5 | $10 / $50 | 100 万 | 2026 年 6 月 9 日 | 最强旗舰,价格也最贵 |
| Claude Opus 5 | $5 / $25 | 100 万 | 2026 年 7 月 24 日 | 主力模型,默认开启思考 |
| Claude Sonnet 5 | $3 / $15(8 月底前介绍价 $2 / $10) | 100 万 | 2026 年 6 月 30 日 | 性价比款,编码接近 Opus |
| Claude Haiku 4.5 | $1 / $5 | 20 万 | 2025 年 10 月 15 日 | 轻量快速款,已 10 个月未更新 |
对照这张表,社区对两个新模型的定位有两派看法:
看法一(主流):Marshmallow 是 Opus 5.1,Melon 是新一代 Haiku。
支持理由很充分:
- Opus 5 上线一个月就陷入口碑危机(下节详说),Anthropic 有强烈动机尽快推出修正版。2026 年上半年 Opus 已经从 4.6 迭代到 4.8 再到 5.0,节奏很快,「5.1 修 bug 版」完全符合惯例。
- Haiku 4.5 是全家族最老的模型,已经 10 个月没更新,而它对应的低价高频场景(分类、摘要、批处理)正被开源模型疯狂蚕食,补一个新 Haiku 是防守刚需。
- 爆料中「更强的那个对话更自然」,与「修复 Opus 5 性格不稳定」的动机吻合。
看法二(少数):Melon 可能是 Sonnet 档的小更新。
也有爆料者认为两个模型「更接近 Opus 或 Sonnet 档」,即 Melon 未必是 Haiku,只是 Sonnet 5 的中期小版本。这种解读下,这次更新就没有覆盖低价档,激进程度低于看法一。
诚实的结论是:一个 Opus 系模型 + 一个更小定位模型的组合概率最大,但「更小的那个」到底是 Haiku 还是 Sonnet 更新,目前无法确认。 答案要等官方发布才能揭晓。
为什么 Anthropic 现在急着上新模型?
这次泄露之所以受关注,是因为它出现在 Anthropic 一段相当微妙的时期。三件事叠加,让「赶紧发新模型」变成刚需。
Opus 5 的口碑危机
Opus 5 上市一个月,社区对它的评价逐渐演变成公开批评:模型「懒、糙、啰嗦」,同样的问题在不同设置下表现差异巨大,也就是不稳定。Claude 团队成员 Thariq 在 X 上公开承认「Opus 5 是一个表现很尖刺(spiky)的模型」,并表示让模型「稳定、温暖、有 Claude 味」是当前最高优先级。
这轮公开对话发生在泄露前几天。有社区观点认为,开发者正是在批评声最高的时候拿到的内测版本——新模型在 Medium 推理档位的稳定表现,恰好就是对这些批评的回应。
Fable 5 卖不动了
支付公司 Ramp 统计了约 7 万家美国企业的 AI 采购数据(金融时报报道):
- Fable 5 的收入只占 Anthropic 自身收入的 11.4%,token 销量占比只有 6%;
- 作为对比,OpenAI 的旗舰 GPT-5.6 Sol 占 OpenAI token 销量的 25%、收入的 23%;
- 更便宜的 Opus 5 上线不到一个月,销量就超过了贵一倍的旗舰大哥 Fable 5。
一项基准测试的数据更能说明问题:Fable 5 拿 70.5 分每个任务要花 17.32 美元,Opus 5 拿 70.0 分只要 8.23 美元——差半分,价格差一倍多,企业用脚投票。
竞争和资本的双重压力
更大的背景是:开源模型在 4 个月内把 token 市场份额从约 11% 抬到了 62%(FT 引用的行业数据),所有闭源厂商的每个价位都面临冲击。与此同时,Anthropic 年化收入 5 月约 470 亿美元、7 月约 650 亿美元,低于投资人此前押注的 800 亿;增速也被 OpenAI 首次反超。而这一切都发生在 Anthropic 冲刺更高 IPO 估值的节骨眼上。
把三件事连起来看:Marshmallow 和 Melon 的出现时机就不是巧合,而是一套组合拳——用一个修复版 Opus 稳住口碑,用一个更便宜的小模型守住低价市场。
什么时候上线?EAP 泄露的历史规律
「代号泄露」在 Anthropic 不是第一次发生,而且前两次都精准对应了后来的正式发布:
| 泄露代号 | 泄露时间 | 对应正式模型 | 正式发布 | 间隔 |
|---|---|---|---|---|
| Mythos | 2026 年 3 月 | Claude Fable 5 | 2026 年 6 月 9 日 | 约 2 个多月 |
| Honeycomb(出现在 Cursor 模型选择器,标注 100 万上下文) | 2026 年 7 月 9 日 | Claude Opus 5 | 2026 年 7 月下旬 | 约 16 天 |
| Marshmallow / Melon | 2026 年 8 月 24 日 | ? | ? | —— |

规律很明显:代号被抓包到正式发布,窗口大约 2 到 4 周。其中 Honeycomb 的先例最接近这次——同样是 -eap 后缀内测版被外部发现,16 天后 Opus 5 正式上线。按这个节奏推算,Marshmallow 和 Melon 如果真要落地,大概率在 2026 年 9 月上中旬之前,中文媒体已有「最快下周」的说法。
但也要泼一盆冷水:也有反例。代号 Numbat 曾在泄露后安静地躺了几个月都没发布。代号泄露证明「模型存在」,但不能保证「马上发布」。一切以 Anthropic 官方公告为准,不信小道消息的具体日期。
现在该做什么:三类人的行动建议
如果你是 API 开发者
- 不要改动现有代码。 两个新模型目前没有任何公开 API ID、没有价格、没有模型卡。现在网上任何声称能「付费体验 Marshmallow」的服务都和这次泄露无关,谨防上当。
- 新模型正式发布后,供应商目录通常几小时到几天内就会跟上,到时再评估迁移不迟。
- 首周谨慎尝鲜。 发布初期的版本往往不稳定,建议先用小流量灰度,配合回退策略,而不是全量切换。如果对模型路由和降级策略感兴趣,可以看这篇 Claude Code 替代品与工具选型指南。
如果你是 Claude 订阅用户(Pro / Max)
- 现有订阅无需任何操作,新模型上线后会自动进入你的可用列表(历史上 Claude 新模型都是这样 rollout 的)。
- 如果你被 Opus 5 的「不稳定」折磨,新版本大概率就是解药,建议等几天而不是现在退订。
- 付费和充值相关的注意事项,可以参考 Claude Code 充值订阅全攻略。
如果你是观望中的新用户
- 不用为了「等新模型」而推迟上手。当前 Sonnet 5 / Opus 5 的能力对绝大多数任务已经够用,工具使用经验比等某一个模型更重要。
- 编程场景还在选工具的话,先看 Cursor 和 Claude Code 怎么选;想了解大模型回答质量波动是怎么回事,可以读 GPT-5.6 降智了吗:回答变短的真相,原理对 Claude 同样适用。
总结
claude-marshmallow-eap 和 claude-melon-eap 的泄露,表面看是两个有趣的代号,背后其实是 Anthropic 的一次关键补救:Opus 5 口碑告急、Fable 5 销量遇冷、开源模型步步紧逼,公司需要在几周内拿出一个「更好用的 Opus」和一个「更便宜的小模型」。
给你三个可以带走的判断:
- 两个模型真实存在,且临近发布——EAP 代号 + 2 到 4 周的历史规律,指向 2026 年 9 月上中旬;
- Marshmallow 大概率是 Opus 5.1,主打修复稳定性和对话体验,不是更强大脑;Melon 的定位(新 Haiku 还是 Sonnet 更新)是最大悬念;
- 现在什么都不用做——不换模型、不退订、不改代码,等官方公告即可。发布后我们会第一时间更新实测对比,欢迎收藏本页。
常见问题
claude-marshmallow-eap 和 claude-melon-eap 是什么?
它们是 Anthropic 两个未发布 Claude 模型的内测代号,2026 年 8 月 24 日被开发者在 API 中发现。`-eap` 后缀代表 Early Access Program(早期访问计划),即正式发布前的内测版本。社区猜测它们分别是 Claude Opus 5.1 和新一代 Haiku(或 Sonnet 更新),均未经官方证实。
EAP 是什么意思?
EAP 是 Early Access Program(早期访问计划,也叫早期预览 Early Access Preview)的缩写,指模型正式上线前提供给少数开发者的有限测试版本。在 Anthropic 的历史中,带 `-eap` 后缀的代号出现后,正式模型通常在 2 到 4 周内发布。
Claude Marshmallow 和 Melon 现在能用吗?
不能。两个模型目前没有公开的 API ID、没有价格、没有模型卡,任何人都无法正式调用。网上声称提供 Marshmallow / Melon 体验的服务均与本次泄露无关。请以 [Anthropic 官网](https://www.anthropic.com/)公告为准。
Claude Marshmallow 是 Opus 5.1 吗?
未证实,但这是可能性最大的猜测。依据:它强于 Melon、对话体验好于 Opus 5、未达 Fable 旗舰级,且 Opus 5 正深陷口碑危机,Anthropic 有强烈动机尽快推出修正版。正式名称也可能与代号不同,最终以官方发布为准。
Claude Melon 是新一代 Haiku 吗?
有可能但不确定。Haiku 4.5 已经 10 个月未更新,是 Claude 家族最老的模型,更新需求强烈;但也有爆料者认为 Melon 更接近 Sonnet 档的小版本更新。两种说法都存在,无法确认。
新模型什么时候正式发布?
没有官方时间表。按 Mythos→Fable 5(约 2 个月)和 Honeycomb→Opus 5(约 16 天)的先例,社区普遍预期在 2026 年 9 月上中旬之前,中文媒体有「最快下周上线」的说法。但也存在代号长期不发布的反例(如 Numbat),请以官方公告为准。
新模型会比现在的 Opus 5 强吗?
从泄露信息看,Marshmallow 的对话自然度好于 Opus 5,且在 Medium 推理档位就有稳定表现,方向上是「修复 Opus 5 的不稳定」而非大幅拉高上限。它不会达到旗舰 Fable 5 的水平。属于「变得更好用」而不是「变得更强」的更新。
新模型的价格会变吗?
未知。多数分析认为 Marshmallow 会延续 Opus 5 的 $5 / $25 定价(点更新通常不动价格),而如果 Melon 是新 Haiku,其 $1 / $5 档位定价能否守住将是最大看点——因为低价档正被开源模型挤压,Anthropic 可能降价或提供介绍价应对。以上均为推测。

京ICP备2024094994号-29