Claude 新模型泄露:claude-marshmallow-eap 和 claude-melon-eap 是什么?实测表现与上线时间预测封面图
AI 编程约 9 分钟

Claude 新模型泄露:claude-marshmallow-eap 和 claude-melon-eap 是什么?实测表现与上线时间预测

AI 指南··0 浏览

2026 年 8 月 24 日,两个从未公开的 Claude 模型代号 claude-marshmallow-eap(棉花糖)和 claude-melon-eap(甜瓜)在 Anthropic API 中被开发者发现。它们是什么、实测强不强、是不是 Opus 5.1 和新 Haiku、什么时候能用?一篇讲清。

claude-marshmallow-eap 和 claude-melon-eap 是 Anthropic 尚未发布、正在小范围内测的两个 Claude 新模型代号,2026 年 8 月 24 日被开发者在 API 中意外发现。社区普遍猜测:前者是 Claude Opus 5.1,后者可能是新一代 Haiku 或 Sonnet 小版本更新。

如果你刚刷到「Claude 棉花糖」「Claude 甜瓜」这两个奇怪的名字,想弄清楚它们到底是什么——一句话版本:这是 Anthropic 两个内测模型的代号,分别叫 Marshmallow(棉花糖)和 Melon(甜瓜),代号后缀 -eap 是 Early Access Program(早期访问计划)的缩写,说明模型已经造出来、正在给一小批开发者试用,距离正式发布大概率不远了。

这件事发生在 2026 年 8 月 24 日。截至发文,Anthropic 官方既没承认也没否认,没有任何定价、模型卡和发布时间信息。本文把已知事实、早期实测、模型定位分析和上线预测一次讲清楚,并告诉你现在该不该等、要不要换模型。

claude-marshmallow-eap 和 claude-melon-eap 是什么?

先给一个可以直接引用的定义:

claude-marshmallow-eap 和 claude-melon-eap 是 Anthropic 两个未发布 Claude 模型的内部代号。-eap 后缀(Early Access Program,早期访问计划)表明它们是正式上线前供少数开发者试用的内测版本——也就是说,模型本体真实存在,不是空穴来风的 rumor。

关键信息速览:

项目 claude-marshmallow-eap(棉花糖) claude-melon-eap(甜瓜)
性质 未发布内测模型代号 未发布内测模型代号
社区主流猜测 Claude Opus 5.1(Opus 5 的修正版) 新一代 Haiku,或 Sonnet 档小更新
早期实测表现 更强,对话自然度好于 Opus 5 稍弱,但同样有不错表现
是否旗舰级 否,未达到 Fable 级别 否,未达到 Fable 级别
现在能否调用 暂不能,无公开 API ID 暂不能,无公开 API ID
发现渠道 Anthropic API、Discord 社区 同左

「棉花糖」和「甜瓜」这些代号怎么来的

Anthropic 的习惯是:未发布的模型用食物类代号,正式发布时再换成正式名称。之前的先例包括蜂蜜(Honeycomb)、神话(Mythos)等。也有社区用户提到还见过 mangosteen(山竹)、horchata(米浆)等其他代号,但这一说法目前只有单一来源,未经证实。

另外值得注意的是,Anthropic 的内部构建版本过去更多用动物命名(比如耳廓狐 Fennec、袋狸 Numbat)。这次连续出现食物系代号,有分析认为可能意味着内部开启了一条新的模型分支——不过这属于推测,官方从未解释过命名规则。

泄露时间线:24 小时内发生了什么

这次泄露的信息密度很高,短短一天内经历了「发现 → 爆料 → 实测流出 → 全网发酵」四个阶段:

  • 8 月 24 日凌晨:有开发者在使用 Anthropic API 时发现了 claude-marshmallow-eapclaude-melon-eap 两个从未公开的模型标识,相关截图随后流传到 Discord 社区。
  • 8 月 24 日上午:X(Twitter)账号 Lentils80 发布「Scoop」爆料帖,确认 Anthropic 正在测试这两个模型,24 小时内获得约 9 万次浏览和数百转发。
  • 随后数小时:科技资讯媒体和加密社区媒体跟进报道;开发者 kimmonismus 等人放出了疑似来自两个模型的实际输出内容。
  • 8 月 24 日晚间:中文社区开始发酵,知乎、36 氪、新智元等陆续发布解读,「Claude 棉花糖」「Claude 甜瓜」成为热词。

X 用户 Lentils80 关于 claude-marshmallow-eap 和 claude-melon-eap 的爆料帖原文截图

原始爆料帖的核心内容有三点(来源:Lentils80 的 X 帖子):

  1. Anthropic 正在测试名为 claude-marshmallow-eap 和 claude-melon-eap 的两个新模型;
  2. 「棉花糖」表现比「甜瓜」更好,对话体验甚至好于现在的 Opus 5;
  3. 但两个模型都不是 Fable 级别(Fable 是 Anthropic 目前的最强旗舰)。

早期实测:Marshmallow 和 Melon 表现怎么样?

目前流出的「评测」全部来自内测开发者的非正式测试,样本很小,参考价值有限,但信息本身很有意思。

实测一:3D 空间任务表现突出

拿到模型输出样本的开发者发现,两个模型被大量用于 3D 强化学习(RL)类任务——比如在 3D 场景中摆放建筑物,模型给出的布局「相当不错」。这被解读为 Anthropic 在重点测试模型的空间理解和推理能力,也可能是下一代模型的主打能力方向之一。

实测二:Medium 推理档位就有好结果

科技分析师 kimmonismus 的评价是:新模型「即使开到 Medium(中等)推理强度,结果也相当不错」,并猜测其中较强的那个就是 Opus 5.1。

为什么这句话重要?因为 Opus 5 的核心槽点恰恰是表现不稳定——推理强度拉满才好用,调低就明显掉链子(下文详说)。如果新模型在 Medium 档就能稳定输出高质量结果,等于直接修复了 Opus 5 被批评最多的短板,还能帮用户省下大量推理 token 费用。

实测三:思考 token 消耗巨大

爆料者也提到一个反面观察:两个模型的思考(thinking)token 消耗非常大,测试中多次撞到 max-tokens 上限。如果正式发布时仍是这样,实际使用成本可能不低,这一点需要等正式版验证。

汇总:早期口碑一览

观察点 结论 可信度
Marshmallow 强于 Melon 多个来源一致 较高
对话自然度好于 Opus 5 爆料者主观感受 中等
Medium 推理档位表现好 单一分析师测试 中等
未达 Fable 旗舰级别 多个来源一致 较高
思考 token 消耗大 爆料者实测 中等
3D 任务能力突出 少量输出样本 偏低,待验证

再次强调:以上全部是未经官方确认的社区信息。在 Anthropic 发布模型卡和基准测试之前,任何「跑分」都只能当参考。

两个新模型到底是什么定位?

要判断 Marshmallow 和 Melon 在产品线里的位置,先看 Claude 当前的模型家族(截至 2026 年 8 月):

模型 输入/输出价格(每百万 token) 上下文 上线时间 定位
Claude Fable 5 $10 / $50 100 万 2026 年 6 月 9 日 最强旗舰,价格也最贵
Claude Opus 5 $5 / $25 100 万 2026 年 7 月 24 日 主力模型,默认开启思考
Claude Sonnet 5 $3 / $15(8 月底前介绍价 $2 / $10) 100 万 2026 年 6 月 30 日 性价比款,编码接近 Opus
Claude Haiku 4.5 $1 / $5 20 万 2025 年 10 月 15 日 轻量快速款,已 10 个月未更新

对照这张表,社区对两个新模型的定位有两派看法:

看法一(主流):Marshmallow 是 Opus 5.1,Melon 是新一代 Haiku。

支持理由很充分:

  • Opus 5 上线一个月就陷入口碑危机(下节详说),Anthropic 有强烈动机尽快推出修正版。2026 年上半年 Opus 已经从 4.6 迭代到 4.8 再到 5.0,节奏很快,「5.1 修 bug 版」完全符合惯例。
  • Haiku 4.5 是全家族最老的模型,已经 10 个月没更新,而它对应的低价高频场景(分类、摘要、批处理)正被开源模型疯狂蚕食,补一个新 Haiku 是防守刚需。
  • 爆料中「更强的那个对话更自然」,与「修复 Opus 5 性格不稳定」的动机吻合。

看法二(少数):Melon 可能是 Sonnet 档的小更新。

也有爆料者认为两个模型「更接近 Opus 或 Sonnet 档」,即 Melon 未必是 Haiku,只是 Sonnet 5 的中期小版本。这种解读下,这次更新就没有覆盖低价档,激进程度低于看法一。

诚实的结论是:一个 Opus 系模型 + 一个更小定位模型的组合概率最大,但「更小的那个」到底是 Haiku 还是 Sonnet 更新,目前无法确认。 答案要等官方发布才能揭晓。

为什么 Anthropic 现在急着上新模型?

这次泄露之所以受关注,是因为它出现在 Anthropic 一段相当微妙的时期。三件事叠加,让「赶紧发新模型」变成刚需。

Opus 5 的口碑危机

Opus 5 上市一个月,社区对它的评价逐渐演变成公开批评:模型「懒、糙、啰嗦」,同样的问题在不同设置下表现差异巨大,也就是不稳定。Claude 团队成员 Thariq 在 X 上公开承认「Opus 5 是一个表现很尖刺(spiky)的模型」,并表示让模型「稳定、温暖、有 Claude 味」是当前最高优先级。

这轮公开对话发生在泄露前几天。有社区观点认为,开发者正是在批评声最高的时候拿到的内测版本——新模型在 Medium 推理档位的稳定表现,恰好就是对这些批评的回应。

Fable 5 卖不动了

支付公司 Ramp 统计了约 7 万家美国企业的 AI 采购数据(金融时报报道):

  • Fable 5 的收入只占 Anthropic 自身收入的 11.4%,token 销量占比只有 6%
  • 作为对比,OpenAI 的旗舰 GPT-5.6 Sol 占 OpenAI token 销量的 25%、收入的 23%;
  • 更便宜的 Opus 5 上线不到一个月,销量就超过了贵一倍的旗舰大哥 Fable 5。

一项基准测试的数据更能说明问题:Fable 5 拿 70.5 分每个任务要花 17.32 美元,Opus 5 拿 70.0 分只要 8.23 美元——差半分,价格差一倍多,企业用脚投票。

竞争和资本的双重压力

更大的背景是:开源模型在 4 个月内把 token 市场份额从约 11% 抬到了 62%(FT 引用的行业数据),所有闭源厂商的每个价位都面临冲击。与此同时,Anthropic 年化收入 5 月约 470 亿美元、7 月约 650 亿美元,低于投资人此前押注的 800 亿;增速也被 OpenAI 首次反超。而这一切都发生在 Anthropic 冲刺更高 IPO 估值的节骨眼上。

把三件事连起来看:Marshmallow 和 Melon 的出现时机就不是巧合,而是一套组合拳——用一个修复版 Opus 稳住口碑,用一个更便宜的小模型守住低价市场。

什么时候上线?EAP 泄露的历史规律

「代号泄露」在 Anthropic 不是第一次发生,而且前两次都精准对应了后来的正式发布:

泄露代号 泄露时间 对应正式模型 正式发布 间隔
Mythos 2026 年 3 月 Claude Fable 5 2026 年 6 月 9 日 约 2 个多月
Honeycomb(出现在 Cursor 模型选择器,标注 100 万上下文) 2026 年 7 月 9 日 Claude Opus 5 2026 年 7 月下旬 约 16 天
Marshmallow / Melon 2026 年 8 月 24 日 ——

Claude 新模型代号泄露与正式发布时间线:Mythos 对应 Fable 5,Honeycomb 对应 Opus 5,Marshmallow 与 Melon 待揭晓

规律很明显:代号被抓包到正式发布,窗口大约 2 到 4 周。其中 Honeycomb 的先例最接近这次——同样是 -eap 后缀内测版被外部发现,16 天后 Opus 5 正式上线。按这个节奏推算,Marshmallow 和 Melon 如果真要落地,大概率在 2026 年 9 月上中旬之前,中文媒体已有「最快下周」的说法。

但也要泼一盆冷水:也有反例。代号 Numbat 曾在泄露后安静地躺了几个月都没发布。代号泄露证明「模型存在」,但不能保证「马上发布」。一切以 Anthropic 官方公告为准,不信小道消息的具体日期。

现在该做什么:三类人的行动建议

如果你是 API 开发者

  • 不要改动现有代码。 两个新模型目前没有任何公开 API ID、没有价格、没有模型卡。现在网上任何声称能「付费体验 Marshmallow」的服务都和这次泄露无关,谨防上当。
  • 新模型正式发布后,供应商目录通常几小时到几天内就会跟上,到时再评估迁移不迟。
  • 首周谨慎尝鲜。 发布初期的版本往往不稳定,建议先用小流量灰度,配合回退策略,而不是全量切换。如果对模型路由和降级策略感兴趣,可以看这篇 Claude Code 替代品与工具选型指南

如果你是 Claude 订阅用户(Pro / Max)

  • 现有订阅无需任何操作,新模型上线后会自动进入你的可用列表(历史上 Claude 新模型都是这样 rollout 的)。
  • 如果你被 Opus 5 的「不稳定」折磨,新版本大概率就是解药,建议等几天而不是现在退订
  • 付费和充值相关的注意事项,可以参考 Claude Code 充值订阅全攻略

如果你是观望中的新用户

  • 不用为了「等新模型」而推迟上手。当前 Sonnet 5 / Opus 5 的能力对绝大多数任务已经够用,工具使用经验比等某一个模型更重要。
  • 编程场景还在选工具的话,先看 Cursor 和 Claude Code 怎么选;想了解大模型回答质量波动是怎么回事,可以读 GPT-5.6 降智了吗:回答变短的真相,原理对 Claude 同样适用。

总结

claude-marshmallow-eap 和 claude-melon-eap 的泄露,表面看是两个有趣的代号,背后其实是 Anthropic 的一次关键补救:Opus 5 口碑告急、Fable 5 销量遇冷、开源模型步步紧逼,公司需要在几周内拿出一个「更好用的 Opus」和一个「更便宜的小模型」。

给你三个可以带走的判断:

  1. 两个模型真实存在,且临近发布——EAP 代号 + 2 到 4 周的历史规律,指向 2026 年 9 月上中旬;
  2. Marshmallow 大概率是 Opus 5.1,主打修复稳定性和对话体验,不是更强大脑;Melon 的定位(新 Haiku 还是 Sonnet 更新)是最大悬念;
  3. 现在什么都不用做——不换模型、不退订、不改代码,等官方公告即可。发布后我们会第一时间更新实测对比,欢迎收藏本页。

常见问题

claude-marshmallow-eap 和 claude-melon-eap 是什么?

它们是 Anthropic 两个未发布 Claude 模型的内测代号,2026 年 8 月 24 日被开发者在 API 中发现。`-eap` 后缀代表 Early Access Program(早期访问计划),即正式发布前的内测版本。社区猜测它们分别是 Claude Opus 5.1 和新一代 Haiku(或 Sonnet 更新),均未经官方证实。

EAP 是什么意思?

EAP 是 Early Access Program(早期访问计划,也叫早期预览 Early Access Preview)的缩写,指模型正式上线前提供给少数开发者的有限测试版本。在 Anthropic 的历史中,带 `-eap` 后缀的代号出现后,正式模型通常在 2 到 4 周内发布。

Claude Marshmallow 和 Melon 现在能用吗?

不能。两个模型目前没有公开的 API ID、没有价格、没有模型卡,任何人都无法正式调用。网上声称提供 Marshmallow / Melon 体验的服务均与本次泄露无关。请以 [Anthropic 官网](https://www.anthropic.com/)公告为准。

Claude Marshmallow 是 Opus 5.1 吗?

未证实,但这是可能性最大的猜测。依据:它强于 Melon、对话体验好于 Opus 5、未达 Fable 旗舰级,且 Opus 5 正深陷口碑危机,Anthropic 有强烈动机尽快推出修正版。正式名称也可能与代号不同,最终以官方发布为准。

Claude Melon 是新一代 Haiku 吗?

有可能但不确定。Haiku 4.5 已经 10 个月未更新,是 Claude 家族最老的模型,更新需求强烈;但也有爆料者认为 Melon 更接近 Sonnet 档的小版本更新。两种说法都存在,无法确认。

新模型什么时候正式发布?

没有官方时间表。按 Mythos→Fable 5(约 2 个月)和 Honeycomb→Opus 5(约 16 天)的先例,社区普遍预期在 2026 年 9 月上中旬之前,中文媒体有「最快下周上线」的说法。但也存在代号长期不发布的反例(如 Numbat),请以官方公告为准。

新模型会比现在的 Opus 5 强吗?

从泄露信息看,Marshmallow 的对话自然度好于 Opus 5,且在 Medium 推理档位就有稳定表现,方向上是「修复 Opus 5 的不稳定」而非大幅拉高上限。它不会达到旗舰 Fable 5 的水平。属于「变得更好用」而不是「变得更强」的更新。

新模型的价格会变吗?

未知。多数分析认为 Marshmallow 会延续 Opus 5 的 $5 / $25 定价(点更新通常不动价格),而如果 Melon 是新 Haiku,其 $1 / $5 档位定价能否守住将是最大看点——因为低价档正被开源模型挤压,Anthropic 可能降价或提供介绍价应对。以上均为推测。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-29

© 2026 AI345 · All Rights Reserved

用户服务协议·隐私政策