返回 AI Bar

美团LongCat 2.5实测,夸骂两极

显卡在燃烧 · 2026-09-27T13:27:51

看见 LongCat-2.5 上线,我第一反应是,这参数我本地这辈子别想了。1.6 万亿总参,我那张 24G 的卡,塞个零头都费劲。胆子 12G,纯看戏。 但实测这瓜是真有意思。夸的那边,有人拿鹈鹕测试跑了一圈,说比 Grok 4.7 还好使。骂的那边更直接,测完撂一句,实力就是上代水平,怪不得没跑分。 两边都吵成这样,官方参数还是得说清吧。 LongCat-2.5-Preview,9 月 25 日上线。总参约 1.6 万亿,干活时只激活约 480 亿。 这就是 MoE 架构,一堆专家模块,每次只叫醒相关的几个,省算力。 原生支持 100 万 token 上下文。token 就是模型读字的最小单位,100 万约等于一次性塞进几本书。还加了图片理解。 官方日志强调写代码突出,深度适配一串编程工具,Claude Code、OpenCode、Kilo Code 这些都在名单里。 这模型不是没底子。前代 LongCat-2.0 是国内头一个全用国产算力训练加部署的万亿参数模型。峰值超 5 万张国产卡,预训练吃了 35 万亿 token。官方跑分在代码和智能体两项上,接近甚至超过 Opus 4.6。它以前用 Owl Alpha 这个马甲,在模型调用平台 OpenRouter 上长期排调用量前三。 那为啥实测两极。我寻思关键在这。2.5 官方一份跑分都没放,只有日志里几句定性描述。没分数就全靠实测说话,夸的夸、骂的骂,都正常。 想免费试的看这。OpenCode 里免费到 10 月 10 日。iPhone 端有龙猫 LongCat 官方 App,文本问答、联网、图像生成都能用。2.5 的网页端和 API 入口也同步开了。美团这波给得挺大方。 我自己站哪边呢。我这种跑不动大模型的,只看戏不站队。但要表态的话,一个连自家跑分都不放的模型,我先信实测不信宣传。夸的有人上图,骂的也有人上图,图比参数实在。

AI 论坛精选

  • Codex对Claude Code五项实测,谁更值得买 - 这一项我也是每天记模型用量。实测里两家的旗舰几乎打平,真正拉开差距的是框架效率、使用额度和深度。Codex 更快更省,20 美元档就能用上旗舰模型。Claude Code 更深,Opus 会多写测试…
  • 竞技场冒出个神秘模型,疑似Gemini 4灰测 - 竞技场冒出个匿名模型,挂名 gemini-3.8-flash,实测明显强过正式版,被猜是 Gemini 4 的灰度测试。 有开发者拿它和 Opus 5.5 掰了个手腕。3D 水上飞机物理模拟,飞机姿…
  • Sonnet 5.5直出喷射战士?它还没发布 - 全网都在转一个视频。说 Claude Sonnet 5.5 一轮对话直出盗版喷射战士,效果炸裂。先泼盆冷水,Anthropic 9月22日发布的是 Opus 5.5。官方写明 Sonnet 5.5…
  • 一句话出宣传片,Opus 5.5真能做到 - Opus 5.5发布后,社区里最热闹的玩法不是跑分,是拿它剪视频。一条宣传片从分镜到成片,它一个人就能包圆了。这波热潮带火的不只是跑分党,做视频的也在围观。 先给你个价格底吧。API 输入 4 美元…
  • Opus5.5的effort默认档够猛 - 先说我自己,以前调这种档位全靠玄学,闭眼选max,钱包疼不疼另说。这次Anthropic官方自己出了份实测,等于把答案贴脸上。 Opus 5.5的effort一共五档,low、medium、high…
  • Muse上线12天,下载量压过ChatGPT - Meta 的 Muse 内部代号 Hatch,基于开源框架 OpenClaw,能自己发邮件、卖车、订行程。 9月8日上线美加,一周登顶美区免费榜。12天 iOS 下载180万,超过同期 ChatGP…
  • 进入 AI 论坛 - 浏览 AI 工具实践、Agent 教程与社区精选讨论