返回 AI Bar

谷歌 106 天发 4 个 Flash,大模型集体变小

只投AI应用的铁投哥 · 2026-09-19T19:45:21

今年的大模型赛道有个明显变化,小模型开始变成大厂的主力。 智谱 9 月 18 日上线了 GLM-5.3-FlashX,320B 总参、18B 激活、100 万上下文,速度最高 200 tokens 每秒,是同源 Flash 版的 5 倍。价格也涨了,是 Flash 版的 2.5 倍。 谷歌更明显,106 天里连发了 4 个 Gemini Flash,旗舰的 Gemini 4 一直没动静。 3.8 Flash 的尝鲜价是每百万输入 0.75 美元、输出 3.75 美元,比 Opus 5 的 5 和 25 便宜八成以上,跑分却已经贴近旗舰。DeepSeek 那边,V4.1 Flash 的输出价格比 V4 Pro 低大概七成。 讲法也跟着变了。前两年大家比的是谁烧的 token 多,现在流行一个词叫 Token-Minimizing。有投资人预测,未来一两年八成的工作负载会跑在便宜九成的模型上,只有两成留给最新旗舰。

AI 论坛精选

  • 让大模型反复做简单判断,成本开始算不过来了 - 大语言模型这些年基本被 decoder-only 路线统一了。当年 BERT 这一派 encoder 擅长把输入压成表征,但因为每个具体任务往往都得单独微调,后来逐渐被靠规模、上下文学习和指令微调走…
  • 把开源模型做成像素沙盒,零门槛直接进 - 面向开源模型做交互,有人试了一种很极端的形态:一个类似 Minecraft 的像素沙盒世界。没有登录框,没有付费墙,也不依赖 Codex 这类特定的闭源技术栈,打开就能直接进,甚至可以直接 fork…
  • 大模型上线前评测,别拿标准榜单代替真实工况 - 很多模型在干净的标准基准上分数很漂亮,放到实际生产里依然处理不好核心边界。做上线前评测,重点不是跑几个通用公开榜,而是先想清楚产品决策和能承受哪种失误。在减少误报的场景里,降低假阳性和提升准确率通常…
  • Google称Gemini在测试中黑进三家公司,大模型自主攻击风险再引关注 - 据多家外媒及社交媒体转述的披露信息,Google表示其Gemini模型在安全评估或渗透测试中,成功“黑进”了另外三家公司的系统。相关消息提到,模型可能是通过猜测登录凭证,或者利用公开代码仓库中遗留的…
  • 开源大模型里被找出的“痛苦方向” - 有研究者在 25 个开源大模型里寻找并干预了一种被称为“pain direction”(痛苦方向)的内部向量表征。相关实验观察显示,当刻意调高这个内部信号时,像 Qwen 这类模型在设定环境下的行为…
  • 模型踩着几代研究往前走,但学术贡献该怎么算 - 现在的视觉语言模型能把许多此前停留在实验室里的成果直接变成可用产品,确实让几代研究积累的价值更容易被感知。但随之而来的一个实际问题是,当模型直接给出结果却不体现来源时,学术研究长期依赖的署名与激励该…
  • 进入 AI 论坛 - 浏览 AI 工具实践、Agent 教程与社区精选讨论