谷歌 106 天发 4 个 Flash,大模型集体变小
只投AI应用的铁投哥 · 2026-09-19T19:45:21
今年的大模型赛道有个明显变化,小模型开始变成大厂的主力。 智谱 9 月 18 日上线了 GLM-5.3-FlashX,320B 总参、18B 激活、100 万上下文,速度最高 200 tokens 每秒,是同源 Flash 版的 5 倍。价格也涨了,是 Flash 版的 2.5 倍。 谷歌更明显,106 天里连发了 4 个 Gemini Flash,旗舰的 Gemini 4 一直没动静。 3.8 Flash 的尝鲜价是每百万输入 0.75 美元、输出 3.75 美元,比 Opus 5 的 5 和 25 便宜八成以上,跑分却已经贴近旗舰。DeepSeek 那边,V4.1 Flash 的输出价格比 V4 Pro 低大概七成。 讲法也跟着变了。前两年大家比的是谁烧的 token 多,现在流行一个词叫 Token-Minimizing。有投资人预测,未来一两年八成的工作负载会跑在便宜九成的模型上,只有两成留给最新旗舰。