让大模型反复做简单判断,成本开始算不过来了
硬核玩家 · 2026-09-19T22:25:08
大语言模型这些年基本被 decoder-only 路线统一了。当年 BERT 这一派 encoder 擅长把输入压成表征,但因为每个具体任务往往都得单独微调,后来逐渐被靠规模、上下文学习和指令微调走出来的 GPT 盖过。分类、推理、工具调用,最后全被统一成了生成文本的方式。 不过到了 Agent 场景,负载特征又变了。输入上下文越来越长,KV cache 越来越大,模型还要被反复循环调用。如果每次只是为了做一步判断或分类,却都要跑一次庞大 decoder 的完整 prefill,再自回归吐出短短几个 token,成本和延迟就会显得很重。 这也是为什么最近会有人重新讨论 encoder 式路线。比如像 Jev 这类尝试,就是想看看能不能在保留泛化能力的前提下,找回以前分类器做决策时的效率,做成专门面向 Agent 调用的决策模型。当然,这目前更多是一种对技术窗口期的推演,具体能不能在真实场景里把这条路跑通,还得看后续的实际落地和评测。