返回 AI Bar

新时代文言文:这是顶尖 AI 对低 Level 人类的蔑视吗?

鼎鼎大名的刘鼎鼎 · 2026-09-03T10:24:50

最近在 Fable 5 和 Opus 的长程任务里,频繁看到 CC 一种近乎于发狂、呓语的自造方言、遣词造句的诡异语言现象,类似于: “账本 15/15 全绿,再给你加几条铁律和红线与你对拍,请你拍板。” “无主 → 已当场归户。” “137 项 spine 落地 + 3 死门归零 + 全套绿 + 终审干净。” “皮要不要重新揉?” “单腿哑火,打回重判,” 中文社区给它起了一个很准确的名字:新时代文言文。 我倾向于把它理解成 Agent 内部工作语域对 Reporting Layer 的穿透。 Agent 执行长程任务时,需要处理大量工具调用、测试结果、中间状态、异常分支和子代理汇报。为了在有限的 Context Window 中维持工作,它会不断压缩已经形成共识的信息,并为高频状态创造速记。 举例来说,“全绿”压缩了全部测试通过,“归户”压缩了责任模块的重新分配,“死门”指向某个必然阻塞交付的检查点。对于刚刚经历完整任务过程的模型,这些词各自对应着确定的状态;对于只看到最终汇报的人,它们省略的是一段从未参与过的工作历史。 因此,文言文的类比比想象中更加准确。 想起本科在中文系学习古典文献学时,提到过文言文通过省略虚词和共享典故,在昂贵的书写介质上压缩信息;那么 Agent 的工作语言同样受到 Token、时延和上下文长度的约束。文言文作为书面语长期独立演化,逐渐远离口语;Agent 在长程任务中主要阅读自己和子代理的输出,其局部语言环境也越来越多地由自己生成。 因为每一个典故都要求读者预先知道一段历史。新时代文言文中的每个黑话,背后则是一段用户没有看见的 Context。 很显然,可读性比任务结果更难获得稳定的显式 Reward。 测试是否通过、代码能否运行、文件有没有生成,都存在相对清楚的反馈。一段最终汇报被用户接受,无法证明用户真正理解了它;用户没有要求重写,也无法证明这套表达是清楚的。 追溯到 25 年,DeepSeek-R1 的公开论文提供过一个很典型的例子。纯结果奖励训练出的 R1-Zero 出现了明显的语言混杂和可读性问题;加入 Language Consistency Reward 以后,语言得到改善,同时伴随轻微的性能损失。 规范、稳定的人类语言需要被单独放进优化目标。模型更擅长完成任务,并不自然意味着它更擅长向人解释任务。 一个更棘手的问题是反馈闭环。 Agent 每一轮生成的速记都会重新进入 Context,成为下一轮 Token Prediction 最近的语言样本。一个临时创造的词被重复几次以后,便获得了局部语境中的合法性;多个子代理继续引用,又会进一步提高它的权重。 任务越长、参与的 Agent 越多、工作历史越复杂,这套方言就越容易形成。最终汇报继续沿用工作过程中的语言,相当于让一份写给人类的报告,继承了全部机器内部的表达惯性。 说回到中文,尤其是汉语的构词方式,又放大了这种体感。双字复合词拥有很强的生成能力,“归户”“对拍”“死门”即使来自临时借译或语义挪用,字形上依然与正常汉语没有明显区别。 我们会感到这种虚假的熟悉感极其消耗注意力:字都认识,词也都像真的,读者会先怀疑自己遗漏了某种行业常识。 一个推断:也许未来 Agent 系统会长期保留两套语言。一套服务于模型内部的协作与压缩,允许速记、缩写和局部概念;另一套服务于人类验收,在最终输出前重新组织事实、补回因果关系,并假设读者从未看过任务过程。 Reporting Layer 在这里承担的实际功能,是把机器的工作历史重新翻译成人类可以判断的材料。它的质量直接决定使用者能否理解修改、检查证据、识别风险,并保留最后的决策权。 翻译成本最终由谁承担,会成为 Agent 产品的一条重要分界线。 如果 A 社持续基于 ASI 不断在同样的 Bias 取向上走到底,那么 CC Agent 眼中的任务过程,实际上已经被压缩成一套只有 Agent 自己熟悉的典故,最后那句“请你拍板”也会逐渐失去意义。悲观的角度讲,目前似乎 Codex 也偶发这样的呓语,用户似乎仍然拥有形式上的决定权,却失去了形成决定所需要的过程。

AI 论坛精选