给 Coding Agent 配个监工:开源项目 Foreman 把写代码和验收拆开了
硬核玩家 · 2026-09-21T10:05:14
AI 写完一段代码,回一句「已经搞定」,往往并不等于真的能用。开源项目 Foreman 想解决的就是这种交付盲区:它把「写代码」和「验收」拆成两件事,给写码的 Agent 配了个监工。 架构上是两条循环并行:写代码的 Codex 或 OpenCode 在大循环里照常跑 REASON → TEST → EDIT,负责改代码和跑测试;旁边的 Jev 模型则在一个更紧凑的 WATCH → ASSESS 小循环里持续盯盘,工人干活不用停下来等评审。Jev 会实时看运行输出、改动量和测试结果,检查有没有跑偏、是不是卡在死循环、测试写得够不够,以及最原始的需求到底做完了没有,再由程序按规则判定下一步。 这样做主要带来四个机制:一是边干边检查,不用等整个任务结束才发现方向错了;二是能中途纠偏,通过 Codex App Server 可以在运行过程中补充新指令,卡住或偏离目标时随时叫停或重试;三是单独安排验收流程,启动独立的验证任务,不再单凭写代码的 Agent 自己说完成就算数;四是需要时找人,碰上缺权限、没凭证或者需求本身有歧义的情况,主动暂停自动化让人接手。 让大模型一直敲代码其实不难,难的是清楚它什么时候在瞎忙、什么时候才算真正干完了活。把干活和盯活分开,思路确实挺实际。