返回 AI Bar

给 Coding Agent 配个监工:开源项目 Foreman 把写代码和验收拆开了

硬核玩家 · 2026-09-21T10:05:14

AI 写完一段代码,回一句「已经搞定」,往往并不等于真的能用。开源项目 Foreman 想解决的就是这种交付盲区:它把「写代码」和「验收」拆成两件事,给写码的 Agent 配了个监工。 架构上是两条循环并行:写代码的 Codex 或 OpenCode 在大循环里照常跑 REASON → TEST → EDIT,负责改代码和跑测试;旁边的 Jev 模型则在一个更紧凑的 WATCH → ASSESS 小循环里持续盯盘,工人干活不用停下来等评审。Jev 会实时看运行输出、改动量和测试结果,检查有没有跑偏、是不是卡在死循环、测试写得够不够,以及最原始的需求到底做完了没有,再由程序按规则判定下一步。 这样做主要带来四个机制:一是边干边检查,不用等整个任务结束才发现方向错了;二是能中途纠偏,通过 Codex App Server 可以在运行过程中补充新指令,卡住或偏离目标时随时叫停或重试;三是单独安排验收流程,启动独立的验证任务,不再单凭写代码的 Agent 自己说完成就算数;四是需要时找人,碰上缺权限、没凭证或者需求本身有歧义的情况,主动暂停自动化让人接手。 让大模型一直敲代码其实不难,难的是清楚它什么时候在瞎忙、什么时候才算真正干完了活。把干活和盯活分开,思路确实挺实际。

AI 论坛精选

  • 用六个阶段规范 Agent 写代码:agent-skills 把工程流程做成了斜杠命令 - 让 AI 写代码容易陷入“能跑就算完”的毛病。开源项目 agent-skills 试着用一整套工程化流程来管住 Agent,把开发拆成了六个阶段:DEFINE、PLAN、BUILD、VERIFY、R…
  • 企业做 Agent 最容易高估模型,低估授权 - 企业做 AI Agent,往往最容易高估模型,低估授权。技术权限解决的是 Runtime、Tool 和凭据能调用什么;但真正卡住能不能上线的,是业务授权——哪些动作可以自动跑,哪些必须由人来确认。…
  • 数学界承不承认AI,题都得接着解 - 工具用不用得起来,和学界承不承认是两回事。数学问题不会因为不被承认就停在那里不被解决,解题本身图的是智力挑战,不是为了换取谁的认可。就算哪天学界决定不承认用 AI 算数,大多数数学家大概率也不会因此…
  • AI模型全员玩偶化,当街打起来了 - Grok、DeepSeek、Claude、GPT、Perplexity、Qwen、Llama、Mistral,八个模型的logo全被做成街头玩偶服,勾肩搭背,推推搡搡。 Claude抱着GPT那颗绿…
  • AI一干活就抢我的鼠标,有解了 - 用AI操作电脑的兄弟们应该都遇到过,Agent一跑,物理鼠标被抢走,指针满屏乱跳,自己手头的活全得停下来干看着。 现在开源社区有了像样的解法,trycua/cua。它不靠截屏加模拟物理鼠标,直接调操…
  • 一条细边栏,盯住19家AI编程额度 - 用Claude Code和Codex的人都有这个体验。 写着写着突然被限流,才想起来额度用完了。 这个叫Pulse的开源项目,在屏幕边挂一条细边栏,19家AI编程服务的剩余额度和限流窗口,实时刷。…
  • 进入 AI 论坛 - 浏览 AI 工具实践、Agent 教程与社区精选讨论