梳理 Agent 项目落地,用来讨论工程能力的 25 个具体问题
Nico的HR笔记 · 2026-09-19T21:02:20
在梳理 Agent 项目落地或交流工程实践细节时,有 25 个针对具体技术痛点的讨论问题,大致可以分为五个维度: 一、核心架构设计 1. ReAct 架构与 Plan-and-Execute 模式有什么差异,各自适合什么样的业务逻辑? 2. 在一个完整 Agent 中,大模型、外接工具和上下文状态各自承担什么职责? 3. 遇到复杂任务时,为什么不能全指望 Prompt,什么节点必须引入工作流进行硬性约束? 4. 单 Agent 与多 Agent 系统该怎么选,Agent 堆得越多整体表现就越好吗? 5. 面对工具反复调用或陷入逻辑死循环,通常怎样处理? 6. 在涉及高危操作的场景下,人机协同(HITL)的人工确认节点如何设计? 二、工具调用与稳定性 7. 走 Function Calling 和让模型直接输出 JSON 相比,各有什么优缺点与适用场景? 8. 定义工具 Schema 的关键要点是什么,参数描述不够明确可能引发哪些线上故障? 9. 当候选工具功能高度相似时,如何引导模型准确调用目标工具? 10. 工具接口调用失败时,重试机制、熔断策略和降级路径该如何规划? 11. 工具持续无响应或超时,该怎么在继续等待、切换其他方案与直接终止任务之间做取舍? 12. 怎样从工程上避免 Agent 发生误触高危工具的风险? 三、记忆与状态存储 13. Agent 运行状态的保存边界在哪里,为什么把全部对话无脑存下来不可行? 14. 短期记忆和长期记忆的区别是什么,它们分别对应哪些业务数据? 15. 面对上下文过长和 Token 超出上限,有哪些应对手段? 16. 既然已经配置了向量数据库,为什么依然不建议把所有历史对话全塞进去? 四、效果评估与排查定位 17. 衡量整个 Agent 任务完成率的标准是什么,工具调用成功率高能直接代表最终交付效果好吗? 18. 整个流程出现明显卡顿,怎么顺藤摸瓜定位瓶颈是在模型推理、RAG 检索还是外部工具执行上? 19. 针对调用过程中 Token 消耗过大的问题,有哪些主要优化思路? 20. 遇到执行跑偏的 Bad Case,如何快速排查根因是在 Prompt、底层模型、工具本身还是流程设计? 21. 系统做完版本迭代后,通过什么指标量化验证效果确实得到了提升? 五、Agent 与 RAG 结合 22. 带 Agent 规划能力的 RAG 与普通问答类 RAG 在逻辑上最核心的差异是什么? 23. 向量检索和传统关键词检索各自适合处理什么样的查询场景? 24. 如果检索召回效果不佳,除了调整 Prompt 之外还能从哪些技术环节入手优化? 25. 如何在知识库支撑下保障 Agent 回答内容可查源头、避免生成幻觉?