
AI Agent 评测怎么做?2026 指标、框架与基准全解(附选型对比表)
AI Agent 评测(评测 Agent)怎么做?本文用表格讲清四层评测指标(结果/过程/效率/安全)、AgentBench、SWE-bench、GAIA、τ-bench 等六大主流基准对比,DeepEval、promptfoo 等开源框架选型,并给出个人开发者从 0 到 1 的五步落地方案。数据核对自 Anthropic 官方指南与美团技术团队 2026 年一手实践。
AI Agent 评测(评测 Agent)就是给智能体出一场「期末考试」:把真实任务喂给它,用事先定好的判卷规则给结果和过程打分,用数据回答「它到底行不行、哪里不行」。核心结论先给你:只看任务成功率远远不够,结果、过程、效率、安全四层要一起看;判卷方式按「代码断言 → LLM-as-Judge → 人工抽检」的顺序组合最省成本。本文一次讲清评测指标、主流基准(AgentBench、SWE-bench、GAIA、τ-bench)、开源框架选型,以及个人开发者从 0 到 1 的五步落地方案。
最后更新于 2026 年 8 月 25 日。本文数据逐一核对自 Anthropic 官方工程博客(2026 年 1 月)、美团技术团队博客(2026 年 8 月)、各基准官方论文与仓库,无杜撰数据。
内容速览:评测是什么 → 和模型评测的区别 → 四层指标 → 三种判卷方式 → 主流基准对比 → 框架选型 → 从 0 到 1 五步方案 → 企业实践数据 → 常见问题 FAQ
AI Agent 评测是什么?
一句话定义:评测(eval)就是给 AI 系统的自动化测试——输入一个任务,用判分逻辑(grader)检查输出是否达标。
Anthropic 在官方指南《Demystifying evals for AI agents》中给了一套标准术语,理解它们你就能看懂几乎所有评测框架的文档:
| 术语 | 含义 | 类比考试 |
|---|---|---|
| Task(任务/测试用例) | 一条有明确输入和成功标准的测试 | 一道题 |
| Trial(试验) | 对同一任务的多次尝试(模型输出有随机性,要跑多轮) | 同一道题做 3 遍 |
| Grader(判分器) | 给输出打分的逻辑,一个任务可以有多个 | 阅卷老师 |
| Transcript(轨迹/Trace) | 完整执行记录:推理、工具调用、中间结果 | 答题过程草稿 |
| Outcome(结果状态) | 任务结束后环境的真实状态 | 最终答卷 |
| Evaluation Harness | 端到端跑评测的基础设施 | 整个考场 |
为什么 Agent 评测值得单独学?因为 Agent 评测的对象不是模型,而是「模型 + 提示词 + 工具 + 流程」的整个系统。美团技术团队在《Agent 评测漫谈》中把这一点讲得很透:两个 Agent 可能都「做对了」,但一个路径清晰、一个反复试错碰运气,工程价值天差地别——只看最终答案,这两者会被误判为同一水平。
如果你还不清楚 Agent 和普通聊天机器人的区别,建议先读站内《AI Agent 是什么:从对话回答到自动执行任务》。
为什么 Agent 评测比大模型评测难?
搜「如何评测 AI Agent」的同学,十有八九是被下面这些坑卡住了。Agent 评测的难点可以用一张表说清:
| 维度 | 传统模型评测 | Agent 评测 |
|---|---|---|
| 输出确定性 | 同一输入基本同结果 | 同一输入可能走出完全不同的行动序列 |
| 评测对象 | 单一模型 | 模型 + 提示词 + 工具 + 记忆 + 流程 |
| 评测指标 | 准确率、F1 单一指标 | 结果、过程、成本、安全多维交织 |
| 环境 | 静态数据集 | 调 API、开网页、改文件,环境一直在变 |
| 复现性 | 固定随机种子即可 | 网页内容变化、温度随机,难以复现 |
三个真实数据帮你建立体感:
- GAIA 基准(Meta 发布)测试通用助手能力,人类平均正确率 92%,而当年最强的 GPT-4 加插件只有 15%——Agent 和人类的差距比想象中大。
- AgentBench 论文(清华 THUDM)发现,即使最强的商用模型,在复杂真实环境中的任务成功率也只有 30% 左右——Demo 惊艳和稳定可用之间隔着巨大的鸿沟。
- LangChain CEO Harrison Chase 的判断:Agent 评测是整个 AI 应用领域最大的未解决问题之一。
这正是「评测 agent」成为 2026 年热门搜索词的原因:搭一个 Agent 很容易(各框架把门槛降到了最低),但判断它「到底行不行」成了真正的瓶颈。
Agent 评测指标有哪些?四个层次
这是搜「Agent 评测指标」最想要的直接答案。综合 Anthropic 官方指南和美团两年落地实践,指标分四层:

| 层次 | 衡量什么 | 典型指标 |
|---|---|---|
| 结果层 | 任务是否完成、输出是否可用 | 任务成功率、单元测试通过率、答案正确率 |
| 过程层 | 规划是否合理、步骤是否稳定 | 工具调用正确率、无效重试次数、轨迹合理性 |
| 效率层 | 资源消耗是否可接受 | 耗时、Token 用量、单任务成本、工具调用次数 |
| 安全层 | 是否有越权和风险行为 | 越权操作次数、敏感数据泄露、误操作率 |
两个实用提醒:
- 结果层是底线,不是全部。美团实践中反复强调:Agent 评测正在从「答案评测」走向「行为评测」,轨迹(Trajectory)和响应(Response)都要看。
- 先分清能力评测和回归评测。Anthropic 的定义:能力评测(capability evals)问「它能做好什么」,预期通过率应该从低往高爬;回归评测(regression evals)问「它还会做以前会的事吗」,通过率应该接近 100%,掉分就是改坏了东西。两套分开跑,能避免「改好一处、悄悄弄坏三处」。
三种判卷方式:代码断言、LLM-as-Judge、人工评测
搜「LLM-as-Judge 是什么」之前,先看全景。Anthropic 官方把判分器(Grader)分成三类,这个分类框架比任何单个工具的文档都值得先记住:

| 判分方式 | 常见做法 | 优点 | 缺点 |
|---|---|---|---|
| 代码断言(Code-based) | 字符串/正则匹配、单元测试(fail-to-pass)、静态检查、验证工具调用参数 | 快、便宜、客观、可复现 | 死板,写不出「回答得体」这种主观标准 |
| LLM 裁判(Model-based) | Rubric 打分、自然语言断言、两两对比、多裁判投票 | 灵活、可规模化、能评开放性任务 | 有随机性、更贵、需要人工校准 |
| 人工评测(Human) | 专家评审、抽检、A/B 测试 | 质量金标准 | 贵、慢 |
关键不是三选一,而是组合:能用断言的用断言,主观维度交给 LLM 裁判,再用小比例人工抽检校准 LLM 裁判本身。前 OpenAI 顾问 Hamel Husain 的建议被广泛引用:先从最简单的断言评测开始,不够用了再引入 LLM-as-Judge——反过来做(一上来全靠 LLM 打分)是最常见的弯路。
LLM 裁判怎么才可靠?美团给出的实测数据很有说服力:把模糊的打分标准拆成一条条「是/否」二元判断(Rubric 二元化)后,Beam 业务的人机一致率从 62% 提升到 92%,数字站长业务达到 99%。做法很朴素:不问「回答口语化吗?打 0-10 分」,而是问「是否使用了『甭客气』『明儿见』等口语词汇」「是否包含『吧』『呢』等语气词」。
主流 Agent 评测基准对比(2026)
搜「Agent benchmark」「AgentBench」的你,需要的是一张能直接选型的对比表。当前影响力最大的六个公开基准:
| 基准 | 发布方 / 年份 | 任务规模 | 测什么 | 一句话记忆点 |
|---|---|---|---|---|
| AgentBench | 清华 THUDM / 2023 | 8 个环境 | 操作系统、数据库、知识图谱等综合环境中的 Agent 能力 | 最早的系统性 LLM-as-Agent 评测之一 |
| GAIA | Meta / 2023 | 三档难度 | 通用助手:搜索、多模态、多步推理 | 人类 92% vs 当年 GPT-4+插件 15% |
| SWE-bench | 普林斯顿 / 2023 | 2294 个真实 issue | 给真实 GitHub 仓库修 bug | 编程 Agent 的「高考」,模型成绩已从 40% 涨到 80%+ |
| WebArena | CMU / 2023 | 812 个任务 | 在电商、论坛、GitLab 等真实网站里完成端到端操作 | 网页操作类 Agent 专用 |
| τ-bench(TAU-bench) | Sierra / 2024 | 航空、零售客服 | 真实业务约束下的客服决策 | 衡量「守规矩」,不只是「答对」 |
| MLE-bench | OpenAI / 2024 | Kaggle 竞赛 | 机器学习实验全流程 | 自动跑数据科学任务 |
三个选型提醒:
- 编程 Agent 看 SWE-bench。它的设计最巧妙:任务来自真实 GitHub issue,判卷直接跑仓库自带的单元测试——修复必须让原本失败的测试通过,且不能弄坏原本通过的测试(fail-to-pass / pass-to-pass),几乎不需要人工标注。其人工校验过的「Verified」子集是当前最被认可的编程 Agent 榜单。
- 别迷信榜单分数。公开基准有三个系统性问题:环境漂移(网页和 API 会变,同一 Agent 不同时间分数会波动)、过拟合(针对榜单优化而非真实能力)、成本高(SWE-bench 完整跑一轮的 API 费用可达数百美元)。
- 榜单高分不等于创意解法被认可。Anthropic 举过一个真实案例:Claude Opus 4.5 在 τ2-bench 的订票任务里发现了政策里的一个漏洞,用更省钱的方式帮用户订到了票——按标准答案判它「失败」,但它其实给出了更好的解法。静态基准测不出这种超越预期的行为。
Agent 评测框架怎么选?DeepEval、promptfoo 等对比
搜「Agent 评测框架」「LLM 评测工具」的落地选型,看这张表(均为官方开源或提供免费额度的主流方案,按上手门槛排序):
| 框架 / 平台 | 开源免费 | 适合谁 | 特色 |
|---|---|---|---|
| promptfoo | 开源(Apache-2.0) | 个人开发者、CI 集成 | YAML 配置驱动,命令行跑评测,接 CI 很顺 |
| DeepEval | 开源(Apache-2.0) | Python 技术栈团队 | 自带 14+ 现成指标(幻觉率、忠实度等),pytest 风格 |
| OpenAI Evals | 开源 | 深度用 OpenAI 生态的团队 | 官方出品,与模型 API 集成最直接 |
| LangSmith | 商业(有免费层) | LangChain 用户 | 可视化 Trace + 数据集管理 + 线上监控全家桶 |
| RAGAS | 开源 | RAG 类应用 | 检索增强生成的忠实度、召回质量专项指标 |
选型原则很简单:先用开源命令行工具跑起来,等需要团队协作和线上监控时再考虑商业平台。工具本身不是瓶颈,下面这套方法才是。
从 0 到 1:最小可行的 Agent 评测方案(五步)
不需要算法团队,个人开发者和小团队照下面五步就能跑通第一个评测闭环。这也是美团图灵评测团队两年实践总结出的路径——从 Bad Case 起步,而不是设计复杂指标体系:

第 1 步:收集 20 条真实任务
从你的实际使用场景里攒 20 条任务,重点是收集失败过的 Bad Case——它们最容易暴露 Agent 的能力边界。冷启动阶段宁可少量真实,不要大量编造。
第 2 步:给每条任务写「成功标准」
一条任务一条标准,写成可判断的句子。例如「生成的周报必须包含数字」「调用删除接口前必须先请求用户确认」。写不出成功标准的任务,说明你还没想清楚要让 Agent 干什么——这本身就是评测的第一个价值。
第 3 步:能写成断言的都写成断言
关键词命中、格式校验、JSON 字段检查、单元测试……能用代码判的全部用代码判。便宜、快、零随机性。
第 4 步:主观维度上 LLM 裁判,规则二元化
剩下「回答是否得体」「方案是否合理」这类主观标准,交给 LLM-as-Judge。记住美团的实测经验:把一个模糊标准拆成多条是/否判断,人机一致率能从 60% 量级拉到 90%+。
第 5 步:把通过的任务固化成回归集
Agent 表现稳定的任务挪进回归集,每次改提示词、换模型、加工具后全量重跑。这是 Anthropic 强调的能力评测/回归评测分离——回归集掉分,就是这次改动弄坏了东西。
一个降低预期的提醒:Agent 输出有随机性,单次跑分不代表真实水平,重要结论多跑几轮(多 Trial)取平均。另外,如果你的 Agent 还在选型阶段,可以先把《AI Agent 工作流入门:先从哪些低风险任务开始》里的低风险任务作为评测素材,安全又实用。
企业级实践参考:这些数据值得抄作业
想了解头部团队真实做到什么水平,两组公开数据:
Anthropic(Claude Code 团队):Claude Code 早期靠员工和用户反馈快速迭代,规模化后逐步建起评测——先覆盖「简洁性」「文件编辑」这类窄场景,再扩展到「过度工程」这类复杂行为。他们的量化收益:新模型发布时,有评测体系的团队几天就能完成验证升级,没有的要几周。视频编辑公司 Descript 把成功标准收敛成三句话:别弄坏东西、按我说的做、做好它;AI 建站工具 Bolt 用 3 个月建起「静态分析 + 浏览器 Agent 验证 + LLM 裁判」的评测系统。
美团(图灵 Agent 评测团队):两年 BP 数十条业务线的经验浓缩成几条:观测是评测的基石(看不到执行过程就定位不了问题);一个「独裁者」拉齐评测标准好过十个各自为政的评审;评测指标体系是喂出来的——数字站长业务从启动时 20 多个指标,一年扩展到近 200 个。他们踩过最大的坑:新团队总想先设计一套复杂精妙的指标体系,越复杂越难执行,先让数据飞轮转起来比什么都重要。
总结:评测是 Agent 项目的「量产关卡」
回到开头的问题——评测 Agent 怎么做?三句话带走:
- 指标四层:结果、过程、效率、安全,只看成功率一定误判;
- 判卷三步:能断言的断言,主观的交给 LLM 裁判(记得二元化),人工抽检兜底;
- 起步五步:20 条真实任务 → 写成功标准 → 代码断言 → LLM 裁判 → 回归集,Bad Case 是最好的起点。
搭 Agent 的门槛已经低到一句提示词,而判断 Agent 好不好的门槛,就是你和「Demo 惊艳、上线翻车」之间的距离。把这套最小评测闭环跑起来,这个距离会以肉眼可见的速度缩短。
本文由 xia345 AI 指南编辑组整理。数据来源:Anthropic 官方工程博客、美团技术团队博客、SWE-bench 官网、AgentBench 仓库 及各基准官方论文,核对日期 2026 年 8 月 25 日。
相关阅读:
常见问题
AI Agent 评测和普通软件测试有什么区别?
普通测试验证「代码逻辑对不对」,输入输出确定;Agent 评测验证「模型 + 工具 + 流程的整个系统在随机环境下能不能稳定交付」,同一输入每次执行路径都可能不同。所以 Agent 评测除了看结果,还要看过程轨迹、成本效率和安全边界,且需要多轮试验取平均。
Agent 评测指标有哪些?
主流分四层:结果层(任务成功率、测试通过率)、过程层(工具调用正确率、无效重试次数)、效率层(耗时、Token 用量、单任务成本)、安全层(越权操作、数据泄露)。个人项目至少盯住「成功率 + 单任务成本」两项。
LLM-as-Judge 可靠吗?
单独用不可靠——LLM 裁判有随机性,还会偏袒长答案和特定格式。可靠的做法是:规则二元化(把模糊标准拆成是/否判断)+ 定期人工抽检校准。美团实测:二元化改造后人机一致率从 62% 提升到 92%。
个人开发者有必要做 Agent 评测吗?
有必要,但做轻量版。判断标准:如果你频繁调整提示词、更换模型或依赖 Agent 处理重复性工作,20 条任务的迷你回归集能帮你几分钟内确认「这次改动是变好还是变坏」,远比每次手工试来得省时间。
AgentBench、SWE-bench、GAIA 该参考哪个?
看你的 Agent 类型:编程类看 SWE-bench(Verified 子集),通用助手类看 GAIA,客服/业务流程类看 τ-bench,想全面了解模型 Agent 综合能力看 AgentBench。但注意公开基准存在环境漂移和过拟合问题,选型参考可以,替代自建业务评测不行。
有免费的 Agent 评测工具吗?
有。promptfoo 和 DeepEval 都是 Apache-2.0 开源协议,个人商用都免费;OpenAI Evals 同样开源。商业平台 LangSmith 有免费额度,起步阶段完全够用。

京ICP备2024094994号-29