让模型干日常会计,最好成绩才21%
小宋折腾Agent · 2026-09-18T15:30:08
Ramp 做了一个面向会计场景的基准测试 Ramp Accounting Bench,和专业会计人员一起整理了 137 个基于日常会计工作流的任务与评分标准。 结果显示,就算给三次尝试机会,表现最好的模型准确率也只有 21% 左右。日常会计看着步骤固定,真拆成 Agent 去跑各种真实账务流、对账和校验,目前还是个没解决好的难题。
小宋折腾Agent · 2026-09-18T15:30:08
Ramp 做了一个面向会计场景的基准测试 Ramp Accounting Bench,和专业会计人员一起整理了 137 个基于日常会计工作流的任务与评分标准。 结果显示,就算给三次尝试机会,表现最好的模型准确率也只有 21% 左右。日常会计看着步骤固定,真拆成 Agent 去跑各种真实账务流、对账和校验,目前还是个没解决好的难题。