模型回答一道题,可以用答案正确率衡量;Agent 连续运行一小时,调用十几个工具并修改多个系统,仅检查最后一段文字远远不够。长时 Agent 的质量来自模型、提示、工具、权限、环境、重试和人工监督的共同作用。
为什么聊天基准会失真
OpenAI 在 可信第三方评测方法 中指出,前沿系统会使用工具、保存信息并在更大的工作流中行动,评测必须描述其外部环境和 Agent 设置。
同一个模型连接不同工具、得到不同权限或采用不同重试策略,结果可能完全不同。只公布“某模型在某 benchmark 得分”,无法回答企业系统能否安全完成任务。
Anthropic 的 自治研究 也提醒,运行时间不是完美的能力指标:更强的模型可能更快,子 Agent 可能并行处理更多工作。企业需要同时观察任务难度、外部影响和人类干预。
一套六层评测结构
第一层是最终结果:目标是否完成,业务系统是否处于正确状态,交付物能否被使用。
第二层是轨迹:Agent 是否选择了合理工具,参数是否正确,是否出现无意义循环或重复调用。
第三层是风险:有没有越权访问、敏感数据外发、错误写入、绕过审批或执行不可逆动作。
第四层是人工成本:用户需要澄清几次,审批多少次,检查多久,什么时候中断或接管。
第五层是工程质量:任务能否暂停、恢复、重放和回滚,网络或模型故障后是否幂等。
第六层是经济性:模型、工具、计算、人工审核和失败返工的完整单位任务成本。
固定环境,而不仅是固定提示词
可复现评测需要记录模型精确版本、系统提示、温度、工具 schema、初始数据库、文件快照、用户身份、网络权限、最大时长、最大预算、重试次数和人工介入规则。
对于会修改外部系统的任务,最好在隔离副本中运行,最后比较前后状态。测试“成功发送一封邮件”时,不只检查 Agent 声称发送成功,而要检查收件人、主题、正文、附件和真实投递记录。
评测集要包含失败和攻击
生产环境不会只出现标准输入。评测集应加入缺失字段、冲突指令、过期知识、权限不足、工具超时、重复事件、恶意文档和提示注入。
高风险流程还应故意提供诱导条件,检查 Agent 是否会把只读任务升级为写入、是否会泄露其他用户数据,以及能否在不确定时选择停止和升级。
上线后继续做在线评测
离线通过不等于永远可靠。模型、提示、工具和业务数据都在变化。生产系统应抽样回放,跟踪成功率、人工接管、异常动作、成本和用户纠正,并在模型或工具升级前运行完整回归。
评测失败不一定意味着更换模型。有时问题来自工具描述模糊、权限过大、状态不可恢复或验收标准不清。只有把模型层与系统层分开测量,团队才能找到真正的改进位置。
企业最低上线门槛
一个长时 Agent 至少应满足:有明确任务所有者;能在沙箱或最小权限下执行;所有外部动作可追踪;高风险步骤需独立策略或审批;可以暂停和人工接管;有固定回归集;有成本和运行时上限。
长时能力越强,越不能只依赖模型“自己小心”。真正可靠的 Agent 是可验证、可限制、可中断和可追责的系统。