Agent 越来越自治,人应该怎么管?从逐步审批到持续监督

结合 Anthropic 的真实自治研究与 OpenAI 的 Codex 控制实践,给出企业设计可见、可干预、风险分级和可追责监督机制的方法。

AI Agent人机协作AI 治理数字员工

Agent 能持续工作的时间越来越长,企业最直觉的控制方法是“每一步都让人确认”。但审批过多会制造新的风险:员工不再认真阅读,只是机械点击允许,真正危险的动作反而淹没在提示中。

Anthropic 对真实 Agent 使用的自治研究发现,经验用户更愿意自动批准部分操作,同时也更频繁地中断 Agent。这说明成熟监督不是减少人的参与,而是改变参与方式:从操作每一步,转向观察目标、轨迹和异常,在需要时迅速介入。

四种监督模式

低风险任务适合“事后抽检”,例如公开资料整理和内部草稿。中风险任务适合“持续可见、异常中断”,例如只读分析和代码测试。高风险任务适合“动作前审批”,例如外部发送、生产写入和费用支出。不可逆或重大风险任务则需要双人复核、职责分离或根本禁止 Agent 执行。

风险应由动作和数据决定,而不是由模型自己判断。读取公开网页和修改生产权限不能共享同一套默认批准策略。

监督界面应该显示什么

用户至少要看见当前目标、已完成步骤、准备调用的工具、使用身份、将要改变的外部状态、预算和剩余时间。只显示“Agent 正在思考”没有监督价值。

审批时应展示真实动作参数。例如发送邮件要显示收件人、正文和附件;修改记录要显示字段前后差异。自然语言摘要可以辅助理解,但不能替代真实参数。

让中断和恢复成为正常能力

Agent 不应只有“运行完成”和“彻底失败”两种状态。用户需要暂停、补充信息、修改目标、撤销某一步、从检查点恢复或转交另一位负责人。

长流程还要处理人员下班、权限变化、工具故障和审批超时。任务状态必须持久化,重试必须幂等,避免恢复后重复发送或重复扣款。

专家负责目标与验收

Anthropic 的 Claude Code 专业知识研究 表明,领域知识仍能提高 Agent 工作效果。企业应把专家经验转成清晰目标、边界、示例、评测和异常规则,而不是只让专家在最后兜底。

岗位负责人需要拥有停止 Agent、调整权限和否决发布的权力,同时对评测门槛和业务结果负责。技术团队负责运行可靠性,安全与法务负责控制边界,责任不能全部推给最终用户。

用监督成本衡量自动化

任务完成率高但检查耗时不降,不代表成功自动化。建议同时跟踪每项任务的审批次数、人工活跃时间、中断原因、返工、异常发现率和未被发现的错误。

随着系统成熟,目标不是把人工参与降到零,而是让人工时间集中在高价值判断。低风险步骤自动执行,高风险步骤得到充分上下文,异常能快速被看见和处理。

数字员工需要“管理制度”

每个生产 Agent 都应有业务负责人、权限所有者、评测版本、服务范围、预算、升级路径和停用机制。组织还应定期复查长期未使用的工具、过期身份和不再适用的自动化。

人类监督不是一个弹窗功能,而是产品设计、权限架构和组织责任的组合。Agent 越自治,监督越需要从零散批准升级为可见、可干预、可恢复和可追责的管理系统。

原始资料Anthropic Measuring Agent Autonomy