关于 Coding Agent 的讨论已经从“能不能写代码”转向“能不能产生可测量的工作价值”。OpenAI 与 Anthropic 在 2026 年都公布了大规模使用研究,但这些数据应该被当作趋势信号,而不是适用于所有企业的 ROI 保证书。
OpenAI 观察到的是委派规模扩大
OpenAI 在 How agents are transforming work 中报告,Codex 用户越来越多地委派长时任务,非开发者增长快于开发者,内部法务、财务、招聘和研究等团队也逐步采用 Codex。
这说明 Coding Agent 的价值不只在代码生成,而在于用代码、文件和工具执行结构化知识工作。但数据主要来自 OpenAI 产品用户和公司内部,用户选择、组织文化与前沿模型访问都可能影响结果。
Anthropic 观察到的是分工和专业知识回报
Anthropic 的 Claude Code 使用研究 分析约 40 万个会话。典型会话中,人类更多负责规划,Claude 更多负责执行;拥有更强领域知识的用户通常成功率更高,也能从错误中更好地恢复。
这挑战了两个极端判断:Agent 既不是只能帮程序员补全代码,也还没有让专业判断变得不重要。现阶段的最佳组合更像“领域专家 + 可执行 Agent”。
使用增长不等于生产力因果
员工使用时间增加,可能说明工具有价值,也可能受到试点激励、培训、任务变化或新鲜感影响。早期采用者产出更多,也可能因为他们本来就更主动、更熟悉技术。
因此企业至少应区分四类指标:
- 采用:多少人和任务真正使用;
- 过程:完成时间、等待、返工和人工干预;
- 质量:正确率、测试通过率、缺陷和可维护性;
- 业务:交付周期、收入、客户结果或风险损失。
如何做自己的 6 周实验
选择 30 到 100 个重复出现、结果可验收的真实任务。先记录两周人工基线,再将员工随机或分阶段获得 Agent 权限。固定任务定义、代码库、数据和验收方式,避免把简单任务都分给 Agent 组。
每个任务记录人工活跃时间、端到端时间、Agent 运行时间、测试结果、返工、事故、模型成本和最终业务结果。员工节省的时间还必须说明去了哪里:如果只是变成更多会议,不能直接算成利润。
不要只统计生成代码量
代码行数可能与价值负相关。更合理的指标包括需求到上线时间、变更失败率、缺陷逃逸率、测试覆盖、代码审查时间、回滚次数和维护者理解成本。
对非技术岗位,则检查交付物是否可重复、是否有依据、是否减少跨部门等待,以及员工是否能处理过去需要工程支持的小型自动化和数据任务。
ClawSphere 判断
现有证据足以支持企业认真试验 Coding Agent,但不足以支持无条件裁员或全公司强制推广。最可能先出现的变化,是每个领域专家能够调度更多数字执行能力,工作瓶颈从“亲自完成每一步”转向“能否定义、监督和验收更多任务”。
企业真正应该投资的是任务标准、测试、数据权限和实验设计。没有这些基础,Agent 的使用量很容易增长,生产力结论却永远无法被证明。
相关阅读:企业 AI ROI 框架与AI Native 企业路线图。