精选AWS AI Blog观点
超越节省工时:构建智能体自动化的商业价值论证框架
文章指出传统的RPA投资回报率模型无法全面衡量智能体自动化(Agentic Automation)的价值。作者为AI卓越中心领导者提供了一个评估框架,从时间节省、异常处理、决策质量和维护经济学四个维度量化智能体的综合价值,并指导企业优先选择哪些工作流进行自动化部署。
智能体自动化(Agentic automation),即能够推理并适应环境以完成任务的软件,正出现在企业卓越人工智能中心(AI CoE)的路径规划中。然而,企业用于证明自动化投资合理性的传统方法——“节省工时乘以人工成本减去构建成本”——是为机器人流程自动化(RPA)等基于规则的工具设计的。该模型未能捕捉到智能体所创造的大部分价值。
在本文中,我们介绍了一个框架,AI CoE 领导者可利用它构建一个能全面体现智能体自动化价值的商业案例。您将了解到为何 RPA 时代的投资回报率(ROI)模型存在不足、如何衡量其遗漏的价值,以及哪些工作流值得通过智能体进行自动化处理。
为何传统商业案例存在不足
经典的投资回报率(ROI)模型是为稳定、高吞吐量且基于规则的工作而构建的:计算交易数量,测量耗时,乘以综合费率,再减去构建成本。RPA 正是在这些条件下确立了其地位。
该模型预设了其诞生时的世界图景。它假设流程是稳定的,因此忽略了随着流程变更而产生的自动化维护成本;它假设任务是基于规则的,因此没有为异常情况设置单独的成本项;它假设工作本身就是全部职责,因此从未计入人类监督的成本。此外,它将节省的一小时视为已储存的价值,但实际上释放出的产能往往会被积压任务重新填满,而无法反映在损益表(P&L)上。麦肯锡指出,企业反复犯下的错误正是低估了将节省的时间转化为成果所需的工作投入:成功的 AI 转型遵循“1:3:5 模式”,即“每在智能体技术上投入一美元,组织就会在三美元用于流程重构,五美元用于能力建设和推广”。然而,大多数公司完全颠倒了这一公式”(麦肯锡,《智能体 AI 变革管理:弥合推广差距》,2026)。
我们通常认为自动化的价值存在于任务本身,但在智能体自动化中,大部分价值存在于任务周围:包括判断力、异常处理以及跨系统的协调。真正的收益来自于围绕智能体重构工作流,而非简单地将智能体嵌入未加改变的现有流程中。
旧模型遗漏的价值维度
更优的商业案例应衡量四个维度的价值,以及决定这些价值能否反映在损益表上的条件。我们称之为“智能体价值模型”。
时间节省。这仍然被计入,但智能体将其应用范围扩展到了固定规则 RPA 难以处理或仅能通过大量异常逻辑才能处理的领域。衡量标准相同,但智能体将其应用于更大规模的工作基础之上。
异常处理。异常承载着巨大的成本。AWS 的指导文件提供了规划范围:纠正一个错误的成本可能是原始交易的 1.5 至 4 倍,而人为错误可能占运营成本的 2% 至 15%(AWS 建议性指导,《评估当前人力流程成本》)。重做乘数定价的是团队拦截到的异常,而错误百分比定价的是漏网之鱼。仅计算劳动力的案例则同时忽略了这两者。
决策质量。智能体可以在大规模应用中执行统一政策并记录推理依据,尽管一致性和错误率需要持续监测。正如 AWS 所指出的,“低频次、高价值的决策可能足以证明使用智能体辅助以提高决策质量,而非为了降低成本”(AWS 建议性指导,《理解智能体 AI 经济学》)。在信贷、定价或风险领域做出的一个更好决策,其价值可能远超一年节省下来的分钟数。
变更韧性与维护经济性。这一点具有双重影响。脚本是脆弱的:当屏幕界面或上游系统发生变化时,脚本会失效,需要有人重新构建它们。智能体能够在无需重写代码的情况下吸收部分变化,但它们将维护工作转移到了评估、提示词工程、监控和模型运营上,而非消除维护需求,且运行它们本身也产生成本。商业案例需权衡避免脆弱脚本维护的成本与持续的智能体运营成本。因此,在经常变化的流程中,数学计算可能倾向于支持智能体;而在冻结不变的流程中,则可能并非如此。
统领这四项的共同条件是价值实现:每一项收益都需要一个明确的机制,将运营改进转化为经济价值,并指定责任人。对于释放的劳动力而言,这意味着减少支出或将产能重新定向到具体的、可衡量的成果上。
以理赔分类流程为例,辅以说明性数据。该流程每年处理 200,000 份理赔案件,每案耗时约 12 分钟(不含返工),完全成本为每小时 45 美元,基础成本约为 180 万美元。自动化处理其中常规的 70%,在扣除这些案件仍需的监督时间之前,可释放约 28,000 小时,即约 126 万美元的产能。这正是大多数案例出错的地方,因为释放工时并不等同于节省资金。只有当公司减少人员雇佣或削减承包商、加班费或外包支出时,实际花费才会减少。否则,相同的人员仍留在薪资名单上,损益表(P&L)永远看不到这 126 万美元。如果通过员工流失和降低加班费能捕获其中一半的价值,那么该商业案例应体现约 63 万美元,而非全额。
更常见的情况是重新部署这些人员,此时价值在于他们现在所创造的成果。对于每一个释放的小时,只计算重新部署产生的价值或现金成本的降低,二者不可兼得。然后加上仅基于劳动力的案例无法看到的额外部分。在需要修正的 8%(16,000 份案件)中,修正成本约为基本处理成本(12 分钟,每小时 45 美元)的 3.5 倍,由此产生约 50.4 万美元的年度修正风险敞口。这是一个基准值,而非智能体带来的价值。真正的价值在于智能体消除的部分:假设减少 40%,并乘以 75% 的实现系数,模型得出的收益约为 15.1 万美元。这尚未计入因单次欺诈标记决策改善所带来的价值。由于 12 分钟的基础时间不包含返工,这部分池子不与释放的产能重叠。如果您的基准线包含返工时间,请将这些节省计入同一个池子中。这种版本的商业案例能够得出财务部门可以辩护的数字。
为了保持数学逻辑的一致性,请以相同的方式衡量每个价值池的大小并净扣除成本,如下表总结所示。
| 价值池 | 基准 | 预期差异 | 实现系数 | 负责人 |
|---|---|---|---|---|
| 释放的产能 | 工时 × 完全费率 | 自动化百分比 | 仅在重新部署至具体成果或支出下降时适用 | 运营主管 |
| 异常与错误成本 | 修正成本 + 错误损失 | 预期减少量 | 捕获比例 | 质量主管 |
| 决策质量 | 更好决策的价值 | 每次决策的提升幅度 | 可归因份额 | 领域负责人 |
| 变更韧性与维护经济学 | 脚本修复成本 + 停机时间 | 避免的重建、更快的变更适应 | 避免重建的比例,公式中已扣除一次智能体成本 | 工程主管 |
将所有内容表述为一行,将每项收益分配到一个池中,以防止重复计算:年度净价值 = 实现的产能价值 + 避免的修正和错误成本 + 决策结果提升 + 避免的维护和停机成本,减去年化实施成本,减去智能体运行、集成、评估、监督、治理和变革管理成本,减去智能体引入的任何新错误造成的损失。智能体未消除的错误已经位于“避免的成本”项之外,因此不要再次减去它们。对于多年期项目,在实际支出的年份记录实施成本,而不是将其年化;随着采用率的提高逐步增加收益;并将每年的现金流折现为净现值(NPV)。
亚马逊快速自动化(Amazon Quick Automate)——亚马逊快速(Amazon Quick)内的自动化服务——的三次早期部署展示了这些维度的实际运作情况。临床试验站点选择公司 Kitsa 自动化地从数十万个网站中提取了超过 50 个数据点。该公司报告称,在覆盖率达到 96% 的情况下,成本节省了 91%,数据获取速度提高了 96%,并将低置信度的案例路由给审核人员处理(时间节省与异常处理)。正如 Kitsa 联合创始人兼首席技术官 Rohit Banga 在 AWS 机器学习博客文章中指出的那样,大规模统一高质量的站点数据打破了核心瓶颈。这使得其“站点查找智能体”(Site Finder Agent)能够以更精确度评估更多的站点。
跨境支付提供商 dLocal 在受控评估中实现了高达 75% 的商户合规审查自动化。这使专家能够将精力集中在复杂的高风险案例上(决策质量),并增加了对政策漂移的持续检查,从而避免周期性人工审查所遗漏的问题(变更韧性)。dLocal 报告称,过去花费数小时进行常规检查的专家,现在将这些时间用于需要监管判断的案例。
Genpact 则在多个 SAP 系统中自动化供应链风险管理,报告称将中断影响分析时间从 2-3 天缩短至几分钟。这是一种没有任何单一记录系统所能拥有的跨系统协调能力(时间节省与决策质量)。这些部署中的任何一个都无法证明所有四个维度,因此必须分别量化每个维度的价值。
优先排序框架
在两个轴线上对每个候选工作流进行评分。第一个轴线是任务复杂度,即该任务所需的推理、上下文理解和适应能力程度。第二个轴线是决策风险,即出错的成本,这决定了你可以授予多大的自主权。这两个轴线均源自 AWS 的经济性指导原则,共同构成了一个可由指导委员会使用的二乘二矩阵。
低复杂度、低风险:保留在机器人流程自动化(RPA)层面,因为在此类场景中引入智能体会增加成本而不增加价值。高复杂度、低风险属于产能提升型应用,因此应通过自动化来提高吞吐量和异常吸收能力。高复杂度、高风险属于决策质量型应用,因此需让人类保持在循环中,并以更好的决策结果来论证其合理性。低复杂度、高风险属于护栏型应用,因此应强化该步骤周围的控制措施,而不是添加其不需要的推理能力。
一个有用的捷径:如果一个人需要在各个系统间移动,并在每一步都解读模糊的上下文,则应评估采用智能体方法的可能性。如果路径保持确定性,RPA 可能仍然更便宜。使用智能体价值模型来决定衡量什么,并使用此矩阵来决定优先事项。

为领导层构建论证依据
将投资呈现为一组工作流的组合,而非单个项目。麦肯锡的研究揭示了孤立试点项目停滞的原因:近三分之二的企业已经尝试过智能体,但不到 10% 的企业将其规模化以产生切实的价值(McKinsey, “Scaling agentic AI with data transformations,” 2026)。价值来源于明确定义成果、将智能体深度嵌入核心工作流,并围绕它们重新设计运营模式。向领导层提供三到五个经过优先排序的领域,每个领域都要具备基于四个维度的论证依据。
最能说服怀疑主义 CFO 的一点是设定停止规则:分阶段进行投资,设定明确的盈亏平衡目标,并预先确定当智能体表现不佳时停止资助的节点。将每个领域与领导层已经跟踪的关键绩效指标(KPI)联系起来,无论是服务成本、周期时间、净推荐值(NPS)还是合规风险。并将治理视为加速手段:受限的自主权、高风险领域的监督以及内置的可审计性,使得随着证据的积累,你可以扩大智能体的自主权。
开始使用亚马逊快速
Amazon Quick 将研究、商业智能和自动化整合为一种代理式体验。借助其自动化服务 Quick Automate,团队能够在企业工作流中编排用户界面操作、API 调用以及人工审核环节。由此产生的案例级执行数据,可由卓越中心(CoE)与运营及财务关键绩效指标相结合,以衡量价值在实现过程中的具体情况。
这种度量方式能将首个项目扩展为整个投资组合。在审视四大价值池后,你往往会发现它们存在于人员跨系统移动、解读上下文并手动处理异常的任何地方。将一个工作流投入生产环境,基准化其价值池和运营成本,指定负责人,并验证具体数值。随后,随着每个新工作流报告结果,投资组合的案例价值便不断累积。
结论
关键在于确定代理式自动化能在哪些领域提供现有工具无法提供的价值,以及在支出之前如何证明这一点。本文所描述的纪律——即量化每一个价值池、应用现实的实现因子并设定停止规则——正是使这一证明具有可信度的核心所在。能够在一个工作流上证明价值的团队,可以基于已衡量的结果而非预测来资助下一个项目。关于底层经济学原理,一个良好的起点是 AWS 关于代理式 AI 经济学的建议指南。
关于作者
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。