← 返回信息流

dev.to #ai短讯

AI辅助工作更便宜吗?一项为期五天的成本估算

dev.to作者:SeaOtter ( Kentaro Mori )行业AI评分:50/100

作者基于过去五天使用AI工具的工作记录,尝试估算引入生成式AI前后的成本差异。文章强调所有数据均为估算而非精确测量节省值,并分享了具体的评估方法及其局限性。

使用我的工作记录和成本估算报告,在人工智能协助下准备。成本比较仅为估算值。

我回顾了五天来使用人工智能工具完成的工作,并尝试为其定价,同时对比了在没有生成式人工智能的情况下完成相同工作可能产生的费用。本文介绍了我是如何做到这一点的,以及这些数字说明了什么、没有说明什么。

关于框架的说明:以下内容均为估算值,并非实际节省的测量结果。我认为可推广到其他项目的部分是方法论:准确描述变化之处,附上证据,并在比较成本前统计人工审查时间。简单的任务列表就足够了。你不需要先构建复杂的人工智能系统。

实际情况

我回顾了2026年10月5日至9日(日本标准时间)的工作。报告将其分为35个任务记录单元,涵盖软件变更、研究、文档、媒体准备、维护和管理。

这35个单元在规模和价值上差异很大。有些是对现有应用程序的改进,有些是文档或小型维护任务。此类计数并非生产力评分,也绝对不代表构建了35个新产品。

  • 一个现有的记忆应用获得了显示、存储、同步、备份和搜索方面的改进,以及相关的文档编写。
  • 一个语音应用修复了录音、播放和界面问题,并记录了Windows设备检查情况。几个相关的修复被合并计算。
  • 一项云实验通过Web界面让一个小规模AI模型给出了一个真实答案。随后删除了临时服务器。这完成了该实验声明的阶段;持续服务不在其范围内。

对于每个条目,我需要一句话来描述“完成”的界限。如果没有这一点,一次小型成功测试可能会悄无声息地变成对整个系统的宣称。

证据与局限并存

如果存在公开的代码变更,报告会提供链接。其他条目则依赖工作记录或我自己的完成确认。这些属于不同类型的证据,因此标注方式不同。

有几个值得明确指出的局限性:

  • 检查代码变更记录并不会重新运行软件。
  • 记录的Windows检查并不能证明所有设备都能正常工作。
  • 一款基于浏览器的游戏已在Chrome中得到确认,而在真实Safari设备上的测试仍未完成。

如果你想在自己的项目中尝试此方法,每个条目包含以下四个字段将大有裨益:

  1. 具体的变更或交付物。
  2. 可用的证据,例如代码变更链接或测试结果。
  3. 已检查的环境或条件。
  4. 未完成或未验证的部分。

相关的重试应归入同一结果之下。否则,一次困难的修复会因为经历了多次尝试而虚增任务数量。

这需要多少人工工作量?

下一个问题是:如果没有生成式人工智能,有经验的人员可能需要多少工作量才能达到相同的记录范围?

这些假设仍允许使用现有的代码库、普通脚本、模板、工具和领域知识。从零开始重建每个应用程序将描述一份不同的工作。

自下而上的估算约为180小时(低值)、310小时(中值)和510小时(高值)。中值计算恰好为309小时。

按每月160个工作小时计算,309小时相当于309 / 160 ≈ 1.93人月。这是对估算值的单位换算,而非人员配置计划或交付日期。

这些是事后判断,而非秒表测量或观察到的节省工时。该范围反映了对复用、调查和修订的不同假设。它不是统计置信区间。

我也未将所有等待时间视为劳动。下载或自动化测试需要时间,但无需有人全程监视。依赖关系也很重要:演示必须先能运行,才能进行拍摄。总估算劳动力无法保证完工日期。

成本假设详述

在假设每小时7,500日元的费率下,中值人工工作场景的成本为:

309小时 × 日元7,500 = 日元2,317,500,即约232万日元。

该时薪是规划假设,而非经核实的市场费率。

AI侧的参考金额为日元5,209.92,约日元5,210。它结合了五天的订阅分配费用与一次RunPod预付费额度购买。额度购买是存入账户的资金;期间实际计算消耗量未知。

订阅数据来自报告的账单证据和用户报告的支付金额,而非当前广告价格。部分分配细节仍不确定,包括ChatGPT的计费周期。报告在必要时也使用了假设的货币换算。

最重要的注意事项:这日元5,210未包含我的指令、审批和审核时间,以及其他成本。将其直接与完整的人工工作估算进行比较,会掩盖工作流程中的主要部分。

因此,报告增加了一种情景。假设人工管理和审核耗时40小时,每小时日元7,500。即40 / 160 = 0.25人月,合计金额变为日元305,209.92,约日元305,210。这比核心假设的人工工作成本低了约87%。

![比较核心人工工作估算与已分配AI付款及假设40小时人工监督的成本情景。

由AI辅助程序化渲染的图表。这些是具有不同成本边界的规划情景。87%的差异并非衡量的投资回报率,且同等输出质量未经独立验证。

低人工工作情景为日元892,500,采用更低的工时和更低的假设费率。这个较小的基准很重要:返工、错误和额外监督可能会侵蚀表面优势,而它们的实际成本在此处并未测量。

一个你可以核查的工作流程

如果你想尝试类似的事情,从一个有界任务开始:修复可重现的问题、更新已知文档或调查特定问题。在移交工作之前定义验收检查。

![一个人主导的工作流程,其中一个人定义任务,AI执行有界工作,一个人在接受结果之前审查证据。]

由AI辅助程序化渲染的图表。推荐的责任划分。此图并非声称审查周内的每项任务都遵循相同的流程。

让人负责生产变更、机密信息、安全以及需要专业知识做出的决策。如果你自己无法评估结果,请引入能够评估的人。

我从中得出的结论

在上述注意事项的前提下,这些估算支持对于范围明确且结果可核查的工作采用以人为核心的AI辅助:一个人保留需求、决策和最终验收,AI在其中执行有界工作。这是我建议首先尝试的设置。

审查还表明,为什么仔细的记录比令人印象深刻的任务数量更重要。对于你自己的试验,记录输出以及使其可用所需的人工努力。一份小而记录良好的比较,比一个大数字更能告诉你下一步该委托什么。一周的时间不足以证明减少人员编制或无人值守操作的合理性。

来源:完整报告,包含任务边界、证据和计算假设,日文。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文