AI Agent的ROI账本:从按Token付费到按结果付费

商业分析AI AgentROI测算按效果付费企业采购客服自动化SRE2026-09-19

同一套客服 Agent,三家供应商的报价单完全没法比:A 家按 token 给单价,B 家按坐席收月费,C 家按「有效解决」收 0.99 美元一次。采购会上把三张纸摊开,没人算得出哪个贵。

要横向比,先把计价单位统一成一句话:完成一件有价值的工作,花多少钱。剩下的都是这句话的展开。

Agent 自动化等级:先确定它自己能按下哪个键

等级不看模型多大,看两件事:Agent 有没有执行权限,出错后谁来收拾。

等级名称谁按下执行键典型动作常见计费方式
L0规则自动化系统关键词分流、固定话术、表单路由包年订阅
L1辅助生成人起草回复、总结工单、生成查询草稿按席位
L2人在环内执行人逐步确认调接口查订单、发起退款等审批席位 + 按任务
L3限定域自主系统,异常才升级在授权额度内直接退款、改派、重跑作业按任务 / 按效果
L4跨系统目标自主系统多系统多步骤、跨天完成一个目标按效果 + 兜底条款
L2 和 L3 之间有一条硬线:这个动作能不能自动回滚。退款能原路退回,删库不能。不能回滚的动作留在 L2。

等级高不等于回本快。L1 的收益最难吹也最好算——省下的是写草稿那几分钟,出错了人已经拦住了。L3 才真正动人力结构,但兜底成本也从这里开始冒头。

每个场景该盯的分子和分母

通用算式只有一行:

单件有效任务成本 =(模型 token + 工具调用 + 检索与存储 + 人工兜底 + 平台费)÷ 有效任务数

分子容易算,分母容易注水。三个场景的分母定义完全不同。

场景分子里的主要项分母怎么定义容易注水的数字
客服token、知识检索、人工升级问题被真正关闭,且 72 小时内没有因同一问题再次来「Agent 已回复」的会话数
销售线索清洗、触达通道费、销售接手时间销售认可的合格会议,或进入报价阶段的线索对话数、回复数
运维告警摘要、日志检索、工具调用、误操作回滚有效定位并消除的故障,不含自行恢复的抖动告警处理条数

客服:先算人工兜底那一项

下面这组参数是示例,换成你自己的实测值再算。

一天 1000 张工单,单次对话平均 6000 输入 token、800 输出 token。按输入 2.5 美元/百万、输出 10 美元/百万计:

  • 模型 token:0.023 美元
  • 向量检索:0.002 美元
  • 工具调用(查订单、改地址)3 次:0.003 美元
  • 平台费摊销:0.05 美元
  • 人工兜底:25% 升级人工,人工单次 3.5 美元,摊到每次 0.875 美元
合计约 0.95 美元/次。有效解决率 60%,分母是 600,单件有效解决成本约 1.58 美元。

关键在最后一行的占比:0.875 ÷ 0.95 ≈ 92%。钱几乎全花在人工兜底上。想让这个数字降下来,动作是压低升级率,而不是去砍 token 单价——token 单价打五折,总成本只降 1%。

销售:分母是合格线索,不是对话数

月度 5000 条线索的 SDR 场景,同样是示例参数:

  • 线索清洗与个性化开头:0.04 美元/条 → 200 美元
  • 邮件/短信通道:0.01 美元/条 → 50 美元
  • 销售接手 8% 的线索,每次 20 分钟,人力 25 美元/小时 → 约 3333 美元
  • 平台费:300 美元
合计约 3880 美元,产出 60 场合格会议,单场约 65 美元。

同一笔钱,如果按「触发回复的线索数」当分母,可能变成 800 个,单次 4.85 美元,看上去便宜十几倍,销售没法用这个数字做决策。签按效果付费的合同前,把「合格」的定义写成可核对的字段,比如「已确认预算与时间、由销售在 CRM 里手动标记为 SQL」。

运维:省下来的主要不是人力

每月 2 万条告警压缩到 800 条,费用侧:

  • token 与日志检索:120 美元
  • 工具调用:80 美元
  • 误报升级人工:5% 的 800 条,每次 15 分钟,30 美元/小时 → 300 美元
  • 平台费:500 美元
合计 1000 美元/月。收益侧如果只算 MTTR:每月 12 次 P2,从 45 分钟降到 28 分钟,省 204 分钟 ≈ 3.4 小时,折 102 美元。按这个口径算,账是亏的。

运维 Agent 的收益大头在「少发生一次事故值多少钱」,这个数要由业务方给,不是运维自己拍。把这笔避免损失写进 ROI 表,但单独放一行,别和人力节省混在一起,否则审计时说不清。

四种付费方式,风险压在哪一侧

计费方式计价单位厂商承担的风险买方承担的风险适合的阶段谈判要点
订阅月/年固定费用量、效果用不满也照付L0–L1 试点试用期长度、超量后的单价
按席位人 × 月效果用量波动、保底席位L1–L2是否要求最低席位数、能否中途减席
按任务次/动作部分效果「动作」边界被放大L2–L3一次任务的步骤上限、失败重试是否计费
按效果有效解决 / 合格线索效果全部归因窗口与定义权L3–L4谁判定「有效」、争议处理、返工是否重计
按任务计费容易失控的地方在「动作」两个字。Agent 拆成 6 步完成一件事,按动作收就是 6 份钱,按任务收就是 1 份。合同里写清「一次用户发起的请求算一次任务,内部重试不计费」,这一句可能省掉一半预算。

按效果付费有公开锚点可参照。Intercom 的 Fin 对外按每次有效解决 0.99 美元计价,没解决不收(具体价格以厂商官网价目页为准)。这种模式对买方友好,代价是供应商会加两样东西:最低月消费,以及归因窗口——用户在 7 天内反复问同一件事,算一次还是三次。这两条不写死在合同里,后面一定扯皮。

现实里更常见的是混合:一笔平台底费 + 按效果的上浮。底费覆盖供应商的固定成本,效果费决定它的利润。谈判时把底费压到能覆盖试运行规模就行,别一签一年。

采购前要拿到的东西

  • 影子模式测试权限:Agent 只生成建议、不对外发送,跑满 14 天
  • 升级率与兜底成本的真实数据,不接受「行业平均」
  • 有效任务的判定规则,落到字段级,写明谁有最终判定权
  • 归因窗口与重复计数规则(同一问题 3 天/7 天内复发怎么算)
  • 失败重试、人工接管、系统超时三种情况是否计费
  • 数据留存位置、能否导出、退出时的删除证明
  • 退出条款:能否按月退、历史数据带走要多久、有无迁移协助
  • 权限清单:Agent 能调用哪些写接口,额度和频次上限是多少
  • 回滚方案:一次错误的批量变更,多久能恢复,谁负责
打分时把「单价」和「上述条款」分开评。单价低的方案如果归因窗口只有 24 小时,实际成本可能高出一截。

14 天影子测试怎么做

影子测试的目的不是看 Agent 多聪明,是把分母测出来。

  • 选一个 L2 场景,权限只给读,不给写
  • 每天随机抽 50 条真实请求,让 Agent 生成建议,人工标注「采纳 / 不采纳 / 方向错」
  • 记录三组数:生成成本、人工评判耗时、原流程处理耗时
  • 第 7 天和第 14 天各算一次采纳率,看是否稳定
  • 把采纳率代入前面的算式,算出单件有效任务成本
  • 拿到这个数,再让供应商报价
采纳率不稳定的场景先别签按效果合同。分母在抖,单价谈不实。

先从影子测试开始。挑一个 L2 场景跑两周,把「有效任务数」这个数字拿到手——它比任何一份报价单都更能决定这笔钱花得值不值。

PREMIUM

需要完整版教程?

包含详细步骤、视频演示、提示词模板和可下载资料包。微信支付即时获取。

购买完整版 ¥29.90