2026中国AI Agent落地白皮书:从PPT到产线的100个真实案例
这篇报告不编 100 条客户故事。真实案例要能追溯到官方公告、客户案例页、财报电话会或可回放日志。下面给你一套案例登记字段,按它把公开线索填满,100 个案例才有意义。数据截至 2026-05;工具价格和功能以官方页为准;不构成采购或投资建议。
1. Agent 技术栈全景图:规划、记忆、工具、执行
先看请求怎么走完一圈。生产环境里,最常坏的不是模型,是权限、重试和回滚。
| 层 | 生产环境必备 | 常见坑 | 验收指标 |
|---|---|---|---|
| 规划 | 状态机 + LLM 拆解;限制最大步数 | 让模型自由规划 20 步,失败不可复现 | 任务完成率、平均步数、越权调用次数 |
| 记忆 | 会话记忆、业务库、向量库分层;权限过滤 | 把全部聊天塞 prompt,成本涨、串权限 | 召回准确率、幻觉率、单次 token |
| 工具 | OpenAPI/MCP 描述;输入输出 schema;错误码 | 工具描述模糊,模型猜参数 | 工具调用成功率、参数错误率、P95 延迟 |
| 执行 | 队列、幂等键、重试上限、补偿事务 | 重复扣款、重复发券 | 重复执行率、回滚成功率、人工接管率 |
| 观测 | trace id、token、成本、延迟、决策日志 | 只看最终答案,查不到中间步骤 | 可回放率、预算告警命中、审计完整率 |
记忆别只做向量库。把记忆分四块:工作记忆放当前任务变量;情景记忆放历史工单和处理结果;语义记忆放产品文档、制度、FAQ;权限记忆放用户、租户、数据范围。向量检索前先按权限过滤,检索后附引用。没有引用,金融和客服场景不要直接回复客户。
工具层写清楚六件事:谁调用、输入什么、输出什么、错误码、费用、幂等。MCP 在 2024 年由 Anthropic 开源,后续被多类客户端支持,适合把内部 API 包装成 Agent 可调用工具。限制也明显:MCP server 一旦给错权限,模型可能批量读数据。生产做法是把写操作拆成生成草稿和人工确认后执行两段。
执行层最容易被忽略。发邮件、退款、改订单、写数据库都要幂等键。重试 3 次仍失败,进入人工队列。回滚要做补偿:退款对应冲正,发券对应作废,发消息对应发更正。没有补偿方案,别上产线。
2. 金融、电商、客服、研发:四类场景拆解模板
下面不写虚构客户。每个场景给公开可核验的产品线索,以及拆解字段。你要凑 100 个案例,按字段去官网、客户案例页、财报、技术博客核验。
2.1 案例登记字段
- 主体:公司/部门/产品名
- 时间:上线或披露日期
- 问题:原来谁做什么,耗时/错误/成本在哪
- Agent 边界:读哪些数据、能调哪些工具、不能做什么
- 模型与框架:模型、Agent 框架、向量库、部署方式
- 人工接管:什么条件转人工,SLA 多少
- 指标:任务完成率、人工接管率、单次成本、P95 延迟、差错率
- 证据:官方链接、公告日期、可回放日志或截图
- 失败记录:至少一条失败模式和修复动作
2.2 金融:知识问答和报告初稿先落地
公开线索:摩根士丹利与 OpenAI 合作的 AI @ Morgan Stanley Assistant 用于内部知识库问答;JPMorgan 的 LLM Suite 用于员工研究写作辅助。国内银行、券商、保险的公开披露更少,选型时要求厂商提供私有化部署、审计日志、数据隔离证明。
| 可做 | 谨慎做 | 不要做 |
|---|---|---|
| 内部制度问答、研报摘要、会议纪要、客户经理话术草稿 | 投资建议生成、自动交易、信贷审批 | 无人工复核直接对客承诺收益 |
| 工具:内部搜索、文档库、CRM 只读接口 | 工具:风控规则查询、工单创建 | 工具:资金划转、修改客户风险等级 |
2.3 电商:商家助手比购物助手更容易算账
公开线索:Amazon Rufus 面向消费者做购物问答;Shopify Sidekick 面向商家做商品、订单、营销辅助。国内可关注阿里、京东、抖音电商公开的商家 AI 工具,但具体收益数字以官方披露为准。
电商 Agent 的产线切入点:
- 商品上架:从图片和表格生成标题、卖点、属性,人工审核后发布。
- 客服售前:回答尺码、材质、发货、退换,转人工条件写清楚。
- 售后工单:识别退款/退货/补发意图,生成处理草稿,不直接退款。
- 广告投放:生成素材和人群建议,预算调整仍需人工确认。
| 指标 | 怎么算 | 常见坑 |
|---|---|---|
| 节省工时 | 单量 × 原处理分钟 × 自动化率 / 60 | 把审核时间漏算 |
| 增量收入 | 曝光 × 点击率提升 × 转化率 × 客单价 × 毛利率 | 把自然增长算成 Agent 贡献 |
| 差错损失 | 错发/错退/错价次数 × 单次成本 | 只算成功单,不算赔付 |
| 成本 | token + 云 + 插件 + 人工复核 + 运维 | 忽略长尾工单成本 |
2.4 客服:Klarna 的公开数据要配合后续调整看
公开线索:Klarna 在 2024 年披露 AI assistant 上线首月处理约 230 万次对话,占其客服对话三分之二,相当于 700 名全职客服的工作量。后续有媒体报道其重新招聘人工客服,这说明 Agent 适合处理高频标准问题,复杂投诉、催收、情绪激烈场景仍要人工。
客服 Agent 的最小可用配置:
- 意图分类:退款、物流、产品、投诉、其他
- 知识库:FAQ、政策、订单接口只读
- 工具:查订单、查物流、创建工单;退款只生成草稿
- 转人工:连续两次未解决、用户要求人工、金额超过阈值、负面情绪
- 评测:每周 200 条人工标注对话,混淆矩阵看漏判
2.5 研发:代码 Agent 先做只读和补全
公开线索:GitHub Copilot 提供代码补全和聊天;Cursor 支持仓库级问答和改写;Devin 定位为异步软件工程 Agent;Sourcegraph Cody 面向代码搜索和解释。国内可关注通义灵码、腾讯云 AI 代码助手等公开产品。
研发场景拆解:
- 代码补全:本地或云端,低风险,指标看采纳率和构建通过率。
- 单测生成:只生成测试文件,不修改业务代码。
- 缺陷定位:只读仓库和日志,输出怀疑文件和复现步骤。
- 依赖升级:生成 PR 草稿,CI 通过后人工合并。
- 不要做:直接推 main、自动改生产配置、无审计执行数据库迁移。
3. ROI 测算模型与失败复盘
ROI 公式: 年净收益 = 节省工时 × 人力成本 + 增量收入 × 毛利率 + 减少差错 × 单次损失 − 模型与云成本 − 工具许可 − 集成与运维 − 人工复核成本 − 合规审计成本。
示例假设,不是真实收益:某客服团队 50 人,人均月成本 1.2 万元;Agent 处理 40% 标准工单,其中 20% 转人工;首年模型与云 18 万元,工具许可 12 万元,集成 30 万元,人工复核 10 万元。计算:
- 团队年人力成本 = 50 × 1.2 × 12 = 720 万元。
- 净自动化率 = 40% × (1 - 20%) = 32%。
- 节省人力 = 720 × 32% = 230.4 万元。
- 首年成本 = 18 + 12 + 30 + 10 = 70 万元。
- 首年净收益 = 230.4 - 70 = 160.4 万元。
- 只做 Demo:没有评测集,上线后无法判断好坏。修复:先建 200 条黄金集。
- 权限过大:Agent 能退款、改价、删数据。修复:写操作全部走人工确认,读操作按租户过滤。
- 数据脏:知识库过期,订单接口字段缺失。修复:上线前跑 100 条历史工单回放。
- 无回滚:重复发券、重复退款。修复:幂等键和补偿事务。
- 成本失控:长对话全量塞 prompt。修复:摘要 + 向量召回 + 预算告警。
- 供应商锁定:工作流无法导出。修复:选支持导出 JSON/YAML 或开源部署的方案。
- 指标错位:只看回答像不像人,不看解决率。修复:业务指标优先。
- 合规缺失:客户数据进公网模型。修复:私有化或专有实例,签数据处理协议。
4. 未来 12 个月落地路线图与选型建议
0-1 月:选一个高频、低风险、数据可拿到的流程。比如客服退款咨询、研报摘要、商品属性补全。建 200 条评测集,人工标注正确答案和工具调用。埋点 trace id、token、延迟、人工接管。
1-3 月:工具接入。读接口先上,写接口只生成草稿。权限按最小化配置,写操作加二次确认。用 MCP 或 OpenAPI 包装内部 API,错误码写全。做 shadow mode:Agent 在后台跑,结果不直接给客户,对比人工处理。
3-6 月:小流量 A/B。分组看解决率、人工接管率、单次成本、P95 延迟。每周复盘失败对话。成本超过预算 80% 告警。达到验收线再放量;达不到就缩场景,不要加功能。
6-12 月:多场景复制。把工具、评测集、权限模板做成内部资产。对比至少两家供应商,保留切换方案。每季度重算 ROI,把人工复核和合规成本算进去。
选型表:
| 方案 | 适合团队 | 部署 | 先验证什么 |
|---|---|---|---|
| Dify | 想快速搭工作流的产品/运营团队 | 开源 + 云版,具体以官方为准 | 工具调用失败恢复、日志导出 |
| Coze/扣子 | 做 Bot、客服、内容工作流 | 云为主 | 数据隔离、发布渠道、费用 |
| LangGraph | 有 Python 工程能力,要精细控制状态 | 自部署 | 状态机回放、断点续跑 |
| AutoGen/CrewAI | 多 Agent 实验、研究型任务 | 自部署 | 多 Agent 是否真比单 Agent 稳 |
| 阿里云百炼/百度千帆/火山方舟/腾讯云大模型知识引擎 | 已有云和合规要求 | 云/专有 | 私有数据是否用于训练、审计日志 |
| GitHub Copilot/Cursor/通义灵码/腾讯云 AI 代码助手 | 研发团队 | SaaS/企业版 | 代码出域、采纳率、CI 成本 |
- 先定场景和验收指标,再看工具。
- 有合规要求,先过数据隔离和审计。
- 工作流要能导出,别把业务逻辑锁在某个 SaaS 里。
- 工具调用必须能回放,否则故障无法定位。
- 先买小规模,跑 4 周 POC,验收不过就换。
下一步:今天选一个流程,填 20 行案例登记表。检查项只有一个:每一次工具调用能否用 trace id 还原输入、输出、权限、成本、人工确认人。做不到,就先别上产线。