2026 中国 AI Agent 落地地图:从聊天框到数字员工
2026 年企业采购 AI Agent,真正要回答的是:它能不能在权限内把一件事办完。聊天框回答错了,用户会再问;数字员工改错订单、发错邮件、查了不该查的数据,就是生产事故。落地顺序应该按任务风险和数据边界排,不按模型榜单排。
Agent 成熟度模型:先确认你在哪一级
| 等级 | 名称 | 典型能力 | 常见产品形态 | 主要风险 |
|---|---|---|---|---|
| L0 | 聊天问答 | 通用对话、简单改写 | 网页/IM 机器人 | 幻觉、不可追溯 |
| L1 | 知识库问答 | RAG、引用来源 | 内部知识助手 | 检索不到、权限穿透 |
| L2 | 单工具调用 | 查订单、查天气、发消息 | 插件/Bot | 鉴权、参数错 |
| L3 | 多步工作流 | 多工具串行、条件分支 | Dify/扣子/百炼工作流 | 中途失败、成本失控 |
| L4 | 长时任务+审批 | 记忆、定时、人工确认 | 办公助理、客服 Agent | 越权、审计缺口 |
| L5 | 数字员工 | 多 Agent 协作、SLA、审计 | 专属云/私有化平台 | 组织与责任边界 |
判断方法很简单:把最近 20 个真实任务交给候选 Agent,记录需要人工补几步、有没有越权、单任务花多少钱。L2 都做不到,先别谈数字员工。
科技媒体和开发者社区在聊什么
媒体侧的高频选题集中在办公、客服、金融、电商。钉钉 AI 助理、飞书智能伙伴、企业微信里的智能助手方案,常被拿来演示“在 IM 里派任务”。银行、券商、保险的选题更保守,重点是合规、私有化和审计。电商媒体更关心导购、售后、客服降本和素材生成。
开发者社区的关键词更偏工程:MCP、Dify、扣子、LangGraph、AutoGen、CrewAI、LlamaIndex、vLLM。MCP 是 Anthropic 在 2024 年 11 月开源的协议,用 JSON-RPC 把模型和外部工具、数据源连起来。它本身不收费,但每个 MCP Server 的权限要单独管。Dify 社区版可自托管,云版按套餐;扣子国内版有免费额度,插件、工作流、知识库、数据库都有;阿里云百炼、百度千帆、腾讯云 LKE、火山方舟提供模型 API、应用编排和知识库,具体价格与配额看当期官网。
这些工具的共同限制:工作流能画出流程,不代表线上稳定;能接 API,不代表有权限治理;能跑 Demo,不代表成本可接受。
金融:先把数据边界和审计写进合同
金融 Agent 的入口通常是内部知识库、客服、信贷资料初审、理赔资料收集、反欺诈辅助。可调用系统包括核心业务系统、工单、OCR、风控规则、CRM。红线是数据不出域、模型备案、生成内容留痕、投顾类输出不能直接给客户。
| 任务 | 可用 Agent 做什么 | 必须人工做什么 | 验收指标 |
|---|---|---|---|
| 内部制度问答 | 检索制度、给出条款引用 | 判断适用版本 | 引用准确率、无权限穿透 |
| 客服工单分类 | 分类、摘要、填字段 | 高风险投诉升级 | 分类准确率、升级召回率 |
| 资料初审 | OCR、缺件提醒、规则校验 | 最终授信判断 | 漏检率、误拒率 |
| 反欺诈辅助 | 关联交易摘要、可疑点提示 | 立案与处置 | 可解释记录、审计完整率 |
电商:高频、低客单、强并发,先算单任务成本
电商 Agent 常见在导购、客服、售后、素材生成。工具调用包括商品库、订单、物流、优惠券、退款、CRM。电商流量峰谷明显,Agent 要能限流、降级、切人工。
| 环节 | 适合自动 | 转人工条件 | 常见坑 |
|---|---|---|---|
| 商品咨询 | 参数对比、库存查询 | 价格谈判、投诉 | 编造优惠 |
| 订单查询 | 查物流、改地址草稿 | 已发货改地址 | 直接承诺时效 |
| 退换货 | 判断规则、生成工单 | 超金额、超时效 | 错用规则 |
| 售后跟进 | 催件、补发提醒 | 情绪激烈 | 重复打扰 |
办公:文档权限比模型能力更容易翻车
办公 Agent 在飞书、钉钉、企业微信、OA、日历、邮件、文档之间跑。典型任务:会议纪要、日报、合同审查、报销、差旅、HR 问答。风险在文档权限。员工能问,不代表 Agent 能读;Agent 能读,不代表能转发到外部群。
- 文档权限继承原系统,不单独维护一套白名单。
- 外发、删除、付款、合同用印类动作必须二次确认。
- 保留“谁在何时让 Agent 调了什么工具”的审计日志。
- 对全员开放的 Agent 设置每日 token 和调用次数上限。
客服:从回复草稿开始,别一上来就自动退款
客服 Agent 最容易做出效果,也最容易出错。稳妥路径:先做知识库检索和回复草稿,再做工单分类,再做订单查询,最后才开放退款、改地址、补发这类写操作。
| 阶段 | 动作 | 权限 | 指标 |
|---|---|---|---|
| 1 | 回复草稿 | 只读知识库 | 采纳率、修改率 |
| 2 | 工单分类 | 读写工单字段 | 分类准确率 |
| 3 | 订单物流查询 | 只读订单 | 查询成功率 |
| 4 | 自动退款/补发 | 写操作+阈值审批 | 错退率、客诉率 |
四个卡点:工具调用、评测、权限、成本
工具调用 API 鉴权、限流、字段变更、网络超时都会让多步任务失败。工具描述要写清输入输出,参数用 JSON Schema 约束,写操作加幂等键,长流程加检查点。做错会怎样:Agent 以为退款成功,实际接口失败,用户重复投诉。
评测 不要只用公开榜单。从历史工单抽 100 到 300 条,标出标准答案、不可接受回复、应转人工。离线看准确率、越权率、平均步数;上线看人工接管率、首次解决率、P95 延迟、单任务成本。没有评测集,调 Prompt 就是盲调。
权限 最小权限、RBAC、字段级/行级控制、审批、审计、脱敏、数据不出域。MCP Server 和插件最容易权限过大,一个文件系统 Server 可能让模型读到整个目录。先沙箱,再放行。
成本 模型 token、工具 API、向量库、GPU、带宽、人工复核都要算。优化顺序:小模型路由、缓存高频问答、压缩上下文、限制最大步数、批量处理非实时任务。单任务成本超过人工成本的一半,就要重新设计场景。
企业选型清单
- 任务边界:替代哪个岗位的哪段流程,输入输出是什么。
- 数据位置:公有云、专属云、私有化,能否出域。
- 工具清单:需要调哪些系统,有无 API、沙箱、测试账号。
- 权限模型:谁可读、谁可写、金额阈值、审批人、审计导出。
- 评测集:至少 100 条真实任务,含不可接受回复。
- 成本模型:单任务 token、工具费、GPU、人工复核。
- 供应商:模型备案、SLA、数据删除、日志导出、私有化版本。
- 试点周期:4 到 6 周,高频低风险场景,指标不达标就停。
- 退出方案:Agent 停用后,人工流程能否接回。
下一步:拿最近 30 天客服工单,抽 50 条,按“可自动、需草稿、必须人工”三栏分类。分完再决定要不要买 Agent,比先选模型有用。