AI Agent生产可用性报告:演示、POC与规模化之间的三道坎
演示环境里,Agent 调三个 API 就能回答。接上真实工单后,常见故障出在架构、工具/记忆/评测、权限成本这三块。三道坎多数来自工程约束,模型能力只是变量之一。
一、Agentic Workflow与多智能体架构:先定边界,再选拓扑
2026 年新项目选型时,OpenAI 已公告 Assistants API 进入弃用周期,官方迁移指南标注 2026-08-26 停用,建议迁移到 Responses API。这个变化会影响 POC:别把状态、文件、工具调用绑在旧 API 上。
Agentic Workflow 的做法:把确定性步骤交给代码,把不确定判断交给模型。比如客服工单:先规则分类,无法判断再给 LLM 路由;查订单走固定工具;退款金额超过阈值走审批;回复生成才用大模型。
| 拓扑 | 适用场景 | 常见问题 |
|---|---|---|
| 单 Agent + 工具 | 工具少于 10 个、流程短 | 工具一多,选错率上升 |
| Router-Worker | 按意图分派到不同处理链 | 路由错误会放大下游成本 |
| Supervisor | 多个专家 Agent 协作 | 转派循环、延迟叠加 |
| 多 Agent 并行 | 检索、分析、写作可拆开 | 消息协议和状态合并难调 |
工具选型上:LangGraph 用 StateGraph 定义节点和边,checkpoint 可做短期记忆;AutoGen 0.4 起拆成 core、agentchat、extensions;CrewAI 适合角色分工原型;Semantic Kernel 适合 .NET、Python、Java 企业集成。不要为了多 Agent 而多 Agent,先把单 Agent 工作流跑稳。
二、工具调用、记忆与评测:把“能说”变成“能做对”
工具调用按这几步做:
- 每个工具用 JSON Schema 定义参数,服务端二次校验。
- 写操作必须带幂等键。退款、发券、改地址没有幂等键,重试会出事故。
- 设置超时、重试、断路器。重试只对幂等读操作默认打开。
- 工具返回结构化错误:code、message、retryable、user_visible。LLM 读 code 比读堆栈可靠。
- 代码执行、浏览器、shell 放沙箱,限制网络和文件。
评测做成三层:离线回放、在线 A/B、人工抽检。指标至少覆盖:
| 指标 | 说明 |
|---|---|
| 任务成功率 | 端到端完成且结果可接受 |
| 工具调用正确率 | 工具名、参数、顺序正确 |
| 参数错误率 | Schema 校验失败比例 |
| P95 延迟 | 用户可感知的慢请求 |
| 单任务成本 | 含模型、工具、存储、人工接管 |
| 升级人工率 | Agent 主动或被动转人工 |
| 越权拦截率 | 被策略引擎挡下的高风险动作 |
三、权限、安全与成本治理:上线前必须能刹车
权限控制:
- 用 OAuth2 scopes 或云 IAM,工具白名单,租户隔离,最小权限。
- 策略引擎用 OPA、Cedar、OpenFGA、SpiceDB。策略放代码外,别写死在提示词。
- 高风险动作人工审批:退款、转账、删数据、发外部邮件、改权限。
成本治理:
- 预算硬上限,按 run、tenant、agent、tool 打标。
- 模型路由:分类和抽取用小模型,规划和复杂回复用大模型。
- 缓存:系统提示、工具说明、RAG 片段可缓存。OpenAI API 按 token 计费,cached input 有折扣,具体价格看官网。Azure OpenAI 可按 PTU 预留,适合稳定吞吐。
- 上下文裁剪、批处理、重试上限。
| 治理项 | 动作 | 上线门槛 |
|---|---|---|
| 租户隔离 | 每次调用带 tenant_id | 跨租户测试通过 |
| 高风险动作 | 人工审批或双人复核 | 无审批不能执行 |
| 预算 | 单 run 和单租户硬上限 | 超额自动停 |
| 审计 | 工具调用全量日志 | 可查 180 天 |
| 回滚 | feature flag 和人工接管 | 5 分钟内切回 |
四、企业落地案例:Klarna 客服数据带来的三道坎
Klarna 在 2024-02-06 官方新闻稿公布:AI assistant 上线首月处理 230 万次对话,占客服对话三分之二,相当于 700 名全职坐席,平均解决时间从 11 分钟降到 2 分钟,预计 2024 年利润改善 4000 万美元。来源:https://www.klarna.com/international/press/klarna-ai-assistant-handles-two-thirds-of-customer-service-chats-in-its-first-month/ 。这是 2024 年数据,2026 年现状可能变化。
映射到三道坎:
- 架构坎:客服流程要拆意图识别、订单查询、退款、升级人工。不能让一个 Agent 从识别到退款全做。
- 工具/记忆/评测坎:订单状态要实时查,退款工具要权限,满意度要抽样。
- 权限成本坎:退款金额限制、人工审批、按租户预算。
五、选型清单:从 POC 到规模化的检查表
| 选项 | 适合 | 注意 |
|---|---|---|
| LangGraph | 可控工作流、checkpoint、生产团队 | 需要写状态和边 |
| AutoGen | 多 Agent 研究、代码生成 | 0.4 起 core/agentchat/extensions,版本变动快 |
| CrewAI | 角色分工快速原型 | 抽象高,复杂控制要下探 |
| Semantic Kernel | .NET、Python、Java 企业集成 | 插件和规划器随微软生态 |
| OpenAI Responses API | 快速接工具、文件搜索、代码解释器 | 托管方便,注意 Assistants 2026-08-26 停用,价格按 token |
- 任务成功率、P95 延迟、单任务成本有定义
- 每个工具 JSON Schema、幂等键、超时、错误码
- 离线评测集覆盖正常、边界、恶意
- 租户隔离、最小权限、高风险审批
- 预算硬上限、按 run 打标
- 人工接管和回滚开关
- 审计日志可查
- 模型、提示词、工具版本可回滚
下一步:选一个低风险读操作工具,比如查订单状态,写 20 条评测用例,跑一周,记录 P95 延迟、单任务成本和工具调用正确率。达不到阈值就留在 POC,别进生产。