2026 AI Agent 落地全景:从 MCP 到多智能体,哪些场景真正跑通?

行业分析AI AgentMCPA2A多智能体企业级AIROI2026-09-25

演示视频里的 Agent 能自己订机票、自己改代码、自己发报告。真上生产时卡住的往往是另一类问题:给它哪个账号、它能花多少钱、出错的时候谁按停。

1. 个人 Agent 和企业级 Agent 差在哪几个字段

个人 Agent 的验收标准是任务完成了。企业级 Agent 的验收标准多三条:能被审计、能被中断、能被复现。

同一套模型,差别全在边上这些设施:

维度个人 Agent企业级 Agent
身份本人的 OAuth token工作负载身份 + 服务账号,代表某个员工或某个系统做事
权限你有的它都有工具白名单 + 参数级限制,例如只能查订单不能退款
成本月底看账单单次任务预算上限,超限熔断
失败处理重试或重来幂等键、补偿操作、人工接管队列
日志聊天记录每次 run 的轨迹、prompt 版本、模型版本、工具版本
评测手感固定回归集 + 线上抽样人工复核
变更直接改 promptprompt 与工具 schema 走版本发布,可回滚
一个具体动作:把你准备交给 Agent 的工具全列出来,逐个标上读、写、付款、对外发言。写和付款这两栏先别给。

企业级 Agent 的每一次运行大概走这样一条链路:

flowchart LR A[请求进入] --> B[规划与任务分解] B --> C[判断是否需要工具] C -->|否| D[生成回答] C -->|是| E[身份与权限校验] E --> F[工具调用 MCP 或 HTTP API] F --> G[结果校验与重试] G --> H[高风险动作判定] H -->|是| I[人工审批队列] H -->|否| J[执行并写审计日志] I --> J J --> D

权限校验在工具调用的前面,不是后面。放在后面意味着请求已经发出去了,你只能事后补救。

2. MCP、A2A、工具、记忆、评测各管一段

这一层最容易混的是 MCP 和 A2A 的位置。它们不竞争,管的是两件不同的事。

MCP(Model Context Protocol) 管 Agent 怎么连工具和数据。Anthropic 在 2024 年 11 月开源,基于 JSON-RPC 2.0,server 侧暴露 tools、resources、prompts,client 侧提供 sampling、roots、elicitation。本地进程用 stdio,远程服务用 Streamable HTTP(2025 年 3 月的规范修订用 Streamable HTTP 取代了早期的 HTTP+SSE 组合)。我在本机接内部脚本时倾向用 stdio,远程共享服务用 Streamable HTTP,理由是本地调试不用额外起一个 HTTP 服务。

A2A(Agent2Agent) 管 Agent 怎么调另一个 Agent。Google 在 2025 年 4 月发布,后进入 Linux Foundation 治理体系。核心是 Agent Card(/.well-known/agent-card.json)加 Task、Message、Artifact 模型。它解决的是跨团队、跨组织时怎么描述能力、怎么交任务、怎么回结果。

工具调用本身 是模型侧能力,function calling 和结构化输出负责把自然语言变成合法参数,MCP 只是其中一种标准化接法。市面上常见的一个判断错误是:以为接了 A2A 就有了多智能体能力。多智能体的难点在任务边界怎么切、失败怎么传,不在通信协议。

记忆 分两层。会话内是上下文窗口加摘要加检查点,跨会话靠外部存储,Mem0、Letta(前身 MemGPT)、Zep 这类服务,或者自建向量库与图存储。企业场景的难点不在检索效果,在写入权限、读取范围和过期策略:员工 A 的偏好记录不能出现在员工 B 的会话里,这是权限问题,不是相似度阈值问题。

评测 同样分两层。结果评测用任务集跑分,公开榜单可参考 SWE-bench Verified(代码修复)、τ-bench(多轮工具调用,出自 Sierra)、GAIA(通用助手)、WebArena 与 OSWorld(网页与桌面操作)。榜单分数别直接当自己的预期,工具集和数据分布不一样。轨迹评测看的是过程:有没有越权调用、有没有重复调用同一个工具、有没有跳过校验直接执行。回归集可以从线上成功和失败的 run 里各抽 50 条固定下来,改一次 prompt 或工具 schema 就跑一遍。

还有一条容易被忽略:记录模型快照版本。API 上的模型别名会更新,行为也会跟着变,回归集通过率突然下降时,第一个要查的就是这个。

3. 四类场景:哪些真跑通了

判断一个场景能不能上 Agent,我用三个问题:结果能不能自动判定,错了能不能撤销,有没有稳定的数字反馈。

场景结果可判定性错误可撤销性成熟度主要指标典型失败
客服高,工单解决或未解决中,承诺类不可撤高一次解决率、升级人工比例、单次处理成本越权承诺赔偿、答非所问
研发高,CI 是否通过、PR 是否合并高,PR 可以关高合并的 PR 数、评审返工次数、CI 首轮通过率测试改对了但语义改错、大范围重写
数据分析中,口径存在歧义高中SQL 正确率、查询被复用次数、从提问到拿到数的时间口径错、JOIN 爆炸、答案看起来对
营销低,效果延迟且归因难中,内容已发布中低素材迭代速度、审核通过率、合规拦截率品牌口吻漂移、夸大表述
每个场景给一个可落地的入口。

客服:先把 Agent 放在只读加起草回复的位置,草稿进人工审核队列,跑两周。审核时人手改动的差异,就是后面要用的评测集和优化材料。不要一上来就给它退款权限。

研发:从 CI 失败修复、依赖升级这类边界清楚的任务开始。让 Agent 开 PR,但不给直接推 main 的权限。代码场景的优势是验证信号明确,CI 会告诉你对不对。

数据分析:先补语义层,把指标定义写进工具能读到的地方,比如 dbt metrics、Cube、LookML。没有语义层的 text-to-SQL 大概率在口径上翻车,而且翻得很安静,结果看着是对的。

营销:审核门放在发布前,规则里先写死那几条,比如违禁词、价格表述、竞品提及。营销场景的问题不是产不出内容,是产得太多没人审。

三类看起来可行、实际上还没跑通的场景:跨系统的长流程审批(采购、报销),链路长、异常分支多、每个系统的权限模型都不一样;承担法律后果的动作(签约、付款、对外承诺),可以做到准备材料并提请审批,最后一步留给人;没有数字反馈的创意决策,缺少稳定信号,Agent 无法自我改进,只能加速产出,加速产出在方向错的时候是负收益。

4. 成本、权限、可观测性、ROI 怎么算

成本结构比模型账单复杂:

成本项说明能压的地方
模型 token输入通常是大头,系统提示和工具 schema 每次都要发缓存计费档、精简工具 schema、控制历史长度
工具调用外部 API 附带的费用、数据库查询成本限制重试次数、加结果缓存
检索向量库存储与查询分层检索,先关键词后向量
评测与人工回归集运行、审核队列的人力把人工集中在失败样本上
失败代价重试、幂等补偿、错误动作的修复幂等键、金额与次数上限
变更改 prompt 或工具后的回归测试版本化,小步发
批处理接口一般有折扣,适合离线评测和批量任务,交互场景用不上。

权限这块,几条实操经验:Agent 的身份要能追溯到代表谁,代表员工 A 发起的申请,审批链上要显示 A;最小权限按参数级配,能查订单不等于能退款;写操作加幂等键,金额、次数、时间窗都设上限;高风险动作走双人复核,其中一人不能是发起者;审计日志记全,谁发起、调了什么工具、参数是什么、模型和 prompt 是哪个版本、返回了什么。

可观测性的 trace 粒度是 run 到 step 再到 tool call。缺任何一层,出事只能靠猜。OpenTelemetry 有 GenAI 语义约定,不少 Agent SDK 直接吐 OTLP,接 Langfuse、Arize Phoenix、LangSmith 这类后端都行。

ROI 别用节省工时乘人数来算,这个算法会漏掉审核成本,也会高估自动化率。更接近实际的写法是:

  • 产出侧 = 自动完成且未返工的任务数 × 单次人工成本
  • 成本侧 = 模型与工具费用 + 审核人力 + 评测与维护 + 失败造成的损失
只有产出侧减成本侧为正,并且连续两个月为正,才值得扩大范围。第一次上线时审核成本经常比省下的人工还高,这正常,但要知道它在往哪个方向走。

上线前过一遍:

  • 每个工具标了读、写、高风险
  • 高风险工具有幂等键和金额次数上限
  • 有固定回归集,每次变更都跑
  • 有 run 级轨迹日志和模型版本记录
  • 有一个人工接管入口,能在一分钟内停掉 Agent
  • ROI 公式里包含审核人力

5. 未来 12 个月:谁在做哪一层

下面这些是判断,不是事实,读者按自己行业核对。

模型厂商在往下走。OpenAI、Anthropic、Google 都在提供 runtime、内置工具、Agent SDK 和工具目录。它们拿走的是默认编排层,这会让只做基础编排的产品很难单独收费。

云厂商在卖治理。AWS、Azure、Google Cloud 的 Agent 托管服务,卖点集中在身份、网络隔离、审计、配额。企业真正卡住的确实就是这些,所以这块有付费意愿。

中间的编排框架会被挤压。LangGraph、CrewAI、2025 年由 AutoGen 与 Semantic Kernel 合并而来的 Microsoft Agent Framework 都在这一层。它们不会被淘汰,但会被要求能被大厂 runtime 托管。

垂直应用层还有空间。客服、编码、销售各有自己的数据格式和验收标准,通用 runtime 吃不到。按结果计费的模式在客服先跑起来,因为它有明确的可判定信号。

协议层面,MCP 在工具接入上的位置已经比较稳,接下来的竞争在企业内的注册中心、权限映射和版本治理,不在协议本身。A2A 这类 Agent 间协议更常出现在跨团队和跨组织场景,前提是双方有身份互认机制。

监管节奏会变成硬约束。EU AI Act 对高风险系统的义务在 2026 年 8 月适用,部署在高风险场景的团队需要把日志、人工监督、风险评估做进流程,而不是上线后补。具体条款以官方文本为准。

一个能立刻做的检查:问你的供应商,Agent 用的工具凭据存在哪、能不能按用户粒度撤销。答不上来的,先别签。

视频检索建议:本文不附具体视频链接,因为第三方转载和链接失效会让出处变得不可核验。可以在 B 站、腾讯视频、优酷、抖音检索「Model Context Protocol 规范」「Agent2Agent Agent Card」「OpenTelemetry GenAI 语义约定」这些关键词,优先看官方账号发布的内容,注意发布时间和是否标注协议版本号。第三方解读可能停留在旧版规范上。免责声明:视频内容由各平台与创作者维护,本站不保证其准确性与时效性,技术细节请以官方文档为准。

下一步:挑一个只读工具,用 MCP 接进来,跑一周,把每次调用的轨迹记下来。看完这一周的数据,再决定要不要给它写权限。

PREMIUM

需要完整版教程?

包含详细步骤、视频演示、提示词模板和可下载资料包。微信支付即时获取。

购买完整版 ¥29.90