演示视频里的 Agent 能自己订机票、自己改代码、自己发报告。真上生产时卡住的往往是另一类问题:给它哪个账号、它能花多少钱、出错的时候谁按停。
1. 个人 Agent 和企业级 Agent 差在哪几个字段
个人 Agent 的验收标准是任务完成了。企业级 Agent 的验收标准多三条:能被审计、能被中断、能被复现。
同一套模型,差别全在边上这些设施:
| 维度 | 个人 Agent | 企业级 Agent |
|---|---|---|
| 身份 | 本人的 OAuth token | 工作负载身份 + 服务账号,代表某个员工或某个系统做事 |
| 权限 | 你有的它都有 | 工具白名单 + 参数级限制,例如只能查订单不能退款 |
| 成本 | 月底看账单 | 单次任务预算上限,超限熔断 |
| 失败处理 | 重试或重来 | 幂等键、补偿操作、人工接管队列 |
| 日志 | 聊天记录 | 每次 run 的轨迹、prompt 版本、模型版本、工具版本 |
| 评测 | 手感 | 固定回归集 + 线上抽样人工复核 |
| 变更 | 直接改 prompt | prompt 与工具 schema 走版本发布,可回滚 |
企业级 Agent 的每一次运行大概走这样一条链路:
权限校验在工具调用的前面,不是后面。放在后面意味着请求已经发出去了,你只能事后补救。
2. MCP、A2A、工具、记忆、评测各管一段
这一层最容易混的是 MCP 和 A2A 的位置。它们不竞争,管的是两件不同的事。
MCP(Model Context Protocol) 管 Agent 怎么连工具和数据。Anthropic 在 2024 年 11 月开源,基于 JSON-RPC 2.0,server 侧暴露 tools、resources、prompts,client 侧提供 sampling、roots、elicitation。本地进程用 stdio,远程服务用 Streamable HTTP(2025 年 3 月的规范修订用 Streamable HTTP 取代了早期的 HTTP+SSE 组合)。我在本机接内部脚本时倾向用 stdio,远程共享服务用 Streamable HTTP,理由是本地调试不用额外起一个 HTTP 服务。
A2A(Agent2Agent) 管 Agent 怎么调另一个 Agent。Google 在 2025 年 4 月发布,后进入 Linux Foundation 治理体系。核心是 Agent Card(/.well-known/agent-card.json)加 Task、Message、Artifact 模型。它解决的是跨团队、跨组织时怎么描述能力、怎么交任务、怎么回结果。
工具调用本身 是模型侧能力,function calling 和结构化输出负责把自然语言变成合法参数,MCP 只是其中一种标准化接法。市面上常见的一个判断错误是:以为接了 A2A 就有了多智能体能力。多智能体的难点在任务边界怎么切、失败怎么传,不在通信协议。
记忆 分两层。会话内是上下文窗口加摘要加检查点,跨会话靠外部存储,Mem0、Letta(前身 MemGPT)、Zep 这类服务,或者自建向量库与图存储。企业场景的难点不在检索效果,在写入权限、读取范围和过期策略:员工 A 的偏好记录不能出现在员工 B 的会话里,这是权限问题,不是相似度阈值问题。
评测 同样分两层。结果评测用任务集跑分,公开榜单可参考 SWE-bench Verified(代码修复)、τ-bench(多轮工具调用,出自 Sierra)、GAIA(通用助手)、WebArena 与 OSWorld(网页与桌面操作)。榜单分数别直接当自己的预期,工具集和数据分布不一样。轨迹评测看的是过程:有没有越权调用、有没有重复调用同一个工具、有没有跳过校验直接执行。回归集可以从线上成功和失败的 run 里各抽 50 条固定下来,改一次 prompt 或工具 schema 就跑一遍。
还有一条容易被忽略:记录模型快照版本。API 上的模型别名会更新,行为也会跟着变,回归集通过率突然下降时,第一个要查的就是这个。
3. 四类场景:哪些真跑通了
判断一个场景能不能上 Agent,我用三个问题:结果能不能自动判定,错了能不能撤销,有没有稳定的数字反馈。
| 场景 | 结果可判定性 | 错误可撤销性 | 成熟度 | 主要指标 | 典型失败 |
|---|---|---|---|---|---|
| 客服 | 高,工单解决或未解决 | 中,承诺类不可撤 | 高 | 一次解决率、升级人工比例、单次处理成本 | 越权承诺赔偿、答非所问 |
| 研发 | 高,CI 是否通过、PR 是否合并 | 高,PR 可以关 | 高 | 合并的 PR 数、评审返工次数、CI 首轮通过率 | 测试改对了但语义改错、大范围重写 |
| 数据分析 | 中,口径存在歧义 | 高 | 中 | SQL 正确率、查询被复用次数、从提问到拿到数的时间 | 口径错、JOIN 爆炸、答案看起来对 |
| 营销 | 低,效果延迟且归因难 | 中,内容已发布 | 中低 | 素材迭代速度、审核通过率、合规拦截率 | 品牌口吻漂移、夸大表述 |
客服:先把 Agent 放在只读加起草回复的位置,草稿进人工审核队列,跑两周。审核时人手改动的差异,就是后面要用的评测集和优化材料。不要一上来就给它退款权限。
研发:从 CI 失败修复、依赖升级这类边界清楚的任务开始。让 Agent 开 PR,但不给直接推 main 的权限。代码场景的优势是验证信号明确,CI 会告诉你对不对。
数据分析:先补语义层,把指标定义写进工具能读到的地方,比如 dbt metrics、Cube、LookML。没有语义层的 text-to-SQL 大概率在口径上翻车,而且翻得很安静,结果看着是对的。
营销:审核门放在发布前,规则里先写死那几条,比如违禁词、价格表述、竞品提及。营销场景的问题不是产不出内容,是产得太多没人审。
三类看起来可行、实际上还没跑通的场景:跨系统的长流程审批(采购、报销),链路长、异常分支多、每个系统的权限模型都不一样;承担法律后果的动作(签约、付款、对外承诺),可以做到准备材料并提请审批,最后一步留给人;没有数字反馈的创意决策,缺少稳定信号,Agent 无法自我改进,只能加速产出,加速产出在方向错的时候是负收益。
4. 成本、权限、可观测性、ROI 怎么算
成本结构比模型账单复杂:
| 成本项 | 说明 | 能压的地方 |
|---|---|---|
| 模型 token | 输入通常是大头,系统提示和工具 schema 每次都要发 | 缓存计费档、精简工具 schema、控制历史长度 |
| 工具调用 | 外部 API 附带的费用、数据库查询成本 | 限制重试次数、加结果缓存 |
| 检索 | 向量库存储与查询 | 分层检索,先关键词后向量 |
| 评测与人工 | 回归集运行、审核队列的人力 | 把人工集中在失败样本上 |
| 失败代价 | 重试、幂等补偿、错误动作的修复 | 幂等键、金额与次数上限 |
| 变更 | 改 prompt 或工具后的回归测试 | 版本化,小步发 |
权限这块,几条实操经验:Agent 的身份要能追溯到代表谁,代表员工 A 发起的申请,审批链上要显示 A;最小权限按参数级配,能查订单不等于能退款;写操作加幂等键,金额、次数、时间窗都设上限;高风险动作走双人复核,其中一人不能是发起者;审计日志记全,谁发起、调了什么工具、参数是什么、模型和 prompt 是哪个版本、返回了什么。
可观测性的 trace 粒度是 run 到 step 再到 tool call。缺任何一层,出事只能靠猜。OpenTelemetry 有 GenAI 语义约定,不少 Agent SDK 直接吐 OTLP,接 Langfuse、Arize Phoenix、LangSmith 这类后端都行。
ROI 别用节省工时乘人数来算,这个算法会漏掉审核成本,也会高估自动化率。更接近实际的写法是:
- 产出侧 = 自动完成且未返工的任务数 × 单次人工成本
- 成本侧 = 模型与工具费用 + 审核人力 + 评测与维护 + 失败造成的损失
上线前过一遍:
- 每个工具标了读、写、高风险
- 高风险工具有幂等键和金额次数上限
- 有固定回归集,每次变更都跑
- 有 run 级轨迹日志和模型版本记录
- 有一个人工接管入口,能在一分钟内停掉 Agent
- ROI 公式里包含审核人力
5. 未来 12 个月:谁在做哪一层
下面这些是判断,不是事实,读者按自己行业核对。
模型厂商在往下走。OpenAI、Anthropic、Google 都在提供 runtime、内置工具、Agent SDK 和工具目录。它们拿走的是默认编排层,这会让只做基础编排的产品很难单独收费。
云厂商在卖治理。AWS、Azure、Google Cloud 的 Agent 托管服务,卖点集中在身份、网络隔离、审计、配额。企业真正卡住的确实就是这些,所以这块有付费意愿。
中间的编排框架会被挤压。LangGraph、CrewAI、2025 年由 AutoGen 与 Semantic Kernel 合并而来的 Microsoft Agent Framework 都在这一层。它们不会被淘汰,但会被要求能被大厂 runtime 托管。
垂直应用层还有空间。客服、编码、销售各有自己的数据格式和验收标准,通用 runtime 吃不到。按结果计费的模式在客服先跑起来,因为它有明确的可判定信号。
协议层面,MCP 在工具接入上的位置已经比较稳,接下来的竞争在企业内的注册中心、权限映射和版本治理,不在协议本身。A2A 这类 Agent 间协议更常出现在跨团队和跨组织场景,前提是双方有身份互认机制。
监管节奏会变成硬约束。EU AI Act 对高风险系统的义务在 2026 年 8 月适用,部署在高风险场景的团队需要把日志、人工监督、风险评估做进流程,而不是上线后补。具体条款以官方文本为准。
一个能立刻做的检查:问你的供应商,Agent 用的工具凭据存在哪、能不能按用户粒度撤销。答不上来的,先别签。
视频检索建议:本文不附具体视频链接,因为第三方转载和链接失效会让出处变得不可核验。可以在 B 站、腾讯视频、优酷、抖音检索「Model Context Protocol 规范」「Agent2Agent Agent Card」「OpenTelemetry GenAI 语义约定」这些关键词,优先看官方账号发布的内容,注意发布时间和是否标注协议版本号。第三方解读可能停留在旧版规范上。免责声明:视频内容由各平台与创作者维护,本站不保证其准确性与时效性,技术细节请以官方文档为准。
下一步:挑一个只读工具,用 MCP 接进来,跑一周,把每次调用的轨迹记下来。看完这一周的数据,再决定要不要给它写权限。