1. 2026 为什么成了分水岭
Agent 不是 2026 年才有的东西。2023 年就有人拿 AutoGPT 跑任务,2024 年各家都在做演示视频。变化发生在 2025 年下半年到 2026 年这段时间,三件事凑到了一起。
工具接入的成本降下来了。 MCP(Model Context Protocol)在 2024 年 11 月由 Anthropic 开源,2025 年 OpenAI、Google、微软陆续在自家产品里支持。以前接一个内部 CRM 或工单系统,要给每个客户端写一套适配;现在写一个 MCP server,多个客户端复用。省掉的是重复适配的活。
模型调工具的稳定性上了一个台阶。 2025 年发布的 Claude Sonnet 4.5、GPT-5、Gemini 2.5 系列,在 function calling 和长上下文检索上的失败率,比 2024 年的模型明显低。以前得在 prompt 里反复写“你必须先调用工具”,现在多数场景不用这么拧。
计价方式开始适配 Agent。 Agent 跑一次任务要十几轮,system prompt 和工具 schema 反复读,按常规 token 计价会很贵。prompt caching 和 batch API 把这块压下来了:Anthropic 的缓存读取按 0.1 倍计价(写入 1.25 倍),OpenAI 的 Batch API 按 50% 计价。
三件事叠加后,2026 年评估 Agent 的问题从“这东西能不能做”变成了“单次任务花多少钱、多久回本”。
2. Demo 能跑、上线就崩,差在哪
演示时有人兜底。模型答错了,操作者补一句、点重试、挑好看的例子。上线后这些全没了。
差距集中在三处:
- 没有回归集。 改一版 prompt,没人知道是变好还是变坏,只能凭感觉。
- 没处理失败路径。 工具超时、返回格式变了、外部 API 限流,演示时碰不到,生产环境天天有。
- 没有成本上限。 演示跑一次花几块钱无所谓,一天几千次就是另一个数量级。
3. 哪些任务该先给 Agent,哪些先别碰
判断标准四条:
- 完成判据能写出来。“把工单归到 8 个标签之一”可以,“帮我处理下客户问题”不行。
- 输入输出有结构。字段、枚举、格式,能机器校验。
- 错误可回滚,或者有强制人工复核点。
- 高频重复。一天做三次的活,做自动化不划算。
| 场景 | 触发方式 | 为什么能上 | 主要风险 |
|---|---|---|---|
| 客服工单分类 + 初稿 | 工单创建 | 有历史标签当标准答案 | 对客户乱承诺 |
| 差评归因 | 定时批处理 | 输出是结构化标签 | 反讽识别错 |
| 招标/财报要点提取 | 文件上传 | 有原文可溯源核对 | 漏掉关键条款 |
| 数据对账异常初筛 | 日终批处理 | 规则 + 查询,可复核 | 误标记正常数据 |
| 代码库问答 | 开发者提问 | 有测试和编译器兜底 | 内部代码泄漏 |
| 销售线索清洗补全 | 定时 | 字段级校验 | 数据合规 |
4. 工具调用:暴露几个、粒度多粗
一条原则:一个工具做一件事。
反面案例是给 Agent 一个 execute_sql,让它自由查库。这等于把数据库权限整个交出去,模型写错了你也定位不到是哪一步错的。
具体做法:
- 工具描述里写清“什么时候不要用这个工具”,比只写“这个工具干什么”更管用。
- 返回结构固定,带
status和error_code,别让模型去解析一段自然语言报错。 - 写操作必须带幂等键。Agent 重试是常态,重试一次就重复下单是真事故。
- 工具数量超过 15 到 20 个,考虑按任务分组,或者加一层路由先用小模型挑工具集。
5. 记忆:三层分开存
把“记忆”当成一个东西是常见误解,实际上分三层:
| 层 | 存什么 | 常见实现 | 存放位置 |
|---|---|---|---|
| 会话内 | 当前对话 | 上下文窗口 | 模型上下文 |
| 跨会话 | 用户偏好、历史任务结论 | Mem0、Zep、Letta | 向量库 + KV |
| 知识层 | 产品文档、规则、政策 | RAG | 向量库/检索服务 |
6. 评估:没有标准答案怎么打分
分两类任务处理。
有标准答案的(分类、抽取、格式转换):字段级比对,算准确率、召回率、F1。这类最好做,先把这类跑通。
没有标准答案的(写回复、做总结、给建议):用 LLM-as-judge,让另一个模型按维度打分。要注意 judge 模型本身有偏好:倾向给长回复高分,也给和自己风格接近的回复高分。缓解办法是把评分拆成具体维度——有没有引用原文、有没有超出知识范围、语气是否合规——别让它打一个笼统的总分。
再加一层人工抽检,每周抽 20 到 50 条标一遍,用来校准 judge。
工具方面,Langfuse、LangSmith、Ragas、Arize Phoenix 都能做 trace 和评测。选哪个主要看现有技术栈和部署要求,功能差异没有宣传材料上写的那么大。
最实际的一步:先攒 30 到 50 条真实 case 当回归集,每次改 prompt、换模型、加工具都跑一遍。步骤如下:
- 从线上日志里抽真实请求,别自己编
- 给每一条写清期望输出或评分维度
- 写一个能一键跑完、输出报告、和上次结果对比的脚本
- 把失败 case 分类打标,看是工具问题、检索问题还是模型问题
7. 权限:怎么让 Agent 不越权
四条规则:
- 读和写用不同凭证。读了不该读的,损失有限;写了不该写的,麻烦大。
- 写操作走人工确认,至少在初期。体验差一点,比出事故强。
- 敏感字段在进入上下文之前就脱敏。等模型看到了再过滤,已经晚了。
- 每次工具调用留审计日志:谁触发、调了什么、参数是什么、返回什么。
8. 成本:拆成四块看
Agent 的成本比一次对话复杂得多:
- 输入 token:system prompt、工具 schema、检索到的文档、历史轮次
- 输出 token
- 检索与 embedding
- 工具本身的花费(调外部 API 的费用)
| 手段 | 效果 | 代价 |
|---|---|---|
| Prompt caching | 长 system prompt + 工具 schema 场景,输入成本可大幅下降 | 缓存写入略贵,前缀必须稳定 |
| Batch API | OpenAI 为 50% 折扣 | 延迟最长到 24 小时 |
| 小模型分流 | 分类、抽取用 mini 级模型 | 需要维护路由逻辑 |
| 上下文裁剪 | 直接减少输入 | 可能丢信息 |
| 硬性限制循环次数 | 防止失控烧钱 | 任务可能中途失败 |
9. 国内平台和国外平台怎么选
先看约束条件,再看功能。
| 平台 | 定位 | 工具接入 | 主要限制 |
|---|---|---|---|
| OpenAI Agents SDK / Responses API | 通用开发 | 函数调用、MCP | 需要海外账号与网络 |
| Anthropic Claude Agent SDK | 编码与长链路任务 | MCP 原生 | 同上 |
| Google ADK + Vertex AI Agent Engine | 企业级 | A2A、MCP | 国内访问受限 |
| Microsoft Copilot Studio / Azure AI Foundry | 办公与企业集成 | 连接器体系 | 绑定 M365 生态 |
| 阿里云百炼 | 国内企业 | 插件与 MCP | 主要跑通义系列 |
| 火山引擎方舟 / 扣子 | 国内企业 | 插件体系 | 主要跑豆包系列 |
| 腾讯云智能体平台 | 国内企业 | 插件体系 | 与微信生态结合紧 |
| 百度千帆 AppBuilder | 国内企业 | 组件体系 | 主要跑文心系列 |
| Dify / LangGraph / n8n | 自建 | 完全自定义 | 需要自己维护 |
- 数据不出内网、要私有化,走自建,LangGraph 或 Dify 部署在自己机房。
- 已经在用某家云,就用这家的智能体平台,省掉权限和网络对接的麻烦。
- 只想验证一个场景值不值得做,用平台的低代码版本,两三天出结果,别一上来就自建。
- 需要精细的评测和成本分析,别指望平台自带的看板,自己接 Langfuse 这类工具。
10. ROI 怎么算
公式不复杂,难的是参数别拍脑袋。
单次任务成本 = (输入token × 输入单价 + 输出token × 输出单价) × 平均轮次 + 检索成本 + 外部API费用
月运营成本 = 单次任务成本 × 月任务量 + 平台/机器固定成本
月收益 = 节省人力小时 × 小时人力成本 × 折算率
净收益 = 月收益 - 月运营成本 - 月开发维护摊销
几个必须写清楚的参数:
- 平均轮次:Agent 不是一问一答。拿真实任务数一下平均工具调用次数,这个数字常常比预期高几倍。
- 折算率:Agent 不会 100% 替代人工。初稿、初筛类任务,按 50% 到 70% 估比较稳,剩下的复核时间省不掉。
- 开发维护成本:算进摊销。评测集维护、模型升级后的适配,都是持续支出。
11. 未来 12 个月
我关注这几件事:
- MCP 工具生态继续扩大。 接内部系统之前先去社区找找有没有现成的 server,比从零写划算。
- 多智能体从演示走向小范围使用。 A2A 协议(2025 年 4 月由 Google 发起,同年捐给 Linux 基金会)解决的是不同厂商 Agent 之间如何对话,2026 年应该能看到一些跨系统的实际用法,但别指望一步到位。
- 评估变成独立预算项。 现在很多团队把评测当附带工作,出了问题才补。往后这会像测试一样,单独排人力。
- 合规时间表开始压人。 欧盟 AI 法案对高风险系统的主要义务时点在 2026 年 8 月前后,出海团队的法务会先于技术团队找上来。
- 模型单价继续降,Agent 总成本不一定降。 单 token 更便宜,但任务链路更长、上下文更大,总账要单独算。
12. 上线前,先做这一件事
别急着选平台、选模型。
找 50 条真实发生过的请求记录,标好正确答案或评分维度,建成一个能一键跑完的评测脚本。这一步做完,后面所有技术选择才有依据——换模型是不是更好、加工具是不是有用、成本涨了值不值,都能用数字回答。
做完这一步,再回头看第 10 节的公式,里面的参数终于有地方可填了。
参考资料(官方文档,链接与内容可能随版本更新,使用前请核对):
- MCP 规范与文档:https://modelcontextprotocol.io
- OpenAI Agents SDK:https://openai.github.io/openai-agents-python/
- Google Agent Development Kit:https://google.github.io/adk-docs/
- A2A 协议:https://a2a-protocol.org
- Langfuse 文档:https://langfuse.com/docs