先分清“会聊天”和“会干活”
一个团队最常见的卡点:模型 API 接好了,知识库也灌了,员工每天打开的还是一个问答框。问一句答一句,答完自己复制到表格里。Agent 这个词在会议纪要里出现了一年多,工位上没多出任何自动化。
问题多半不在模型。把一个只会说话的模型推到需要动手的流程前面,中间缺的是工具、权限、状态和兜底。
按“能动手到什么程度”分,市面上的产品大致落在五层:
| 层级 | 能做什么 | 你怎么验证 | 常见翻车点 |
|---|---|---|---|
| L0 对话 | 一问一答,输出是文字 | 换个说法问同一件事,看答案稳不稳 | 把“看起来对”当成对 |
| L1 检索问答 | 能查内部文档和数据库,答案带出处 | 问一个只存在于内部文档里的数字 | 文档过期,检索到旧版本 |
| L2 单步工具调用 | 能调 1~3 个接口:查订单、发通知、建日程 | 让它真写一条测试数据进去 | 参数填错,失败也不报错 |
| L3 多步任务 | 自己拆步骤、循环试错、卡住会问人、失败能回滚 | 中途断一次网,看它会不会卡死 | 步数失控,token 烧穿预算 |
| L4 长时驻留 | 定时触发、有独立身份和权限、多个 Agent 互相派活 | 查操作日志,能不能定位到某一步 | 权限开太大,出事追不到人 |
层级不是越高越好。L1 的维护成本可能是一周更新一次文档;L3 得有人持续改工具描述、补失败处理。不少团队的第一个 Agent 死在“上来就想做 L4”。
四类玩家分别卡在什么位置
云厂商:卖模型,也卖编排
阿里云百炼、火山引擎方舟与扣子(Coze)、腾讯云大模型知识引擎、百度千帆与文心智能体平台、华为云 ModelArts Studio 与盘古,是当前企业侧最常被拉进方案对比的一组。
它们的共同点:模型可选、按 token 或按资源计费、支持私有化或专有云、新用户一般有试用额度。差异主要在模型生态和工具生态——比如是否原生支持 MCP(Model Context Protocol,Anthropic 于 2024 年 11 月开源,随后被多家厂商采纳)来挂外部工具。
别指望它们替你做最后一公里。你的 ERP 里那张表叫什么、字段怎么映射、失败重试几次,这些得自己填。云厂商给的是发动机和变速箱,不是方向盘上的手。
自建路线也值得看一眼:Dify、FastGPT、n8n 是常见的开源编排选项,扣子的 Coze Studio 也在 2025 年开源。社区版通常免费,云托管版按月或按调用量收费,具体档位以官网计价页为准。
手机厂商:抢的是入口,不是算力
华为小艺、小米超级小爱、OPPO 小布、vivo 蓝心小V、荣耀 YOYO,这两年都在做同一件事——把“你说一句话,手机自己点”变成系统能力。
技术上分成两条路:一条是系统级意图框架,App 主动把自己的能力注册进来,系统调用;另一条是 GUI Agent,直接看屏幕、识别按钮、模拟点击。公开层面,智谱 AutoGLM、字节 UI-TARS 是后一条路上比较有代表性的动作。
GUI Agent 的好处是 App 不用适配;代价是慢、耗电、容易点错。更关键的是,碰到验证码、支付确认、实名认证这类环节,系统基本会拦住它——这是设计如此,不是 bug。
所以手机上的 Agent,2026 年最稳的用法是跨 App 的信息搬运和提醒:“把这条快递单号记到备忘录”“明天下午三点提醒我给张工回电话”。让它替你做决策,还早。
办公协同:最可能先跑出效果的一层
钉钉 AI 助理、飞书智能伙伴、企业微信、WPS AI、腾讯文档这一批产品,优势不在模型,而在现成的组织架构、权限体系、审批流和消息触达。
“发消息、建群、拉审批、填表格”这些动作本来就发生在这些系统里,不用额外造轮子。一个典型场景:每天早上九点,把昨天超时未发货的订单整理成表,@ 到负责人,并把处理结果写回原表。这类任务的完成标志清晰,失败影响可控,适合拿来试水。
垂直场景:靠行业数据吃饭
| 方向 | 代表形态 | 现在能做到 | 暂时做不到 |
|---|---|---|---|
| 编程 | Cursor、Trae、通义灵码等 IDE 类工具 | 改多文件、跑测试、按报错自己修 | 需求本身有歧义时替你拍板 |
| 客服 | 电商平台自带客服 Agent、独立厂商 | 处理高频标准问题、查物流、发起退款 | 处理情绪激烈或涉及赔偿的对话 |
| 财税法律 | 行业 SaaS 内置助手 | 草拟文书、比对条款、查政策 | 承担签字责任 |
| 数据分析 | BI 工具内置 Agent | 自然语言转 SQL、出图、写结论 | 数据口径本身混乱时给出正确结论 |
三种付法,对应三种风险
| 订阅制 | 按结果付费 | 项目制 | |
|---|---|---|---|
| 怎么算钱 | 按席位/按月,或按 token、按调用量 | 按解决的工单数、成功调用次数、成单量 | 一次性交付加年度维护 |
| 适合谁 | 内部工具、用量平稳、要快速试 | 客服、外呼、营销这类结果可量化的场景 | 系统集成重、要接内网老系统的场景 |
| 对方的动力 | 让你多用 | 让你少用(成本压在他们那边) | 尽快验收 |
| 你最大的风险 | 用量失控,长任务循环烧 token | “结果”的定义跟你理解的不一样 | 交付后没人管,改一个字段另收费 |
- 什么算“解决”——用户不再追问算不算,三天内再次咨询算不算
- 谁判定——系统自动判定还是人工抽检,抽检比例多少
- 失败是否收费——模型答错、工具超时、用户挂断分别怎么算
- 超时怎么处理——任务跑超过 N 分钟自动终止还是继续计费
- 数据归谁——交互日志能不能导出,能不能用来训练对方的模型
- 封顶条款——单日调用上限、单任务最大步数、月度费用上限
企业选型:从流程倒推,不从产品倒推
对照清单逐项打勾,缺一项就先别签:
- 场景有终点:能一句话说清“做完了是什么样”,而不是“帮我处理一下客户”
- 接口能接:有开放 API、MCP 服务或只读数据库账号
- 身份独立:Agent 用单独的服务账号跑,不借用任何人的账号,权限按最小给
- 日志可查:每一次工具调用都能回溯到时间和参数
- 兜底明确:卡住超过多久转人工,转给谁
- 成本封顶:单任务步数上限、日均调用上限、超量告警接收人
- 有人维护:字段映射、工具描述、失败话术,指定一个人每周花两小时改
- 退出可行:配置和日志能导出,换供应商不用从零再来
个人使用:三个动作,别贪多
个人用 Agent 最容易犯的错是一次性挂十个工具,然后发现它一个都用不明白。
- 挑一件事,每周至少重复三次。重复次数不够,你判断不出它到底有没有变好。
- 先让它读,再让它写。把周报素材、会议记录扔给它整理,跑顺了再给它写文件的权限。写权限给早了,出错就是数据事故。
- 给它固定的输出模板。同一份简报的格式固定下来,你才能一眼看出它这次哪里不对。
- 成功的提示词存成文件,别留在聊天记录里。下周你还得用。
- 每周翻一次失败记录。失败的调用比成功的更能告诉你边界在哪。
想听官方口径,去哪儿看
二手解读的信息衰减很快。这几类内容值得自己看原版:
- 云栖大会、火山引擎 Force 大会、腾讯全球数字生态大会、百度 Create 大会的官方回放,通常在对应厂商的 B 站官方账号下能找到
- 手机厂商系统发布会回放,在各自官方视频号和官网
- 抖音、腾讯视频、优酷、B 站上的“Agent 实测”类内容质量差异很大。看之前先确认发布时间和演示环境;只放成功片段、不放失败过程的,参考价值有限
今天就能做的一件事
打开团队上周的群聊或工单记录,找出一句被重复问了五次以上的话。那句话对应的流程,就是你的第一个 Agent 场景。
如果翻完一周记录,找不出这样一句话,那就别急着买工具——你需要的是先把流程理顺。