2026中国AI智能体落地全景:从Coze、Dify到企业工作流,钱在哪里?

行业分析AI智能体CozeDifyMCP企业工作流ROI2026-09-19

一位客服主管拿着一份「智能体替代 30 个坐席」的提案来找你。先别急着砍预算,先问一句:这 30 个人每天处理的工单,有多少是同一类问题?

这个问题决定了他该买扣子还是 Dify,也决定了这笔钱最后是省下来还是沉进去。

智能体和工作流自动化,分界线在哪

工作流自动化不新鲜。Zapier、n8n、钉钉审批、RPA 都属于这一类:步骤写死,A 触发 B,B 把数据交给 C。模型可以出现在某个节点里做分类或摘要,但节点本身和分支条件是提前定义好的。

智能体的差别在决策权。你给一个目标,它自己决定先查订单、再查物流、要不要给用户发消息、发完要不要建工单。步骤不在代码里,在模型的判断里。

判断一个任务属于哪边,问一句话就够:这件事交给一个刚入职的实习生,你能不能写出一份步骤不超过十步的 SOP?

  • 能,就是工作流。
  • 不能,而且他每次都得先问一圈人才能决定下一步,那就是智能体。
成本上的差别来自调用次数。工作流走完一次流程通常调用一到两次模型;智能体为了一个任务可能调十次工具,每次结果都要塞回上下文,token 和延迟同时上涨。业务量大的场景,这个倍数就是账单的倍数。

flowchart TD A[拿到一个待自动化的任务] --> B{步骤能写死吗} B -- 能 --> C[工作流自动化] B -- 不能 --> D{出错后必须精确回滚吗} D -- 必须能 --> E[工作流加人工兜底] D -- 不需要 --> F{调用量级大吗} F -- 不大 --> G[智能体] F -- 很大 --> H[智能体加小模型路由加调用上限]

真正模糊的是客诉处理这类场景。意图分类可以用工作流,退款申请处理要查订单、看物流、判断有没有超期,这段适合智能体。别把整个流程塞进同一种方式,按步骤拆开。

平台型、垂直型、企业自研,三类玩家各卖什么

平台型产品的差别主要在部署方式和锁定程度。

  • 扣子(Coze):字节的产品,Bot、插件、工作流、知识库在同一个界面里,发布渠道包含飞书、抖音等。验证想法快,一两周能看到东西。深度定制要绕平台限制。
  • Dify:开源项目,社区版可以自托管,Workflow 和 Agent 节点都有。有技术团队、数据不能出内网的公司常拿它起步。企业版功能和支持需要单独谈。
  • 阿里云百炼、百度千帆、腾讯元器:和自家云资源、模型服务绑得紧,走企业采购流程比较顺。签之前先确认模型能不能换、数据落在哪个区域。
  • n8n:编排能力强于 AI 能力,自托管版本可用。公司已经在跑 n8n,加一个 AI 节点比换平台便宜。
类型典型产品上线速度定制空间主要风险
平台型扣子、Dify、百炼、千帆、元器快中平台限制、迁移成本
垂直型各行业客服/营销/法务 SaaS最快低功能边界固定,加需求要等排期
企业自研LangGraph、Dify 二开、直接调 API慢高人力投入、长期维护
垂直型产品的共同点:预置行业知识、按坐席或按调用量收费、交付周期短。缺点也一致,你的特殊流程他们不会为你一个人改。

企业自研适合核心业务。判断标准简单:这个环节停了公司会不会停。会,那就自己掌握;不会,买现成的。

客服、营销、研发、供应链,ROI 怎么算才不骗自己

先记住一个公式:

年化收益 = 节省工时 × 综合人力成本 + 质量收益 + 新增产出 − 模型调用费用 − 平台费用 − 集成开发 − 运维

多数提案只算第一项,还按满负荷算。

客服:按工单类型拆,别按总量算

把最近一个月的工单导出来,按问题类型分组。排名前五的类型通常占掉大部分重复劳动,这部分是智能体能吃下的,长尾留给人工。

盯四个数:自助解决率、转人工率、首次响应时间、因错误回复产生的二次工单。最后一项最容易被忽略,也最容易把账算崩。上线前先跑四周影子模式,智能体给建议、人工点发送,两边答案都留档。

营销:先看产出速度,别先看转化率

素材批量生成、投放文案变体、评论区回复,这些环节的收益好测。转化率受素材质量、渠道、预算多重影响,单把 AI 拉出来归因会失真。先确认产出量能不能起来,再看转化。

研发:用 DORA 指标对照

代码补全、单测生成、issue 分类、on-call 初筛这几件事里,补全工具的收益最好算。用部署频率、变更失败率、平均恢复时间做前后对照,比凭感觉说提效靠谱。

供应链:数据规整的场景,传统模型往往更便宜

需求预测、单据识别、异常订单排查,这些任务的数据是结构化的。历史数据够、规律稳定的话,梯度提升树之类的模型成本更低、延迟更小、结果还更可解释。智能体的价值在处理非结构化的那部分:供应商邮件、合同条款、异常描述。

四个场景通用的核算清单:

  • 把任务拆成可自动化与不可自动化两部分
  • 影子模式跑够四周,记录命中率和错误类型
  • 模型调用费用按最坏情况(调用次数上限)估算,别按平均值
  • 算清楚人工兜底的人力,这部分不会消失,只会变少

MCP、权限、评估、成本,2026 年绕不开的四件事

MCP

Anthropic 在 2024 年 11 月开源了 Model Context Protocol,用统一的方式描述模型能调用哪些工具。接入之后,同一份工具定义能在不同客户端之间复用,不用为每个平台重写一遍。

它解决的是接口格式问题。权限和审计不在它的范围内。要接之前先看平台文档里对 MCP 的支持程度和认证方式,各家进度不一样。

权限

智能体拿到的工具权限,不应该超过给它派活的那个人。落到实现上:

  • 默认只读,写操作(下单、退款、发消息)走单独审批或二次确认
  • 用 OAuth 的 scope 限制到具体资源,别图省事给一个全量 token
  • 所有工具调用留日志,包括入参和返回,出事能回溯到哪一步
评估

没有评估集就不要上线。做法:从真实历史数据里挑 50 到 200 条典型 case,每条写清楚期望行为,包括该调用哪个工具、该拒绝什么请求。每次改 prompt 或换模型后跑一遍回归。维护这个集合的成本比模型费用高,但它是唯一能判断「变好了还是变坏了」的手段。

成本

三块:模型调用、平台订阅、集成开发。前两块看得见,第三块最容易被低估——把智能体接进老系统,接口改造和异常处理的工作量通常超过搭建智能体本身。

控制调用成本的具体手段:

  • 简单分类和路由用小模型,复杂推理才上大模型
  • 限制单次任务的最大工具调用次数,超了直接转人工
  • 缓存高频问题的答案,别每次都重新推理
  • 监控单任务平均 token 消耗,设一个告警阈值
多智能体互相调用的架构,先算最坏情况的成本。一个请求套三层,账单会失控。

企业怎么选,投资人怎么看

选型清单:

  • 这个任务有没有可写下来的 SOP,有的话先做工作流
  • 数据能不能出内网,不能的话优先看 Dify 社区版或云厂商私有化方案
  • 上线后谁来维护 prompt、知识库、评估集,有没有固定的人
  • 最坏情况损失多大,能不能回滚
  • prompt、知识库、工具定义能不能导出,换平台时会不会推倒重来
投资判断看三件事:

第一,收入是不是绑在模型调用量上。按调用量收费的产品,毛利会被上游模型价格和客户用量两头挤,订阅制或按坐席收费的形态更稳。

第二,客户把多少流程放进了产品里。放进去就难换。

第三,交付人力占收入的比例。这个数字高,说明产品化程度低,规模越大越累。

垂直型公司能不能活下来,看它有没有拿到平台型公司拿不到的东西:行业数据、合规资质、和客户业务系统的深度集成。只做 prompt 封装的产品,平台出一个官方模板就没了。

这周就能做的一件事

挑一个高频、低风险、输出可校验的任务——订单状态查询、常见问题回复、单据字段提取都行。用扣子或 Dify 社区版搭一版,跑四周影子模式,把命中率和错误类型记下来。

四周之后你手里的数字,比任何一份行业报告都能帮你决定这笔钱该不该花。

各平台定价和功能调整频繁,签约前以官网当前页面为准。

PREMIUM

需要完整版教程?

包含详细步骤、视频演示、提示词模板和可下载资料包。微信支付即时获取。

购买完整版 ¥29.90