AI 客服答错率高,先别换模型:从会话日志到兜底话术的排查顺序(2026)

客服AI客服知识库Dify2026-09-30

大促结束后第一周,客服后台的会话量常见翻两三倍,其中一大半是同一个问题:包裹停在中转站三天没动。客服一边复制单号查询,一边把“请您耐心等待”重复上百遍。这种时候很多团队会决定上一套 AI 客服,接上大模型接口,两周后却发现答错率比纯人工还高——用户问“退货运费谁出”,机器人甩出一条通用规则,而生鲜类目实际不支持。

问题大多不在模型选得不够强。你喂进去的材料长什么样、放行的条件设成什么样,才是决定机器人会不会答偏的地方。下面这套顺序,来自智能客服项目里反复出现的排查路径,可以照着走。

一、先数清楚:哪些问题真能被机器人接住

上模型之前,先要花时间的是数数。跳过这一步,后面所有配置都是猜。

拉 30 天会话,人工过 200 条

从客服系统导出最近 30 天的会话记录,字段尽量带上:用户原话、客服最终回答、是否转人工、处理时长。可以用大模型先做一次聚类,把几千条压成几十个意图,但聚类结果必须人工过一遍,从高频意图里挑 200 条逐条看。

看的时候只问一个问题:这个问题换成我,能不能在 30 秒内给出确定答案。能,就可以试着交给机器人;不能,先放着。判断依据是有没有唯一正确答案,跟问题本身简不简单没关系。

三类问题,处理方式完全不同

这一步做完,你会得到一张分流表。三类问题归属不同,硬塞给同一个机器人,就会出现该答的不答、不该答的乱答。

问题类型典型例子该由谁回答
有稳定标准答案发票怎么开、七天无理由的范围、发货时效机器人直答,答案进知识库
依赖实时数据我的件到哪了、退款到账没有机器人调接口查数据,不解释政策
涉及金额、投诉、情绪赔付多少、要投诉、要找媒体直接转人工,机器人只收集信息
第二类最容易被做坏。机器人没有查订单的权限,却硬要回答物流问题,只能靠猜,猜错一次用户能记很久。给它接口,或者让它老实说“我帮您转接查询”。

二、知识库怎么切,决定机器人答得准不准

知识库不是文档仓库。整本 PDF 丢进去,检索出来的往往是一段看着相关、实际答非所问的文字。

一条问答 = 一个问题 + 多种问法 + 一个答案

以运费问题为例,用户不会规规矩矩问“退货运费由谁承担”。他可能说:退货要自己出运费吗;这个运费你们报不报;我寄回去的快递费谁给。这几种问法写在同一条问答里,比让模型自己去算相似度稳得多。

Dify、FastGPT、扣子(Coze)这类工具都支持一条问答挂多个相似问法。这一步是体力活,也是效果差异比较明显的地方。

带条件的答案要拆开

“七天无理由退货”这句话,在服饰、生鲜、定制类目下的答案不一样。三条规则揉成一条,模型召回时容易只截到前半句。拆成三条,每条正文里写清适用条件和不适用条件。

每条答案标上出处和生效日期

平台规则会改。答案里带上来源文档名和更新日期,过期内容能一眼找出来下架。客服主管换人时,这套标注能省掉大量交接成本。

三、让机器人敢说“我不知道”的三个开关

机器人最容易出事的地方,是它永远想给一个答案。

召回阈值往上调

相似度低于阈值时,系统应该判定“没找到”,而不是退而求其次给最接近的那条。不少平台的默认设置是总返回 Top1,把阈值调高、允许返回空结果,答错率通常会明显下降,代价是转人工率上升。这笔账要算,别默认转人工就等于失败。

兜底话术要带具体动作

“抱歉,这个问题我没查到,已经帮您转接人工,工单号 12345”,比“抱歉我不太明白”有用得多。转人工的同时,把用户已经说过的信息一并带过去,用户不必重复第二遍。

高风险场景设白名单

退款金额争议、投诉、法律、监管、人身安全相关的词命中后,直接进人工队列,不经过模型。名单不长,二十来个词够用,但一定要有。

四、上线前:50 条真实会话跑一遍

  • 从近 30 天会话抽 50 条,三类问题都要覆盖,不能只挑简单的
  • 逐条记录:机器人回答、是否可用、错在哪一类(没召回 / 召回错 / 答半截)
  • “答半截”单独归类——它看起来对,实际漏了条件,最难被发现
  • 两个人交叉判定,避免一个人判久了标准变松
  • 灰度先放 10%–20% 流量,其余仍走原流程
  • 每天固定看一遍错误样本,改的是知识库,不是模型参数
最后一条值得多说一句。看到答错就去换更大的模型,是这类项目里常见的无效动作。同一个知识库,换模型带来的提升有限;把答案补全、把条件拆开,效果来得更快。

五、上线后盯哪三个数

很多团队只盯一个“AI 解决率”,这个数字很容易被优化。更实用的是三个:

转人工率:涨得太快说明知识库覆盖不够,跌得太快反而要警惕,可能机器人开始硬答了。

因错答产生的投诉或二次进线量:这是能比较直接反映用户感受的指标。

首次响应时长:机器人接了以后,用户等第一句话的时间是变短还是变长。如果知识库检索慢,用户感受不到 AI 的存在。

几个反复踩到的坑

把产品手册整本导入,不拆条,检索结果永远是“最像的一段”。

机器人没有订单查询权限,却让它回答物流状态。

电话、微信、APP 三个渠道各建一套知识库,同一个问题三个答案,用户换个渠道就换一套说法。

客服随手改知识库没有版本记录,出了问题查不到是谁在什么时候改的。

推荐学习视频

国内平台上这几类内容更新比较稳定,可以在对应平台内按账号或关键词检索:

  • B 站「AI进化论-花生」:大模型应用与工具评测方向,适合补基础概念,看清不同模型的能力边界。
  • B 站、抖音「秋叶Excel」:偏办公场景的 AI 落地,客服话术模板、工单整理类内容较多。
  • 腾讯视频、优酷:搜索“智能客服 知识库 搭建”,多为厂商公开课,讲工具操作的部分可以直接照做。
以上视频的具体标题、作者与发布时间以平台页面显示为准,建议在平台内按关键词检索最新一期。

视频来源网络,仅供学习参考,如有侵权请联系删除。

今天就能做的一件事

导出最近 7 天的会话记录,随机抽 100 条,按上面三类打标签,算出每类占比。如果“依赖实时数据”这一类超过三成,先解决接口对接和数据权限,再谈知识库和模型。这一步不用买任何工具,一个上午能做完。

PREMIUM

需要完整版教程?

包含详细步骤、视频演示、提示词模板和可下载资料包。微信支付即时获取。

购买完整版 ¥29.90