客服机器人乱承诺怎么治:知识库清洗、拒答阈值与转人工规则实操

客服智能客服RAG知识库2026-10-07

一个售后主管的真实麻烦

电商售后团队通常先上机器人,再补规则。上线两周后问题集中冒出来:机器人告诉用户「支持 7 天无理由」,而该品类实际是 15 天;用户问能不能补发,机器人回「我们会尽快为您处理」,用户当成承诺截图留证;账号解绑这类问题,机器人给了三步操作,其中一步是错的。

这些对话里机器人并没有「看起来在胡说」,它答得很有条理。问题出在检索到的那段知识是三个月前的版本,或者压根没检索到,模型自己补了一句圆上。

2026 年做客服机器人,难点已经从「能不能接上大模型」转成「答错的那一次有没有人拦住」。下面这套流程适合已经有机器人在跑、但客诉和赔付还在出的团队。如果还没上线,也可以按这个顺序搭,能省掉一轮返工。

第一步:把机器人不准碰的问题列成清单

调提示词之前,先做这件事。涉及金额、时效、账号权限的问题一旦答错,用户会拿着截图要赔付,事后解释成本远高于一开始就不让机器人答。

拉最近 3 个月的工单,按「是否产生赔付」「是否升级为二次投诉」「是否涉及监管投诉」三个维度打标。打标完通常能得到 15 到 30 条意图,典型的有:

  • 退款到账时间、赔付金额、优惠券补发
  • 保修期与责任认定、是否属于人为损坏
  • 账号解绑、手机号变更、实名信息修改
  • 合同条款、发票开具、开票主体变更
  • 涉及诉讼、消协、平台介入的表述
这些意图写进配置,命中就直接转人工,机器人只负责收集必要信息,比如订单号、问题描述。关键词匹配加意图分类双保险,只靠一种容易漏。

不划这条线的后果很直接:后面无论怎么调阈值,机器人都可能在某个你没预料到的说法上给出承诺。

第二步:工单不是语料,得先改造成语料

把工单库直接喂给知识库是最常见的翻车点。工单里有客服口语、用户情绪宣泄、内部黑话、已经失效的临时政策,模型分不清哪句是结论哪句是过程。

清洗按这个顺序走:

  • 只保留状态为「已确认解决」且经过质检复核的工单
  • 删除内部备注、个案赔付记录、客服之间的讨论
  • 手机号、地址、订单号、身份证号做脱敏,别把用户信息带进知识库
  • 政策类文档标注生效日期,过期版本直接下架,不要留在库里靠模型自己判断
  • 一条问答只讲一件事,原先把三个问题混在一条工单里的,拆开重写
  • 每段控制在 200 到 500 字,标题写清适用条件,例如「XX 品类 · 华东仓 · 会员等级 V3」
为什么要卡字数:分段太短,检索时上下文不够,模型容易脑补;分段太长,一段里混着多个答案,模型会挑错那一条。

工具上,处理扫描件、复杂表格类政策文档,RAGFlow 的解析能力比较适合;要私有化部署、连内部工单系统,FastGPT 和 Dify 都能用;不想自己运维,阿里云百炼的知识库、腾讯云大模型知识引擎这类托管方案上手更快,按量计费,具体档位以官网当期价格为准。选型的关键不是功能列表,是你们的工单数据能不能出内网。

第三步:设置「答不准就不答」的阈值

这一层是拦截幻觉的主要位置。多数平台都提供这些参数,默认值通常偏「敢答」,需要手动往保守方向调。

参数建议起点说明
召回条数 top-k3 到 5太少漏信息,太多引入无关片段
相似度阈值0.60 到 0.75依赖你选的 embedding 模型,必须实测
重排 rerank开启明显提升政策类长文档的命中准确度
命中条数下限至少 2 条且最好来自同一份政策文档
生成温度 temperature0 到 0.2客服场景不需要发挥
返回引用来源开启方便事后追溯是哪段知识答错了
无命中动作兜底话术 + 转人工不要让模型「尽力回答」
阈值没有通用值。做法是拿 30 条真实问题跑一遍,记录两类错误:「该答的没答」和「不该答的答了」。前者把阈值调低,后者调高,来回两三轮通常能稳定下来。

兜底话术也别写成「抱歉我没听懂」,用户会反复追问。写成明确动作:「这个问题我确认不了,现在为你转接人工,预计等待 X 分钟」,并自动带上已收集的订单号,人工接手时不用重复问。

第四步:转人工的触发条件写成明文规则

转人工率高不一定是坏事。转人工率很低但投诉率在涨,说明机器人卡在了不该卡的位置。

  • 用户连续两轮表达不满,或直接要求找人工
  • 命中第一步列出的禁区意图
  • 检索命中条数低于下限,或最高相似度低于阈值
  • 涉及金额赔付、账号安全、法律合规表述
  • 同一会话机器人已回答 3 轮但用户仍在追问同一个问题
  • 情绪识别为负面(可选,误判率偏高,建议先调高阈值再启用)
第 5 条容易被忽略。很多团队只按「答不出来」转人工,但用户重复追问往往意味着答非所问,这时候继续让机器人试下去,体验比直接转人工差得多。

上线前:用 30 条真实问题做一次回归

从工单里抽 30 条,10 条常见问题、10 条边界问题(比如跨品类、跨地区政策冲突)、10 条禁区意图。每条标注期望动作:直接回答、拒答、转人工。

跑完记录四个数字:答对、答错、该转没转、该答没答。目标不必是 100% 答对,禁区意图必须 0 漏放。

这个用例集的价值在后面。每次改知识库、改提示词、换模型版本,重跑一遍。不重跑的话,修好一个问题往往会弄坏另一个,而且没人知道是哪次改动导致的。

上线后每周花 30 分钟看三样东西

  • 转人工原因前 10 名。同一原因连续两周排前列,说明知识库缺内容,不是模型问题。
  • 用户重复追问的原句。这些句子直接反映了知识库的表达方式和用户说法之间的差距,把它们作为同义表述补进文档。
  • 机器人回答里出现「可能」「大概」「建议您咨询」的句子。这类模糊词基本对应召回不足,去补对应政策文档。
每周同步一次政策变更,新版本入库的同时把旧版本下架。库里留着两个版本,模型就有 50% 左右的概率念错那个。

推荐学习视频

这类产品迭代快,建议以官方账号的最新一期为准,优先看 2025 年之后发布的内容:

  • B站「阿里云开发者社区」官方账号:百炼知识库与大模型应用的系列讲解,可搜索「百炼 知识库」
  • B站「腾讯云」官方账号:大模型知识引擎相关分享,可搜索「大模型知识引擎 客服」
  • 抖音「扣子 Coze」官方账号:智能体与工作流的产品演示
视频来源网络,仅供学习参考,如有侵权请联系删除。

今天能先做的一件事

从工单系统导出最近 3 个月的数据,筛出产生过赔付或二次投诉的对话,把其中的问题意图抄出来,列成一张禁区清单。这张清单不需要任何技术投入,但它决定了后面所有配置的上限。清单列完,再去调阈值。

PREMIUM

需要完整版教程?

包含详细步骤、视频演示、提示词模板和可下载资料包。微信支付即时获取。

购买完整版 ¥29.90