一个售后主管的真实麻烦
电商售后团队通常先上机器人,再补规则。上线两周后问题集中冒出来:机器人告诉用户「支持 7 天无理由」,而该品类实际是 15 天;用户问能不能补发,机器人回「我们会尽快为您处理」,用户当成承诺截图留证;账号解绑这类问题,机器人给了三步操作,其中一步是错的。
这些对话里机器人并没有「看起来在胡说」,它答得很有条理。问题出在检索到的那段知识是三个月前的版本,或者压根没检索到,模型自己补了一句圆上。
2026 年做客服机器人,难点已经从「能不能接上大模型」转成「答错的那一次有没有人拦住」。下面这套流程适合已经有机器人在跑、但客诉和赔付还在出的团队。如果还没上线,也可以按这个顺序搭,能省掉一轮返工。
第一步:把机器人不准碰的问题列成清单
调提示词之前,先做这件事。涉及金额、时效、账号权限的问题一旦答错,用户会拿着截图要赔付,事后解释成本远高于一开始就不让机器人答。
拉最近 3 个月的工单,按「是否产生赔付」「是否升级为二次投诉」「是否涉及监管投诉」三个维度打标。打标完通常能得到 15 到 30 条意图,典型的有:
- 退款到账时间、赔付金额、优惠券补发
- 保修期与责任认定、是否属于人为损坏
- 账号解绑、手机号变更、实名信息修改
- 合同条款、发票开具、开票主体变更
- 涉及诉讼、消协、平台介入的表述
不划这条线的后果很直接:后面无论怎么调阈值,机器人都可能在某个你没预料到的说法上给出承诺。
第二步:工单不是语料,得先改造成语料
把工单库直接喂给知识库是最常见的翻车点。工单里有客服口语、用户情绪宣泄、内部黑话、已经失效的临时政策,模型分不清哪句是结论哪句是过程。
清洗按这个顺序走:
- 只保留状态为「已确认解决」且经过质检复核的工单
- 删除内部备注、个案赔付记录、客服之间的讨论
- 手机号、地址、订单号、身份证号做脱敏,别把用户信息带进知识库
- 政策类文档标注生效日期,过期版本直接下架,不要留在库里靠模型自己判断
- 一条问答只讲一件事,原先把三个问题混在一条工单里的,拆开重写
- 每段控制在 200 到 500 字,标题写清适用条件,例如「XX 品类 · 华东仓 · 会员等级 V3」
工具上,处理扫描件、复杂表格类政策文档,RAGFlow 的解析能力比较适合;要私有化部署、连内部工单系统,FastGPT 和 Dify 都能用;不想自己运维,阿里云百炼的知识库、腾讯云大模型知识引擎这类托管方案上手更快,按量计费,具体档位以官网当期价格为准。选型的关键不是功能列表,是你们的工单数据能不能出内网。
第三步:设置「答不准就不答」的阈值
这一层是拦截幻觉的主要位置。多数平台都提供这些参数,默认值通常偏「敢答」,需要手动往保守方向调。
| 参数 | 建议起点 | 说明 |
|---|---|---|
| 召回条数 top-k | 3 到 5 | 太少漏信息,太多引入无关片段 |
| 相似度阈值 | 0.60 到 0.75 | 依赖你选的 embedding 模型,必须实测 |
| 重排 rerank | 开启 | 明显提升政策类长文档的命中准确度 |
| 命中条数下限 | 至少 2 条 | 且最好来自同一份政策文档 |
| 生成温度 temperature | 0 到 0.2 | 客服场景不需要发挥 |
| 返回引用来源 | 开启 | 方便事后追溯是哪段知识答错了 |
| 无命中动作 | 兜底话术 + 转人工 | 不要让模型「尽力回答」 |
兜底话术也别写成「抱歉我没听懂」,用户会反复追问。写成明确动作:「这个问题我确认不了,现在为你转接人工,预计等待 X 分钟」,并自动带上已收集的订单号,人工接手时不用重复问。
第四步:转人工的触发条件写成明文规则
转人工率高不一定是坏事。转人工率很低但投诉率在涨,说明机器人卡在了不该卡的位置。
- 用户连续两轮表达不满,或直接要求找人工
- 命中第一步列出的禁区意图
- 检索命中条数低于下限,或最高相似度低于阈值
- 涉及金额赔付、账号安全、法律合规表述
- 同一会话机器人已回答 3 轮但用户仍在追问同一个问题
- 情绪识别为负面(可选,误判率偏高,建议先调高阈值再启用)
上线前:用 30 条真实问题做一次回归
从工单里抽 30 条,10 条常见问题、10 条边界问题(比如跨品类、跨地区政策冲突)、10 条禁区意图。每条标注期望动作:直接回答、拒答、转人工。
跑完记录四个数字:答对、答错、该转没转、该答没答。目标不必是 100% 答对,禁区意图必须 0 漏放。
这个用例集的价值在后面。每次改知识库、改提示词、换模型版本,重跑一遍。不重跑的话,修好一个问题往往会弄坏另一个,而且没人知道是哪次改动导致的。
上线后每周花 30 分钟看三样东西
- 转人工原因前 10 名。同一原因连续两周排前列,说明知识库缺内容,不是模型问题。
- 用户重复追问的原句。这些句子直接反映了知识库的表达方式和用户说法之间的差距,把它们作为同义表述补进文档。
- 机器人回答里出现「可能」「大概」「建议您咨询」的句子。这类模糊词基本对应召回不足,去补对应政策文档。
推荐学习视频
这类产品迭代快,建议以官方账号的最新一期为准,优先看 2025 年之后发布的内容:
- B站「阿里云开发者社区」官方账号:百炼知识库与大模型应用的系列讲解,可搜索「百炼 知识库」
- B站「腾讯云」官方账号:大模型知识引擎相关分享,可搜索「大模型知识引擎 客服」
- 抖音「扣子 Coze」官方账号:智能体与工作流的产品演示
今天能先做的一件事
从工单系统导出最近 3 个月的数据,筛出产生过赔付或二次投诉的对话,把其中的问题意图抄出来,列成一张禁区清单。这张清单不需要任何技术投入,但它决定了后面所有配置的上限。清单列完,再去调阈值。