推理模型时代,AI 产品如何设计可信交互?
用户点下“深度推理”,按钮变成 24 秒计时。答案出来后写着“建议拒绝退款”。客服主管盯着屏幕问:物流那条信息从哪来?中间有没有看错政策?这 24 秒里,产品如果只给转圈和结论,推理能力越强,用户越不敢按。
退款审核场景可以串起五个设计点:推理预算、延迟反馈、过程展示、纠错入口、评估指标。其他任务替换数据和规则即可。
1. 推理模型带来的能力变化
推理模型在回答前会花更多 test-time compute,也就是把算力用在中间步骤上。API 层面,OpenAI o 系列用 reasoning_effort,可选 low、medium、high;Anthropic 的 extended thinking 用 budget_tokens 控制思考预算;Gemini 用 thinking_budget;DeepSeek-R1 的 API 会分开返回 reasoning_content 和最终 content。这些参数说明一件事:推理不是免费开关,它买的是多步检查、工具调用和约束满足,代价是延迟、token 和成本。
产品侧要把它当数据库查询处理,而不是当普通文本生成。
| 能力变化 | 用户端表现 | 设计动作 |
|---|---|---|
| 多步推理 | 简单问题也可能等 5 到 30 秒 | 显示阶段状态,允许中断,缓存常见结果 |
| 工具调用 | 会搜索、查库、跑代码 | 显示工具名、参数摘要、返回状态 |
| 中间反复 | 有时改结论,有时卡住 | 把关键步骤变成可检查对象,不承诺一次就对 |
| 成本上升 | 深度模式账单更高 | 默认中等预算,深度模式让用户确认 |
| 输出不稳定 | 同一问题两次步骤不同 | 保存版本,支持对比和回退 |
2. 用户对黑箱与延迟的容忍度
延迟容忍度不只看秒数,还看任务价值、可控感和反馈。Nielsen Norman Group 的经典响应时间阈值是:0.1 秒像即时,1 秒不打断思路,10 秒是注意力上限。放到 2026 年的推理产品里,可以这样拆:
| 场景 | 参考等待 | 需要什么反馈 | 能不能中断 |
|---|---|---|---|
| 搜索建议、代码补全 | 1 秒内 | 不能阻塞输入 | 不需要 |
| 聊天问答 | 1 到 3 秒 | 首状态要快,先给一句“正在查政策” | 可以 |
| 数据分析、合同审阅 | 10 到 60 秒 | 进度清单、已读文件、当前检查项 | 必须能停 |
| 批量规划、代码迁移 | 分钟级 | 后台跑、完成通知、中间结果落盘 | 要能暂停和续跑 |
黑箱问题更麻烦。用户通常不要求看原始思维链。他们要知道三件事:结论用了哪些输入,哪一步可能错,改哪里可以重算。原始 CoT 可能包含个人信息、错误假设和来回推翻的句子,直接摊开会让用户把草稿当承诺。OpenAI 的 reasoning 指南和 Anthropic 的 extended thinking 文档都倾向用摘要、结构化结果和可验证输出来代替原始推理。界面默认给摘要,原始日志放调试或合规入口,并且脱敏。
3. 展示思考过程的界面模式
不要把所有模式堆在一个界面。先按任务选一种主模式,再补证据。
| 模式 | 适合任务 | 实现要点 | 风险 |
|---|---|---|---|
| 计时加摘要 | 日常问答 | 显示“思考 12 秒”,展开后给 1 到 3 条高层摘要 | 摘要太细会误导,太粗等于没给 |
| 步骤检查器 | 数学、报销、代码迁移 | 中间结论变成可勾选、可编辑字段 | 步骤太多,用户不看 |
| 证据卡 | 法律、医疗、金融 | 每个结论挂来源、页码、时间、版本 | 来源缺失时不能假装有 |
| 工具轨迹 | Agent、检索问答 | 显示调用了搜索、数据库、代码解释器,参数脱敏 | 暴露内部接口或密钥 |
| 候选方案 | 规划、选型 | 给 2 到 4 个方案、评分和取舍 | 评分没有依据会变成摆设 |
| 原始日志 | 调试、合规 | 权限控制、默认关闭、可导出 | 隐私和误读 |
一个判断标准:如果用户看完界面,能说出“我不同意第 3 步,因为物流数据是旧的”,这个界面就合格。如果只能说出“AI 说不行”,那就是黑箱。
4. 可控性、可解释性与纠错设计
可控性要落到关键节点上的选择,不要堆开关。
- 推理预算滑杆:快、标准、深度。映射到 API 参数,并显示预计时间和费用提示。
- 停止按钮:停下后保留已完成的步骤和中间结论,不要清空。
- 锁定步骤:用户确认“订单金额正确”后,重跑不重新算这一步。
- 重跑分支:只重跑受影响的步骤,不从头再来。
- 工具开关:允许或禁止联网、代码、数据库查询,按任务预设。
- 版本对比:保存两次推理的步骤和结论,标出差异。
纠错设计要给具体入口:
- 结论区固定显示三条以内关键依据,每条可点开来源。
- 每个推理步骤可以标记“错误”“过时”“缺少来源”。
- 证据卡支持编辑,例如把过期的物流时间改成最新时间。
- 用户追加约束后,只重跑受影响步骤,并保留旧版本。
- 最终输出列出未决点,例如“退货政策版本未确认”。
- 把修正后的样本导出到评估集,不直接拿去训练,先做人工审核。
5. 评估指标与案例
可信交互不能只看“用户觉得好用”。要把交互行为和任务结果分开测。
| 指标 | 定义 | 采集方式 | 看什么方向 |
|---|---|---|---|
| 任务成功率 | 一次通过人工复核的比例 | 抽样复核 | 升 |
| 首状态延迟 | 提交到看到“正在处理”的时间 | 前端埋点 | 降,尽量 1 秒内 |
| 总延迟 | 提交到结论的时间 | 前端加后端日志 | 按任务分层看 |
| 中断恢复率 | 停止后能继续并完成的比例 | 会话埋点 | 升 |
| 修正率 | 用户编辑步骤或证据的比例 | 事件日志 | 看分布,不只看均值 |
| 错误可归因率 | 错误能定位到输入、工具、推理或政策 | 人工标注 | 升 |
| 证据命中率 | 引用来源确实支持结论 | 抽样检查 | 升 |
| 人工复核时间 | 与无 AI 流程对比 | A/B 或前后测 | 降,且不能牺牲准确率 |
公开案例里,ChatGPT 的思考计时和摘要、Claude 的 extended thinking 块、DeepSeek-R1 的 reasoning_content 折叠区、Perplexity Pro Search 的搜索步骤,都在做同一件事:把部分过程变成可检查对象。产品设计可以借用这个思路,但别承诺展示完整原始思维链。官方文档也说明,部分模型返回的是摘要,不是完整内部推理。
延伸阅读,均为官方文档或公开页面,内容与可用性由原平台维护。本文只做设计讨论,不复制其完整内容:
- OpenAI reasoning 指南:https://platform.openai.com/docs/guides/reasoning
- OpenAI o1 系统卡:https://openai.com/index/openai-o1-system-card/
- Anthropic extended thinking 文档:https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking
- DeepSeek-R1 代码库:https://github.com/deepseek-ai/DeepSeek-R1
- Google Gemini thinking 文档:https://ai.google.dev/gemini-api/docs/thinking
- Nielsen Norman Group 响应时间阈值:https://www.nngroup.com/articles/response-times-3-important-limits/