你的对话记录正在被训练,敏感信息怎么办?
把敏感信息粘进在线对话框之前,先问自己一个问题:这些文本被用来训练后,我还能接受吗?
三星用真金白银回答了“不能”。2023年4月,三星电子有员工把半导体相关源代码贴进ChatGPT求解。三星此后限制员工使用ChatGPT和其他生成式AI,但数据一旦进入训练流程便无法撤回。这不是孤立事件,而是每一个每天向ChatGPT/文心一言/Gemini提问的人都可能踩中的坑。
01 看隐私政策时,只看三个问题
所有大模型产品的隐私条款都可以压缩成三个问题:
- 对话是否默认用于训练模型?能否手动关?
- 对话是否会被人工阅读/审核?
- 有没有“不训练”的API或企业版选项?
| 风险点 | 典型账号类型 | 你该做的动作 |
|---|---|---|
| 对话默认参与模型训练 | ChatGPT个人账号 | Settings -> Data Controls -> 关闭 Improve the model for everyone |
| 对话可能被人工阅读并用于改进模型 | Google 个人版 Gemini | 打开 Gemini Apps 活动记录,暂停记录并删除旧对话 |
| 企业版/API 数据是否被训练 | OpenAI API、Google Workspace | 查看对应产品条款/数据处理协议,优先选“不训练”计划,必要时走合同 |
| 国内产品个人版入口不统一 | 通义千问/文心一言/Kimi等 | 找设置 -> 隐私 -> 数据控制,关闭“参与模型优化”,同时关闭历史保存 |
02 三星ChatGPT事故复盘:训练数据比被拖库更麻烦
2023年4月,三星电子内部出现员工在 ChatGPT 上意外泄露半导体相关数据的报道。在解决代码错误时,员工把工厂测量设备、源代码等直接粘进了对话框。三星随后通知限制公司内使用生成式AI,并着手开发自己的内部AI工具。
这次事件没有上演“黑客拖库”剧情,但它比拖库更麻烦:数据作为训练材料进入模型,OpenAI在相关隐私说明中也提示用户不要输入机密信息。三星的损失很难量化,却给所有公司一个明确信号——员工手里的键盘,比防火墙更值得管理。
两个教训值得留在笔记里:
- 员工不是不知道保密,而是不知道聊天记录去了哪里、做了什么;
- 公司没有提供可用的内部AI工具,安全制度就只能靠员工自觉。
03 本地模型:敏感数据不用出门
敏感数据应该匹配敏感的处理方式:最重要的内容根本不要离开自己的机器。
Ollama、LM Studio、AnythingLLM这三件套可以组成一条完全本地的AI工作流。下面先看工具分工:
| 工具 | 主要用途 | 适合对象 |
|---|---|---|
| Ollama | 命令行下载、运行开源模型,提供本地API | 开发者,想用脚本批量处理文件的人 |
| LM Studio | 图形界面下载模型、聊天、启动本地API | 不想碰命令行、只要一个能对话窗口的人 |
| AnythingLLM | 本地文档库问答,支持连接上方两个引擎 | 需要总结合同、论文、客服记录等文档集合的人 |
硬件建议:7B模型量化版至少需要8GB内存,日常跑摘要、翻译、写作辅助够用;如果只有4GB内存,可以选3B以下模型或直接用在线API的公司版本处理非敏感数据。
命令行里运行一个7B模型只两步:
ollama pull qwen2.5:7b
ollama run qwen2.5:7b
第一次会下载几个GB的模型权重,之后没有网络也能跑。
04 自动匿名化:给在线AI的最后一道保险
如果你因为模型效果、公司要求必须使用在线AI,可以用剪贴板脱敏脚本兜底。我选择这种方法而不推荐浏览器插件,原因是当前主流 AI 网页输入框大多是“虚拟可编辑层”,普通脚本改输入框内容时,页面自己的React状态不会被同步改变,粘贴时仍然可能带着原始数据。剪贴板方案在用户按下粘贴键之前就完成替换,通用性更好。
具体场景:你是电商运营,要把一批聊天记录发给在线AI做差评归类。聊天记录里有电话、邮箱,先对原始文本运行一次脱敏,再粘贴到AI输入框,最终发给服务器的内容里不会包含真实联系方式。
Windows用户可以用AutoHotkey实现,步骤:
- 到 autohotkey.com 下载并安装 AutoHotkey v2。
- 新建文本文件
anonymize.ahk,写入以下内容:
^!s:: {
A_Clipboard := ""
Send("^c")
if !ClipWait(2)
return
A_Clipboard := RegExReplace(A_Clipboard, "1[3-9][0-9]{9}", "[手机号]")
A_Clipboard := RegExReplace(A_Clipboard, "[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+[.][A-Za-z]{2,}", "[邮箱]")
A_Clipboard := RegExReplace(A_Clipboard, "[0-9]{6}(19|20)[0-9]{2}(0[1-9]|1[0-2])([0-2][0-9]|3[01])[0-9]{3}[0-9Xx]", "[身份证]")
}
- 双击运行这个脚本。
- 在任意文件或表格中选中需要脱敏的文本,按下
Ctrl+Alt+S,此时文本已被替换进剪贴板;切到AI对话框,正常的Ctrl+V粘贴即可。
现在可以做的最后一步
这篇文章不是让你卸载AI工具,而是让你养成“先分流、再对话”的习惯。打开你的AI产品设置,把所有“模型优化”开关关掉;遇到敏感内容时,优先切换到本地模型;非用在线AI不可时,执行剪贴板脱敏。
如果今天只做一件事,试试在本地跑一次 Ollama 或 LM Studio,感受一下没有“对话记录被训练”这个心理负担的问答是什么体验。
免责声明:本文所列工具名称、数据政策对应关系均基于相关产品公开信息,使用前请自行核验官方隐私中心的最新版本。文中示例只用于演示,不构成对特定技术的安全承诺。