用 AI 处理敏感数据前,先分清这三层的边界

问题的本质

「AI 会不会泄露我的数据」这个问题问得太笼统。把它拆成三层,答案就清楚了:数据在哪一层,决定了它有没有出网。

第一层:模型层(生成建议)

你把数据贴进对话框,让 AI 帮你写方法、写脚本。这一层数据确实过了网,进入了服务方的请求链路。

结论:这一层只喂脱敏的假数据。改字段名、把真实姓名换成「张三」、金额乘以随机系数,都行。目的是让它理解结构,不是让它看到真值。

第二层:执行层(实际处理)

写好的脚本、工具在你自己机器上跑,读本地文件、写本地目录。这一层不出网,断网也能运行。

关键原则:敏感的事让 AI 想办法,别让 AI 碰真数据。

第三层:存储层(结果落盘)

结果保存到哪里,同样决定了风险。

怎么判断一个工具到底联不联网

  1. 断网测试:关掉 WiFi / 拔网线再跑,能正常运行基本就是纯本地
  2. 看隐私政策:出现「上传」「云端处理」「用于模型训练」这类字样要警惕
  3. 流量监控:运行时观察有没有对外请求(Windows 可用资源监视器)

这三条比任何宣传语都可靠。

企业环境的现实约束

很多单位有明文规定禁止向外部服务传输工作数据。本地工具天然不触碰这条红线,报备流程也简单得多。

总结

  1. 把「让 AI 想方法」和「让程序去跑」分开,前者用假数据,后者在本地
  2. 敏感数据只在本机流转,断网可运行是硬性验收项
  3. 警惕在线转换类网站,那是最常见的泄露入口
  4. 选工具时先问一句:它断网能不能跑?

我处理工资、客户资料时用的工具是本地跑的(ExcelRouter,开源 MIT):

GitHub:https://github.com/MarsandSea/ExcelRouter

Gitee 镜像:https://gitee.com/Marsandsea/Excelrouter

文中提到的工具:ExcelRouter

把一个或一整批 Excel 按部门、区域、工号等字段拆成多个文件,完整保留复杂表头与格式, 可再按人二级拆分并打包 ZIP。Windows + 银河麒麟 / 统信 UOS,免费开源(MIT), 全程本机处理,不联网、不上传。

下载(国内 · Gitee) GitHub 源码 ⭐