用 AI 处理敏感数据前,先分清这三层的边界
问题的本质
「AI 会不会泄露我的数据」这个问题问得太笼统。把它拆成三层,答案就清楚了:数据在哪一层,决定了它有没有出网。
第一层:模型层(生成建议)
你把数据贴进对话框,让 AI 帮你写方法、写脚本。这一层数据确实过了网,进入了服务方的请求链路。
结论:这一层只喂脱敏的假数据。改字段名、把真实姓名换成「张三」、金额乘以随机系数,都行。目的是让它理解结构,不是让它看到真值。
第二层:执行层(实际处理)
写好的脚本、工具在你自己机器上跑,读本地文件、写本地目录。这一层不出网,断网也能运行。
关键原则:敏感的事让 AI 想办法,别让 AI 碰真数据。
第三层:存储层(结果落盘)
结果保存到哪里,同样决定了风险。
- 保存在本地目录 → 风险等价于你本地磁盘的安全策略
- 保存到网盘 / 在线文档 → 又回到「出网」
- 上传到在线转换网站 → 这层最危险,很多在线工具会把文件留存
怎么判断一个工具到底联不联网
- 断网测试:关掉 WiFi / 拔网线再跑,能正常运行基本就是纯本地
- 看隐私政策:出现「上传」「云端处理」「用于模型训练」这类字样要警惕
- 流量监控:运行时观察有没有对外请求(Windows 可用资源监视器)
这三条比任何宣传语都可靠。
企业环境的现实约束
很多单位有明文规定禁止向外部服务传输工作数据。本地工具天然不触碰这条红线,报备流程也简单得多。
总结
- 把「让 AI 想方法」和「让程序去跑」分开,前者用假数据,后者在本地
- 敏感数据只在本机流转,断网可运行是硬性验收项
- 警惕在线转换类网站,那是最常见的泄露入口
- 选工具时先问一句:它断网能不能跑?
我处理工资、客户资料时用的工具是本地跑的(ExcelRouter,开源 MIT):
文中提到的工具:ExcelRouter
把一个或一整批 Excel 按部门、区域、工号等字段拆成多个文件,完整保留复杂表头与格式, 可再按人二级拆分并打包 ZIP。Windows + 银河麒麟 / 统信 UOS,免费开源(MIT), 全程本机处理,不联网、不上传。
下载(国内 · Gitee) GitHub 源码 ⭐