为什么需要这份清单
把代码贴给 AI 很方便,但代码里常常夹带敏感信息。一旦外泄,回收成本极高。这份清单用于在「提效」和「安全」之间划出可执行的边界。
一、绝对不要粘贴的内容
- 密钥、令牌、私钥、证书内容
- 数据库连接串、内网地址、账号密码
- 真实用户数据(手机号、身份证、地址、订单记录等)
- 未公开的商业逻辑核心算法(如涉密项目)
- 含保密条款的第三方代码
原则:凡是「贴出去后无法撤回」的内容,都不要贴。
二、粘贴前的脱敏步骤
- 替换标识符:把真实域名、库名、账号替换为占位符(如
example.com、DB_MAIN) - 删除配置段:配置、环境变量、注释里的内部地址优先删掉
- 保留结构:脱敏时尽量保留代码结构与命名风格,否则模型难以判断问题
- 最小化:只贴与问题相关的文件,不要整个目录打包
一个实用做法:脱敏后自己再读一遍,确认看不出属于哪个项目。
三、评估工具的数据策略
接入前逐项确认(通常在隐私政策或服务条款里):
- 提交的内容是否用于模型训练
- 数据保留多久、是否可以删除
- 是否支持「不训练」或企业版隔离
- 数据存储在哪个地区
强合规行业(金融、医疗、政企):优先选择支持私有化部署或明确保证不用于训练的方案。
四、团队层面的建议
- 明确一份「允许/禁止」清单,写进开发规范
- 代码审查时把「是否泄露敏感信息」纳入检查项
- 定期扫描仓库,避免密钥被误贴(密钥本身就不应入库)
小结
AI 能显著提高开发效率,但边界要提前划好。记住三句话:密钥不贴、用户数据不贴、贴前脱敏。做到这三点,绝大多数风险都可避免。