// 维基 · 分析 · 2026 年 9 月
在秘密与个人数据上训练AI
文章草稿。规则截至 2026 年 9 月;具体数据集的评估始终取决于数据构成。
供讨论的草稿。本文区分三种情形:在自己的公司数据上训练、在个人数据上训练、在受法律保护的秘密上训练——各有各的条件。
简短回答
在公司内部数据上训练模型是允许的——只要数据不离开受控环境,就不构成披露。条件有三:数据本身合法取得、环境封闭(自有服务器或约定的企业服务)、“记住”风险受控:模型可能记住片段并将其提供给外人。个人数据增加第152号联邦法的要求;受保护秘密增加各自法律的要求。
公司秘密
只要训练在封闭环境中进行,处于商业秘密制度下的自有信息仍受保护:传输至受控资源不构成披露;而上传到公共服务已被实践等同于披露(第 02-1545/2026 号案件, 关于秘密的札记)。NDA 下的第三方数据是另一个问题:除非合同明确允许,“处理”之权不包含“训练模型”之权;措辞值得核查并写入新的保密协议。训练之后秘密制度并不消失:能够复现秘密的权重同样是受保护信息。
个人数据
- 处理依据。 训练模型是新目的:为某项任务收集的个人数据不能默默投入数据集;需要同意、去标识化或其他合法依据。
- 本地化: 在俄罗斯境内的服务器上训练;境外云平台引入跨境传输问题。
- 数据主体的权利: 已训练模型按请求删除在技术上困难——这支持在进入样本前去标识化,并将对应表与数据集分开保存。
- 运营者的文件 应如实描述此类处理:“内部模型训练”应列为处理目的之一。
受法律保护的秘密
国家、律师、医疗、银行等秘密各有其制度。总原则:模型不是责任主体,运营者负责;凡制度允许以组织自身手段处理的,封闭环境中的处理即可行;凡法律要求特别渠道或同意的,即被禁止。对职业秘密,带按需知密的内部环境通常与制度兼容;对国家秘密——只有经认证的环境。
记忆风险
大模型能逐字复现训练数据的片段。对秘密和个人数据而言这是泄露渠道:会提问的人可以引出被记住的内容。措施:训练前过滤和去标识化数据集、限制对模型本身的访问(环境不仅关乎训练,也关乎使用)、发布前做提取测试、监控查询。
检查清单
- 进入训练的数据类别清单及各类别的依据;
- 环境:在哪里训练、在哪里运行、谁有权接触权重;
- 个人数据:同意或去标识化;本地化;在运营者文件中体现;
- 与伙伴的保密协议:是否含有训练权;
- 每次发布前的“模型能吐出什么”测试。