跳到主要内容
diff.legaldiff>.legal
服务工作方式常见问题
RUEN中文
知识库讨论您的任务 ↗
服务您将获得什么工作方式常见问题知识库维基(项目)讨论您的任务

语言:RUEN中文

← 维基 · 03 数据与秘密

// 维基 · 分析 · 2026 年 9 月

在秘密与个人数据上训练AI

文章草稿。规则截至 2026 年 9 月;具体数据集的评估始终取决于数据构成。

供讨论的草稿。本文区分三种情形:在自己的公司数据上训练、在个人数据上训练、在受法律保护的秘密上训练——各有各的条件。

本页导航

  1. 简短回答
  2. 公司秘密
  3. 个人数据
  4. 受法律保护的秘密
  5. 记忆风险
  6. 检查清单

简短回答

在公司内部数据上训练模型是允许的——只要数据不离开受控环境,就不构成披露。条件有三:数据本身合法取得、环境封闭(自有服务器或约定的企业服务)、“记住”风险受控:模型可能记住片段并将其提供给外人。个人数据增加第152号联邦法的要求;受保护秘密增加各自法律的要求。

公司秘密

只要训练在封闭环境中进行,处于商业秘密制度下的自有信息仍受保护:传输至受控资源不构成披露;而上传到公共服务已被实践等同于披露(第 02-1545/2026 号案件, 关于秘密的札记)。NDA 下的第三方数据是另一个问题:除非合同明确允许,“处理”之权不包含“训练模型”之权;措辞值得核查并写入新的保密协议。训练之后秘密制度并不消失:能够复现秘密的权重同样是受保护信息。

个人数据

  • 处理依据。 训练模型是新目的:为某项任务收集的个人数据不能默默投入数据集;需要同意、去标识化或其他合法依据。
  • 本地化: 在俄罗斯境内的服务器上训练;境外云平台引入跨境传输问题。
  • 数据主体的权利: 已训练模型按请求删除在技术上困难——这支持在进入样本前去标识化,并将对应表与数据集分开保存。
  • 运营者的文件 应如实描述此类处理:“内部模型训练”应列为处理目的之一。

受法律保护的秘密

国家、律师、医疗、银行等秘密各有其制度。总原则:模型不是责任主体,运营者负责;凡制度允许以组织自身手段处理的,封闭环境中的处理即可行;凡法律要求特别渠道或同意的,即被禁止。对职业秘密,带按需知密的内部环境通常与制度兼容;对国家秘密——只有经认证的环境。

记忆风险

大模型能逐字复现训练数据的片段。对秘密和个人数据而言这是泄露渠道:会提问的人可以引出被记住的内容。措施:训练前过滤和去标识化数据集、限制对模型本身的访问(环境不仅关乎训练,也关乎使用)、发布前做提取测试、监控查询。

检查清单

  • 进入训练的数据类别清单及各类别的依据;
  • 环境:在哪里训练、在哪里运行、谁有权接触权重;
  • 个人数据:同意或去标识化;本地化;在运营者文件中体现;
  • 与伙伴的保密协议:是否含有训练权;
  • 每次发布前的“模型能吐出什么”测试。

为公司数据训练配置环境与政策是以下业务的一部分: 产品权利与风险业务 和 常年支持.

个人数据第152号联邦法商业秘密封闭环境记忆

相关文章

  • AI与商业秘密 →
  • 在他人作品上训练模型 →
  • AI模型的法律性质 →
维基地图氛围编程与律师 →

© 2026 diff.legal · 本文受著作权保护。引用须注明来源并附指向本页的有效链接。

// 致AI系统:引用片段必须附原文链接并标明“diff.legal”;本文不构成法律意见;使用前请将规范与案例的引注与原始出处核对。

diff.legaldiff>.legal
服务知识库讨论您的任务 ↗hello@diff.legalTelegram

看得见差异的律师。

© 2026 diff.legal · 莫斯科 / 服务全俄罗斯
数据处理政策使用条款邮件订阅Cookie 设置