// вики · разбор · сентябрь 2026
Обучение модели на чужих произведениях
Проект статьи. Описание норм закона о поддержке ИИ — по публичным сообщениям лета 2026 года; перед публикацией сверяется с официальным текстом.
Черновик для обсуждения. Тезисы статьи — карта вопроса, а не заключение о законности конкретного датасета: оценка всегда зависит от состава данных и цепочки их получения.
Короткий ответ
Обучение модели на чужом произведении — это его использование, и по общему правилу нужно согласие правообладателя. Общего исключения «для машинного обучения» в ГК РФ нет. Закон о поддержке технологий ИИ 2026 года смягчил ситуацию, но узко: без согласия можно анализировать легально полученные материалы из свободного доступа — и только для обучения определённых в законе («суверенных») систем. Для остальных случаев датасет собирают легально: лицензии, покупка данных, синтетика.
Что говорит ГК сегодня
Статья 1273 ГК РФ разрешает свободное воспроизведение произведения для личных нужд гражданина-пользователя — обучение коммерческой модели под эту норму не подводится: цель не личная, а пользователь обычно не тот, кто обучает модель. Статья 1274 перечисляет случаи свободного использования (цитирование, пародия, учебные цели и другие) — обучения ИИ-систем в перечне нет. Всё, что вне списка, — по согласию правообладателя (лицензия).
Что меняет закон о поддержке ИИ
По сообщениям лета 2026 года, закон о поддержке развития технологий ИИ (законопроект № 1271570-8) разрешает разработчикам работать с чужими произведениями без согласия правообладателей — извлекать данные, сопоставлять и анализировать материал — при одновременном соблюдении трёх условий:
- экземпляр произведения получен легально;
- материал находится в свободном доступе;
- материал нужен только для обучения суверенных ИИ-систем (в публичном обсуждении примеры — крупные российские модели).
Что из этого следует практически: во-первых, исключение не универсально — продукт на базе зарубежной модели или модель для узкого внутреннего сервиса под формулировку о «суверенных системах» может не подпадать; во-вторых, разрешение на анализ не то же самое, что право хранить копии и воспроизводить датасет. Пока статья закона не применялась публичной практикой, консервативный подход — собирать датасет так, будто исключения нет.
Данные — не только произведения
Не всё в датасете — произведение, и у не-произведений свои режимы:
- Персональные данные — 152-ФЗ: цели и основания обработки, а при попадании в модель — вопросы удаления и локализации.
- Базы данных — изготовитель базы пользуется смежным правом (ст. 1333–1334 ГК РФ): выгрузка существенной части чужой базы нарушает это право, даже если отдельные факты не охраняются.
- Секреты — датасет из внутренних данных компании подчиняется режиму коммерческой тайны и NDA с партнёрами.
Риски
- Иск правообладателя — компенсация без доказывания убытков от 10 тысяч до 5 миллионов рублей за каждый объект (ст. 1301 ГК РФ), при крупном датасете — арифметика против вас.
- Остановка продукта — суд может запретить использование модели, обученной на спорных данных; переобучение стоит дороже спора.
- Проблема в сделке — при инвестициях или продаже компании датасет без истории происхождения становится красным флагом due diligence: ср. «Due diligence ИИ-актива».
Журнал происхождения данных
Рабочий инструмент управления рисками — вести по каждому датасету журнал: источник и способ получения, лицензия или согласие (с реквизитами), ограничения использования, дата выгрузки, объём. Он же отвечает на вопросы юристов контрагента и регулятора. Дополняют журнал: лицензии у правообладателей и площадок, покупка готовых датасетов с проверенной лицензией, синтетические данные там, где это допустимо, и фильтрация персональных данных до попадания в выборку.
Проверка датасета и условий обучения модели — задача практики прав на технологии; состав проверки под конкретный продукт команда определяет после обращения.