LCH.LEGAL

Обучение LLM на чужих данных — судебное решение в США

23 июня 2025 г. судья Уильям Алсуп вынес первое прецедентное решение по обучению генеративных языковых моделей на книгах, защищённых авторским правом. Дело Bartz v. Anthropic впервые вывело в судебную плоскость ключевой вопрос: допускается ли использование текстов без согласия правообладателя для тренировки ИИ?

Решение ясно определяет: не любое нарушение исключительных прав «исцеляется» трансформативной целью, то есть использованием для создания нового и не похожего на исходный продукт. Каждый этап — сбор, хранение, обучение, вывод должен быть юридически обоснован сам по себе.

➡ Рассказывает Кирилл Ляхманов, Советник, Руководитель практики IP/IT 

Что решил суд в США

➡ Обучение моделей — допустимо, если модель не воспроизводит источник данных 1 в 1

Суд признал использование книг в обучении модели Claude допустимым на основании fair use. Обучение признано трансформативным: модели не выдавали пользователям фрагменты произведений, а сам процесс обучения сопоставим с чтением книги человеком.

➡  Оцифровка купленных книг допустима при соблюдении условий

Anthropic имела право оцифровать легально приобретённые бумажные книги, если цифровая копия:
🔘заменяла оригинал в пропорции 1:1,
🔘не распространялась,
🔘использовалась только для обучения.

В этом суд руководствовался "доктриной первой продажи", которая позволяет покупателю книги использовать ее любым способом, кроме создания новых экземпляров книги. Чтобы соответствовать требованиям доктрины, Anthropic вырезали страницы из книг, а после оцифровки - сжигали, что добавляет кейсу чуточку антиутопичности.

➡  Использование пиратских копий — нарушение

Anthropic скачала более 7 млн книг с Books3, LibGen и PiLiMi, сохранив их в “исследовательской библиотеке”. Суд признал это нарушением:
🔘источник данных имеет значение,
🔘отложенное трансформативное использование не оправдывает изначальное копирование,
🔘хранение «навсегда» подрывает рыночную ценность произведений.

Что это значит на практике

✔ Сам продукт может быть чистым, но цепочка его создания может нарушать чужие права

Claude не нарушает права авторов напрямую. Но суд признал, что обучение на нелегальных данных влечёт ответственность — независимо от итогового результата.

🔹Риск: легальность модели не отменяет незаконность использования пиратских данных.

✔ Источник данных это критически важный элемент правовой оценки

Купленные книги допустимо использовать для обучения модели, а пиратские копии - уже нет.

🔹Риск: юридическая чистота датасета важна на каждом этапе, включая «неиспользуемые» элементы.

✔ Fair use не «искупает» нарушения, которые допущены на этапе обучения

Суд отверг позицию «позже будет трансформативное использование — значит, можно копировать заранее».

🔹Риск: нарушение фиксируется в момент доступа к произведению, а не его использования.

✔ Вопрос об ответах модели оставлен открытым

Суд указал: если в будущем появятся признаки утечек или воспроизведения фрагментов книг в ответах модели, это будет новое основание для иска.

А что в России?

🔘Fair use отсутствует
Ст. 1270 ГК РФ требует согласия правообладателя на любое использование произведения, за исключением узкого перечня. Исключений для ИИ в российском законодательстве нет.

🔘Оцифровка купленных книг — нарушение
Даже если книга куплена легально, сканирование для последующего машинного анализа считается воспроизведением. Исключение о личном использовании не применимо.

🔘Использование пиратских источников — квалифицированное нарушение
Даже при отсутствии коммерческой выгоды и публичного распространения. Возможны иски о компенсации до 5 млн рублей за каждое произведение (ст. 1301 ГК РФ), административные и уголовные меры.

🔘Продукт, обученный на пиратских данных, может быть законным, но это не снимает ответственность за pipeline
Ответственность накапливается не только за результат, но и за процесс. Суд может квалифицировать действия как нарушение исключительных прав, даже если в ответах модели нет воспроизведения объектов, на которых она обучалась.