Обучение LLM на чужих данных — судебное решение в США
г.
г.
23 июня 2025 г. судья Уильям Алсуп вынес первое прецедентное решение по обучению генеративных языковых моделей на книгах, защищённых авторским правом. Дело Bartz v. Anthropic впервые вывело в судебную плоскость ключевой вопрос: допускается ли использование текстов без согласия правообладателя для тренировки ИИ?
Решение ясно определяет: не любое нарушение исключительных прав «исцеляется» трансформативной целью, то есть использованием для создания нового и не похожего на исходный продукт. Каждый этап — сбор, хранение, обучение, вывод должен быть юридически обоснован сам по себе.
➡ Рассказывает Кирилл Ляхманов, Советник, Руководитель практики IP/IT
Что решил суд в США
➡ Обучение моделей — допустимо, если модель не воспроизводит источник данных 1 в 1
Суд признал использование книг в обучении модели Claude допустимым на основании fair use. Обучение признано трансформативным: модели не выдавали пользователям фрагменты произведений, а сам процесс обучения сопоставим с чтением книги человеком.
➡ Оцифровка купленных книг допустима при соблюдении условий
Anthropic имела право оцифровать легально приобретённые бумажные книги, если цифровая копия: 🔘заменяла оригинал в пропорции 1:1, 🔘не распространялась, 🔘использовалась только для обучения.
В этом суд руководствовался "доктриной первой продажи", которая позволяет покупателю книги использовать ее любым способом, кроме создания новых экземпляров книги. Чтобы соответствовать требованиям доктрины, Anthropic вырезали страницы из книг, а после оцифровки - сжигали, что добавляет кейсу чуточку антиутопичности.
➡ Использование пиратских копий — нарушение
Anthropic скачала более 7 млн книг с Books3, LibGen и PiLiMi, сохранив их в “исследовательской библиотеке”. Суд признал это нарушением: 🔘источник данных имеет значение, 🔘отложенное трансформативное использование не оправдывает изначальное копирование, 🔘хранение «навсегда» подрывает рыночную ценность произведений.
Что это значит на практике
✔ Сам продукт может быть чистым, но цепочка его создания может нарушать чужие права
Claude не нарушает права авторов напрямую. Но суд признал, что обучение на нелегальных данных влечёт ответственность — независимо от итогового результата.
🔹Риск: легальность модели не отменяет незаконность использования пиратских данных.
✔ Источник данных это критически важный элемент правовой оценки
Купленные книги допустимо использовать для обучения модели, а пиратские копии - уже нет.
🔹Риск: юридическая чистота датасета важна на каждом этапе, включая «неиспользуемые» элементы.
✔ Fair use не «искупает» нарушения, которые допущены на этапе обучения
Суд отверг позицию «позже будет трансформативное использование — значит, можно копировать заранее».
🔹Риск: нарушение фиксируется в момент доступа к произведению, а не его использования.
✔ Вопрос об ответах модели оставлен открытым
Суд указал: если в будущем появятся признаки утечек или воспроизведения фрагментов книг в ответах модели, это будет новое основание для иска.
А что в России?
🔘Fair use отсутствует Ст. 1270 ГК РФ требует согласия правообладателя на любое использование произведения, за исключением узкого перечня. Исключений для ИИ в российском законодательстве нет.
🔘Оцифровка купленных книг — нарушение Даже если книга куплена легально, сканирование для последующего машинного анализа считается воспроизведением. Исключение о личном использовании не применимо.
🔘Использование пиратских источников — квалифицированное нарушение Даже при отсутствии коммерческой выгоды и публичного распространения. Возможны иски о компенсации до 5 млн рублей за каждое произведение (ст. 1301 ГК РФ), административные и уголовные меры.
🔘Продукт, обученный на пиратских данных, может быть законным, но это не снимает ответственность за pipeline Ответственность накапливается не только за результат, но и за процесс. Суд может квалифицировать действия как нарушение исключительных прав, даже если в ответах модели нет воспроизведения объектов, на которых она обучалась.