Обучение ИИ на охраняемых материалах. Часть 2. Аргументы ПРОТИВМы остановились на том, что ИИ модель и обучающий датасет могут нарушать права на чужую IP.
Что в этой части можно сказать?
В России по поводу обучения ИИ и его правомерности "мало что сказано и сделано".
Поэтому для понимания вопроса и возможных развилок приходится обращаться к зарубежному опыту. Обычно в этом плане выделяют США, Европу и Японию:
1⃣ В США есть
fair use (исключение, допускающее использование чужого IP без согласия правообладателя), и оно может покрывать обучение ИИ.
2⃣ В Европе есть своя версия исключений -
Text and Data Mining.
3⃣ В Японии обучение считается
Non-Enjoyment use и не подпадает под монополию правообладателя (то есть не является использованием в юридическом понимании).
Но, как говорится, есть нюанс. А юристам важно знать нюансы.
✳ Fair use (США)Fair use - это (упрощенно) американская версия исключений из монополии правообладателя.
У Fair use есть критерии (факторы), а у них - подкритерии. Одним из подкритериев является критерий
трансформативности (видоизменяет ли новое произведение первое с новым выражением, смыслом или посылом).
Он не единственный, но очень важный. Без него тест может быть не пройден, а нарушение установлено.
По
мнению Бюро авторского права США, обучение модели GenAI на больших и разнообразных наборах данных часто является трансформативным.
Но тут же Бюро оговаривается.
Преобразующий характер зависит от цели. Обучение модели для исследовательских целей или для выполнения узкой, не подменяющей задачи (например, модерация контента) - более преобразующее. Обучение модели для генерации контента, очень похожего на оригинальные работы (например, изображений в стиле популярного мультсериала), - наименее преобразующее и вряд ли будет считаться добросовестным использованием.
В общем в США все не так однозначно. Идем дальше.
✳ Text and Data Mining (Европа)
Тут вообще много вопросов, но начнем по порядку. Вот что пишут о TDM в исследовании по заказу
Европейского парламента:Традиционный TDM определяется как аналитический метод, направленный на извлечение информации, закономерностей или корреляций. Напротив, обучение генеративного ИИ — это принципиально иной процесс, представляющий собой синтез и экспрессивное воспроизведение, а не просто извлечение фактов или знаний.
Иными словами, они указывают, что деятельность GenAI - это не только анализ, но и последующее воспроизведение, которое не покрывается исключением TDM.
Европейский парламент обращает внимание, что это последовательная позиция и в
2014, и в
2016 годах об GenAI даже не думали.
Ведомство интеллектуальной собственности ЕС в этой части
отмечает:Основная точка зрения в юридической литературе заключается в том, что TDM может включать процесс обучения ИИ, но не генерацию выходных данных
На самом деле этим проблемы TDM не ограничиваются. Есть еще странный opt-out, непонятный законный доступ, вопросы к скоупу TDM по субъектному составу. Но главный тут вывод - в Европе все также неоднозначно.
Остается Япония, но ее я не смог уместить в пост, так что расскажу об этом в другой раз. Тем более что есть более интересный способ послушать мои (и не только) аргументы -
AI: БАТТЛ "АВТОРЫ vs ИИ".
Жду Вас!