Американские учёные открыли явление "затухания атрибуции" в генеративных моделях искусственного интеллекта.
➡️ Чем больше данных используют для обучения ИИ, тем меньшее значение имеет каждый конкретный элемент в этом массиве для результата генерации. Если объём данных достаточно большой, можно удалить даже все работы определённого художника, и картинка, созданная моделью, не изменится.
Доказать это было сложно. Тогда учёные предложили "диффузионный ансамбль" — архитектуру из множества мелких компонентов, каждый из которых обучен на своём фрагменте данных. Это позволило отключать влияние отдельных изображений. Опыты показали, что чем больше обучающий набор данных, тем меньше "контрфактический радиус" — то есть максимальное влияние отдельного элемента.
🔴 С юридической стороны это открытие говорит о том, что ИИ-модели проявляют творческий подход, а не копируют исходные материалы. Если результаты генерации не имеют ничего общего с отдельными элементами из обучающего массива, то использование такого контента, даже защищённого авторским правом, считается добросовестным. Правда, на языковых моделях этот подход пока не проверяли.
✈️ «Архипелаг БИГТЕХ»
➡️ Чем больше данных используют для обучения ИИ, тем меньшее значение имеет каждый конкретный элемент в этом массиве для результата генерации. Если объём данных достаточно большой, можно удалить даже все работы определённого художника, и картинка, созданная моделью, не изменится.
Доказать это было сложно. Тогда учёные предложили "диффузионный ансамбль" — архитектуру из множества мелких компонентов, каждый из которых обучен на своём фрагменте данных. Это позволило отключать влияние отдельных изображений. Опыты показали, что чем больше обучающий набор данных, тем меньше "контрфактический радиус" — то есть максимальное влияние отдельного элемента.
🔴 С юридической стороны это открытие говорит о том, что ИИ-модели проявляют творческий подход, а не копируют исходные материалы. Если результаты генерации не имеют ничего общего с отдельными элементами из обучающего массива, то использование такого контента, даже защищённого авторским правом, считается добросовестным. Правда, на языковых моделях этот подход пока не проверяли.
✈️ «Архипелаг БИГТЕХ»