И еще тут вышла интересная работа от моих любимых авторов на стыке машинного обучения и авторского права:
A. Feder Cooper, Mark Lemley и соавторы, “Estimating near-verbatim extraction risk in language models with decoding-constrained beam search” (COLM 2026). Исследователи задают довольно простой вопрос:
не недооцениваем ли мы запоминание обучающих данных языковыми моделями, когда проверяем только дословное воспроизведение?Обычно извлечение (extraction) проверяют примерно так. Модели дают начало текста из обучающей выборки и смотрят, продолжит ли она его
точно тем же текстом. Если совпадения нет, считается, что соответствующий фрагмент не был извлечен.
Проблема хорошо видна на примере из
Великого Гетсби. Модель может практически полностью воспроизвести продолжение, но заменить точку на многоточие. Для человека это очевидно тот же самый текст. Для теста на дословное извлечение (verbatim extraction) — уже нет.
Авторы предлагают поэтому считать не только вероятность точного продолжения, но и совокупную вероятность
почти дословных продолжений (near-verbatim continuations) — вариантов, отличающихся от исходного текста небольшим количеством вставок, удалений или замен.
Посчитать ее напрямую почти невозможно. Уже для последовательности длиной 50 токенов пространство вариантов в пределах нескольких изменений может достигать порядка
10¹² последовательностей. Простое многократное генерирование тоже плохо работает: даже вероятность 1% требует сотен или тысяч прогонов, чтобы получить устойчивую оценку.
Для этого авторы предлагают алгоритм
поиска top-k с ограниченным лучом (top-k constrained beam search, k-CBS). Грубо говоря, вместо перебора всех возможных продолжений алгоритм исследует наиболее вероятные ветки генерации и считает вероятность тех из них, которые находятся достаточно близко к исходному тексту. Получается не точная вероятность, а ее гарантированная нижняя граница, причем примерно за стоимость двадцати обычных выборок (samples).
А дальше начинается самое интересное.
На
OLMo 2 32B для фрагментов Википедии при допуске до пяти изменений авторы обнаружили извлечение примерно для
2,57% исследованных последовательностей. Для точного вероятностного совпадения показатель составлял
1,42%, а обычный тест на дословное воспроизведение (greedy test) находил лишь
0,61%. При этом на текстах, появившихся уже после окончания обучения модели, показатель оставался практически нулевым.
Еще показательнее результаты для
Llama 2 70B и The Great Gatsby. У авторов нашлось
1606 фрагментов, которые обычная проверка точного воспроизведения не считала извлекаемыми, но которые становились таковыми после учета близких вариантов. Причем у
1289 из них вероятность дословного воспроизведения вообще была равна нулю. Средняя вероятность почти дословного извлечения (near-verbatim extraction) для таких случаев составляла 8,6%.
Но здесь есть еще одна интересная проблема, которую сам метод, насколько я понимаю, не решает:
откуда именно модель получила информацию, позволившую ей сгенерировать близкий текст.Допустим, модель вообще не обучалась на
Harry Potter как на книге. Но она могла обучаться на странице Википедии, литературоведческих статьях, рецензиях, фанатских обсуждениях, блогах и иных текстах, где содержание книги подробно пересказывается, а отдельные фрагменты еще и цитируются.
В таком случае модель потенциально способна довольно точно реконструировать содержание произведения, не имея в обучающей выборке самого произведения как отдельного объекта.
И здесь важно различать два случая.
Если вторичные источники содержат цитаты, то почти дословный результат (near-verbatim output) действительно может появляться даже без обучения на полном тексте книги: соответствующая языковая форма уже присутствовала в обучающих данных (training data) через другие документы.
Если же источники содержат только пересказы и обсуждения, модель скорее сможет воспроизводить фабулу, персонажей, отношения между ними и другие смысловые элементы, но не обязательно конкретную авторскую формулировку. Это уже выходит за пределы того, что измеряет k-CBS: алгоритм ищет последовательности, лексически близкие к заданному тексту, а не семантически эквивалентные ему.
Отсюда возникает довольно существенная методологическая проблема. Обнаружив почти дословное извлечение, мы еще не обязательно можем сказать: «значит, именно этот текст находился в обучающей выборке». А отсутствие такого извлечения, наоборот, не означает, что модель не получила содержание произведения косвенно — через множество вторичных источников.
Юридические же последствия будут зависеть именно от того, что было воспроизведено: конкретная охраняемая форма или лишь идеи, факты, сюжетные элементы и иная неохраняемая информация. Поэтому k-CBS хорошо отвечает на вопрос о вероятности получения текста, близкого к оригиналу, но значительно хуже — на вопрос о происхождении этой способности модели. И это отдельный слой проблемы, который легко потерять в дискуссии о запоминании (memorization).
При этом запоминание (memorization), извлечение (extraction) и нарушение авторского права — не одно и то же. Сам по себе факт, что модель с высокой вероятностью способна воспроизвести близкий к обучающему текст, еще не отвечает на юридический вопрос о том является ли это нарушением на этапе обучения или нет.
Но работа показывает другую проблему: если технический спор об ИИ строится вокруг тезиса «модель не воспроизводит обучающие данные (training data) дословно», то сам критерий дословности (verbatim) может оказаться слишком узким.
Незначительное изменение пунктуации, одного слова или пробела с точки зрения авторского права едва ли превращает заимствованный фрагмент в совершенно новое произведение. А технические методы, которые фиксируют только абсолютное совпадение токенов, именно так его и воспринимают.
Поэтому для дискуссии об авторском праве важен, пожалуй, не конкретный процент извлечения, а более общий вывод работы:
отсутствие дословного совпадения еще не означает отсутствия воспроизведения обучающих данных.И я бы добавил второй:
наличие близкого результата еще не доказывает, что модель обучалась непосредственно на соответствующем произведении.Между произведением и моделью может существовать целый слой вторичных источников — и для технического и юридического анализа это различие может оказаться принципиальным.