Фиктивный Марат


Гео и язык канала: Россия, Русский
Категория: Право


Меня зовут Марат, и я – это фикция, дихотомия, суперпозиция.
Будни студента-юриста и портретного фотографа
Автор: @mabeaverat

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Право
Статистика
Фильтр публикаций


Что за легенда на законеру


Репост из: Закон.ру
Данила Малов предлагает разобрать проект реформы суда присяжных и постараться определиться принесёт ли она пользу правосудию или поставит под удар его независимость.


Репост из: Legal Elysium
И еще тут вышла интересная работа от моих любимых авторов на стыке машинного обучения и авторского права: A. Feder Cooper, Mark Lemley и соавторы, “Estimating near-verbatim extraction risk in language models with decoding-constrained beam search” (COLM 2026).
Исследователи задают довольно простой вопрос: не недооцениваем ли мы запоминание обучающих данных языковыми моделями, когда проверяем только дословное воспроизведение?

Обычно извлечение (extraction) проверяют примерно так. Модели дают начало текста из обучающей выборки и смотрят, продолжит ли она его точно тем же текстом. Если совпадения нет, считается, что соответствующий фрагмент не был извлечен.
Проблема хорошо видна на примере из Великого Гетсби. Модель может практически полностью воспроизвести продолжение, но заменить точку на многоточие. Для человека это очевидно тот же самый текст. Для теста на дословное извлечение (verbatim extraction) — уже нет.
Авторы предлагают поэтому считать не только вероятность точного продолжения, но и совокупную вероятность почти дословных продолжений (near-verbatim continuations) — вариантов, отличающихся от исходного текста небольшим количеством вставок, удалений или замен.
Посчитать ее напрямую почти невозможно. Уже для последовательности длиной 50 токенов пространство вариантов в пределах нескольких изменений может достигать порядка 10¹² последовательностей. Простое многократное генерирование тоже плохо работает: даже вероятность 1% требует сотен или тысяч прогонов, чтобы получить устойчивую оценку.

Для этого авторы предлагают алгоритм поиска top-k с ограниченным лучом (top-k constrained beam search, k-CBS). Грубо говоря, вместо перебора всех возможных продолжений алгоритм исследует наиболее вероятные ветки генерации и считает вероятность тех из них, которые находятся достаточно близко к исходному тексту. Получается не точная вероятность, а ее гарантированная нижняя граница, причем примерно за стоимость двадцати обычных выборок (samples).
А дальше начинается самое интересное.

На OLMo 2 32B для фрагментов Википедии при допуске до пяти изменений авторы обнаружили извлечение примерно для 2,57% исследованных последовательностей. Для точного вероятностного совпадения показатель составлял 1,42%, а обычный тест на дословное воспроизведение (greedy test) находил лишь 0,61%. При этом на текстах, появившихся уже после окончания обучения модели, показатель оставался практически нулевым.
Еще показательнее результаты для Llama 2 70B и The Great Gatsby. У авторов нашлось 1606 фрагментов, которые обычная проверка точного воспроизведения не считала извлекаемыми, но которые становились таковыми после учета близких вариантов. Причем у 1289 из них вероятность дословного воспроизведения вообще была равна нулю. Средняя вероятность почти дословного извлечения (near-verbatim extraction) для таких случаев составляла 8,6%.

Но здесь есть еще одна интересная проблема, которую сам метод, насколько я понимаю, не решает: откуда именно модель получила информацию, позволившую ей сгенерировать близкий текст.
Допустим, модель вообще не обучалась на Harry Potter как на книге. Но она могла обучаться на странице Википедии, литературоведческих статьях, рецензиях, фанатских обсуждениях, блогах и иных текстах, где содержание книги подробно пересказывается, а отдельные фрагменты еще и цитируются.
В таком случае модель потенциально способна довольно точно реконструировать содержание произведения, не имея в обучающей выборке самого произведения как отдельного объекта.

И здесь важно различать два случая.
Если вторичные источники содержат цитаты, то почти дословный результат (near-verbatim output) действительно может появляться даже без обучения на полном тексте книги: соответствующая языковая форма уже присутствовала в обучающих данных (training data) через другие документы.

Если же источники содержат только пересказы и обсуждения, модель скорее сможет воспроизводить фабулу, персонажей, отношения между ними и другие смысловые элементы, но не обязательно конкретную авторскую формулировку. Это уже выходит за пределы того, что измеряет k-CBS: алгоритм ищет последовательности, лексически близкие к заданному тексту, а не семантически эквивалентные ему.

Отсюда возникает довольно существенная методологическая проблема. Обнаружив почти дословное извлечение, мы еще не обязательно можем сказать: «значит, именно этот текст находился в обучающей выборке». А отсутствие такого извлечения, наоборот, не означает, что модель не получила содержание произведения косвенно — через множество вторичных источников.

Юридические же последствия будут зависеть именно от того, что было воспроизведено: конкретная охраняемая форма или лишь идеи, факты, сюжетные элементы и иная неохраняемая информация. Поэтому k-CBS хорошо отвечает на вопрос о вероятности получения текста, близкого к оригиналу, но значительно хуже — на вопрос о происхождении этой способности модели. И это отдельный слой проблемы, который легко потерять в дискуссии о запоминании (memorization).

При этом запоминание (memorization), извлечение (extraction) и нарушение авторского права — не одно и то же. Сам по себе факт, что модель с высокой вероятностью способна воспроизвести близкий к обучающему текст, еще не отвечает на юридический вопрос о том является ли это нарушением на этапе обучения или нет.
Но работа показывает другую проблему: если технический спор об ИИ строится вокруг тезиса «модель не воспроизводит обучающие данные (training data) дословно», то сам критерий дословности (verbatim) может оказаться слишком узким.
Незначительное изменение пунктуации, одного слова или пробела с точки зрения авторского права едва ли превращает заимствованный фрагмент в совершенно новое произведение. А технические методы, которые фиксируют только абсолютное совпадение токенов, именно так его и воспринимают.

Поэтому для дискуссии об авторском праве важен, пожалуй, не конкретный процент извлечения, а более общий вывод работы:

отсутствие дословного совпадения еще не означает отсутствия воспроизведения обучающих данных.

И я бы добавил второй:

наличие близкого результата еще не доказывает, что модель обучалась непосредственно на соответствующем произведении.

Между произведением и моделью может существовать целый слой вторичных источников — и для технического и юридического анализа это различие может оказаться принципиальным.


Репост из: Подслушано в МГУ
Не бойтесь 4-х лет в МГУ: эти 6 лет станут лучшими 9 годами вашей жизни

#мгу_классика


Репост из: Будни лучшего юрфака страны | МГУ
В Конституции, как в женщине — должна быть загадка

#Шустров


Репост из: РУЛЬФЫ, ИЛЬФЫ И ИНХАУСЫ
Фотографии авторства Романа Бевзенко

Известный российский юрист, доктор юридических наук Роман Бевзенко победил на тематическом фотоконкурсе Silhouette от 35Photo.

Всего соревновалось больше 1.3 тыс. фотографов из 65 стран, было представлено 7.8 тыс. работ. Г-н Бевзенко выставил на конкурс две фотографии из поездки по Кении, одну из ОАЭ и одну из Турции.

Рульфы, ильфы и инхаусы в:
Telegram | VK | Max | Dzen | LinkedIn
Юридические вакансии




Кто хочет повторить фотографию?


Репост из: Первый университетский
Только сентябрь, а студенты МГУ уже настолько устали от учебы. Что же будет в сессию?


Надеюсь, все сегодня помнят, что нужно сделать


Репост из: Будни лучшего юрфака страны | МГУ
Армия и флот — союзники не только России, но и Бориса Николаевича Ельцина

#Шустров


Репост из: Будни лучшего юрфака страны | МГУ
А вот и обещанный розыгрыш 😇

Разыгрываем сразу два приза, потому что мы вас любим! Итак, на кону:

💬 Яндекс.Станция;
📚 любая книга по праву (до 3 000 рублей).

А победитель, который заберёт Станцию, также сможет добавиться в семейную подписку Яндекс.Плюса админа. Всё лучшее — студентам лучшего юрфака страны 🔥

Условия:
— быть подписанным на наш канал;
— отправить этот пост другу;
— нажать кнопку «Участвовать»!

Итоги подведём в следующую пятницу, 25 сентября. Чем больше друзей позовёте, тем выше шанс победить. Удачи! 😈

@lawyer_msu


Репост из: Legal Elysium
Вы когда-нибудь получали письмо от иностранного регулятора с требованием соблюдать его законодательство?

Возможно, в этот момент вам хотелось ответить примерно как в известном меме: «А что ты мне сделаешь? Я в другом городе».

Американский адвокат Preston Byrne, представляющий 4chan, пошёл дальше. Он начал посылать британскому регулятору хомяков. Точнее картинки с хомяками.

История началась в 2025 году, когда британский Ofcom, аналог нашего Роскомнадзора стал добиваться от 4chan соблюдения требований Online Safety Act. Позиция Byrne была довольно простой: британский регулятор может сколько угодно принимать решения и выписывать штрафы, но из этого ещё не следует, что такие решения автоматически имеют юридическую силу и могут быть исполнены против американской компании в США.

В одном из ответов Byrne написал, что документы Ofcom обладают примерно той же юридической ценностью, что и бумага, которую можно измельчить и использовать в качестве подстилки для хомяка.

Так появился Mr Whiskers.

В дальнейшем условный хомяк превратился практически в официального участника переписки. История добралась даже до американского суда, где Byrne пришлось объяснять судье, что его «hamster email» был шутливой формой вполне серьёзного юридического возражения против экстерриториального действия британского регулирования.

27 февраля 2026 года Ofcom снова написал 4chan. В ответ регулятор снова получил изображение хомяка.

19 марта Ofcom наложил существенно более крупный штраф — совокупно около £520 000. Byrne заранее пообещал, что на giant fine последует giant hamster.

И слово сдержал: Ofcom получил AI-картинку гигантского хомяка в костюме Годзиллы.

Когда в июле 2026 года регулятор вновь потребовал уплатить штраф и даже прислал банковские реквизиты, ответ был предсказуем.

Ещё один хомяк.

Иногда юридическая позиция — это мемо на сорок страниц.

А иногда хомяк.


Видео недоступно для предпросмотра
Смотреть в Telegram


Сверх-Я

Кто стоит надо мною? Кто ограничивает меня? Кто пишет эти бесполезные тексты под фотографиями, которые все равно никто не читает?

модель — Влад

записаться на фотосессию можно в лс)

#canon_eos_400d



Показано 16 последних публикаций.