Себастьян Рашка разбирает интересную идею Anthropic: можно ли оставить в тексте от Claude незаметный след, который позволит определить, что он был создан моделью.
На первый взгляд это похоже на водяной знак на фотографии. Если изображение можно пометить специальным идентификатором, почему бы не сделать то же самое с текстом?
Но с языком всё сложнее. Текст постоянно редактируют, сокращают, переводят, меняют стиль. Любой очевидный след быстро исчезает.
Поэтому Anthropic предлагает другой подход: не добавлять метку после генерации, а немного изменить сам процесс выбора слов. Языковая модель в каждый момент выбирает следующий токен из набора возможных вариантов. Если слегка сместить эти вероятности, отдельные изменения останутся незаметными, но на длинном тексте появится статистический рисунок.
Для аналитика здесь есть что-то знакомое: поиск слабого сигнала среди шума. Но техническая часть — только начало. Зачем нам вообще нужно знать, был ли текст создан человеком или моделью?
Потому что использование ИИ бывает очень разным. В одном случае модель становится обычным инструментом. Аналитик просит её помочь проверить гипотезы, программист — найти ошибку в коде, исследователь — разобраться в новой области. Человек остаётся автором решения, а модель помогает быстрее пройти часть пути.
В другом случае ИИ используется именно для того, чтобы скрыть отсутствие человеческой работы. Студент сдаёт полностью сгенерированное эссе как своё. Компания создаёт тысячи фальшивых отзывов. Кто-то запускает поток комментариев, чтобы создать иллюзию общественного мнения.
Здесь проблема уже не в самом участии модели. Проблема возникает, когда происхождение текста важно для доверия, но его намеренно скрывают. Особенно заметным это становится в масштабе. Человек ограничен временем, а модель — почти нет. Создать несколько тысяч убедительных сообщений теперь можно гораздо дешевле, чем раньше.
Поэтому вопрос постепенно меняется. Нам не так важно просто узнать: «участвовал ли ИИ?» Важнее понять: кто поставил задачу, кто принимал решения и использовалась ли модель как инструмент или как способ выдать автоматическую генерацию за человеческий опыт.
Watermarking в Claude интересен именно этим. Это не только попытка найти машинный текст. Это один из первых шагов к новой системе доверия к информации, где происхождение становится частью самого содержания.
Кстати, внимательный читатель может попробовать найти в этой заметке следы ИИ. Возможно, он заметит слишком аккуратную структуру, слишком ровные формулировки или даже подозрительно длинные тире, которые мы не стали заменять на короткие, чтобы сделать вид, будто здесь вообще не было никаких моделей.
https://open.substack.com/pub/sebastianraschka/p/claude-watermarking
На первый взгляд это похоже на водяной знак на фотографии. Если изображение можно пометить специальным идентификатором, почему бы не сделать то же самое с текстом?
Но с языком всё сложнее. Текст постоянно редактируют, сокращают, переводят, меняют стиль. Любой очевидный след быстро исчезает.
Поэтому Anthropic предлагает другой подход: не добавлять метку после генерации, а немного изменить сам процесс выбора слов. Языковая модель в каждый момент выбирает следующий токен из набора возможных вариантов. Если слегка сместить эти вероятности, отдельные изменения останутся незаметными, но на длинном тексте появится статистический рисунок.
Для аналитика здесь есть что-то знакомое: поиск слабого сигнала среди шума. Но техническая часть — только начало. Зачем нам вообще нужно знать, был ли текст создан человеком или моделью?
Потому что использование ИИ бывает очень разным. В одном случае модель становится обычным инструментом. Аналитик просит её помочь проверить гипотезы, программист — найти ошибку в коде, исследователь — разобраться в новой области. Человек остаётся автором решения, а модель помогает быстрее пройти часть пути.
В другом случае ИИ используется именно для того, чтобы скрыть отсутствие человеческой работы. Студент сдаёт полностью сгенерированное эссе как своё. Компания создаёт тысячи фальшивых отзывов. Кто-то запускает поток комментариев, чтобы создать иллюзию общественного мнения.
Здесь проблема уже не в самом участии модели. Проблема возникает, когда происхождение текста важно для доверия, но его намеренно скрывают. Особенно заметным это становится в масштабе. Человек ограничен временем, а модель — почти нет. Создать несколько тысяч убедительных сообщений теперь можно гораздо дешевле, чем раньше.
Поэтому вопрос постепенно меняется. Нам не так важно просто узнать: «участвовал ли ИИ?» Важнее понять: кто поставил задачу, кто принимал решения и использовалась ли модель как инструмент или как способ выдать автоматическую генерацию за человеческий опыт.
Watermarking в Claude интересен именно этим. Это не только попытка найти машинный текст. Это один из первых шагов к новой системе доверия к информации, где происхождение становится частью самого содержания.
Кстати, внимательный читатель может попробовать найти в этой заметке следы ИИ. Возможно, он заметит слишком аккуратную структуру, слишком ровные формулировки или даже подозрительно длинные тире, которые мы не стали заменять на короткие, чтобы сделать вид, будто здесь вообще не было никаких моделей.
https://open.substack.com/pub/sebastianraschka/p/claude-watermarking