Репост из: Силиконовый Мешок
Забавно, как весь твиттер взбудоражился от новости, что Anthropic начал помечать невидимыми водяными знаками тексты, которые генерируют их модели. Не в метаданных, а прямо в тексте.
Знак (водяной) не виден глазу, не меняет смысл и качество текста и переживает копипаст. Работает на уровне модели, поэтому помечается все, от API и приложения до Claude Code и доступа через облака Amazon, Google и Microsoft. А к сгенерированным файлам (.png, .svg, .jpg) теперь вкладывается криптоподпись по открытому стандарту C2PA (как я понял).
Это все связано с комплаенсом. С 2 августа 2026 европейский AI Act требует делать ИИ-контент машинно-различимым. Поэтому маркируют пока только модели, запущенные после этой даты, а старые «в переходном периоде», то есть их тексты никто не помечает.
Как вообще можно спрятать знак в словах? Anthropic деталей не раскрывает, но у Google похожая штука SynthID-Text уже два года работает в Gemini, так что механику можно подсмотреть там.
Например, модель пишет «утром выпил кофе и ___ на работу» и выбирает между «поехал», «пошел» и «отправился». Секретный ключ вместе с несколькими предыдущими словами псевдослучайно делит словарь на «зеленые» и «красные» слова, и модель чуть чаще берет зеленые.
Читатель видит обычный текст. А детектор с тем же ключом считает статистику. Если на тысячу слов зеленых 70% вместо ожидаемых 50%, текст писала модель. Поэтому в Anthropic и предупреждают, что детекция на небольших текстах срабатывать не будет, а вот ресечи, статьи или дипломные работы раскрасит как новогоднюю елку.
Так что если они будут использовать что-то наподобие гугловского SynthID-Text, мы получим следующую историю:
— Списка «слов-маркеров» не существует. Раскраска пересчитывается на каждом слове от контекста, найти знак глазами невозможно.
— Короткие тексты и код почти не маркируются. Статистике нужен объем и свобода выбора между синонимами.
— Знак появится, даже если Claude просто вычитал или перевел ваш собственный текст. Anthropic честно пишет, что watermark не доказывает авторство ИИ.
— Проверить метку сможет только сам Anthropic. Детектор обещают «в будущей документации».
В общем, все «хуманайзеры» и деслоп-промпты не работают. Они чистят стиль, а знак сидит в статистике выбора слов. Стереть его может только пересказ текста другой моделью. Ну или машина времени. Тексты моделей, вышедших до августа, не помечены до сих пор.
Знак (водяной) не виден глазу, не меняет смысл и качество текста и переживает копипаст. Работает на уровне модели, поэтому помечается все, от API и приложения до Claude Code и доступа через облака Amazon, Google и Microsoft. А к сгенерированным файлам (.png, .svg, .jpg) теперь вкладывается криптоподпись по открытому стандарту C2PA (как я понял).
Это все связано с комплаенсом. С 2 августа 2026 европейский AI Act требует делать ИИ-контент машинно-различимым. Поэтому маркируют пока только модели, запущенные после этой даты, а старые «в переходном периоде», то есть их тексты никто не помечает.
Как вообще можно спрятать знак в словах? Anthropic деталей не раскрывает, но у Google похожая штука SynthID-Text уже два года работает в Gemini, так что механику можно подсмотреть там.
Например, модель пишет «утром выпил кофе и ___ на работу» и выбирает между «поехал», «пошел» и «отправился». Секретный ключ вместе с несколькими предыдущими словами псевдослучайно делит словарь на «зеленые» и «красные» слова, и модель чуть чаще берет зеленые.
Читатель видит обычный текст. А детектор с тем же ключом считает статистику. Если на тысячу слов зеленых 70% вместо ожидаемых 50%, текст писала модель. Поэтому в Anthropic и предупреждают, что детекция на небольших текстах срабатывать не будет, а вот ресечи, статьи или дипломные работы раскрасит как новогоднюю елку.
Так что если они будут использовать что-то наподобие гугловского SynthID-Text, мы получим следующую историю:
— Списка «слов-маркеров» не существует. Раскраска пересчитывается на каждом слове от контекста, найти знак глазами невозможно.
— Короткие тексты и код почти не маркируются. Статистике нужен объем и свобода выбора между синонимами.
— Знак появится, даже если Claude просто вычитал или перевел ваш собственный текст. Anthropic честно пишет, что watermark не доказывает авторство ИИ.
— Проверить метку сможет только сам Anthropic. Детектор обещают «в будущей документации».
В общем, все «хуманайзеры» и деслоп-промпты не работают. Они чистят стиль, а знак сидит в статистике выбора слов. Стереть его может только пересказ текста другой моделью. Ну или машина времени. Тексты моделей, вышедших до августа, не помечены до сих пор.