Забавно, как весь твиттер взбудоражился от
новости, что Anthropic начал помечать невидимыми водяными знаками тексты, которые генерируют их модели. Не в метаданных, а прямо в тексте.
Знак (водяной) не виден глазу, не меняет смысл и качество текста и переживает копипаст. Работает на уровне модели, поэтому помечается все, от API и приложения до Claude Code и доступа через облака Amazon, Google и Microsoft. А к сгенерированным файлам (.png, .svg, .jpg) теперь вкладывается криптоподпись по
открытому стандарту C2PA (как я понял).
Это все связано с комплаенсом. С 2 августа 2026
европейский AI Act требует делать ИИ-контент машинно-различимым. Поэтому маркируют пока только модели, запущенные после этой даты, а старые «в переходном периоде», то есть их тексты никто не помечает.
Как вообще можно спрятать знак в словах? Anthropic деталей не раскрывает, но у Google похожая штука
SynthID-Text уже два года работает в Gemini, так что механику
можно подсмотреть там.
Например, модель пишет «утром выпил кофе и ___ на работу» и выбирает между
«поехал»,
«пошел» и
«отправился». Секретный ключ вместе с несколькими предыдущими словами псевдослучайно делит словарь на «зеленые» и «красные» слова, и модель чуть чаще берет зеленые.
Читатель видит обычный текст. А детектор с тем же ключом считает статистику. Если на тысячу слов зеленых 70% вместо ожидаемых 50%, текст писала модель. Поэтому в Anthropic и предупреждают, что детекция на небольших текстах срабатывать не будет, а вот ресечи, статьи или дипломные работы раскрасит как новогоднюю елку.
Так что если они будут использовать что-то наподобие гугловского SynthID-Text, мы получим следующую историю:
— Списка «слов-маркеров» не существует. Раскраска пересчитывается на каждом слове от контекста, найти знак глазами невозможно.
— Короткие тексты и код почти не маркируются. Статистике нужен объем и свобода выбора между синонимами.
— Знак появится, даже если Claude просто вычитал или перевел ваш собственный текст. Anthropic честно пишет, что watermark не доказывает авторство ИИ.
— Проверить метку сможет только сам Anthropic. Детектор обещают «в будущей документации».
В общем, все «хуманайзеры» и деслоп-промпты не работают. Они чистят стиль, а знак сидит в статистике выбора слов. Стереть его может только пересказ текста другой моделью. Ну или машина времени. Тексты моделей, вышедших до августа, не помечены до сих пор.