Н
Нефёдов
Репост из: Гостев из будущего
Anthropic начала помечать всё, что пишет Claude.
С 2 августа новые модели Claude встраивают в генерируемый текст невидимую метку. Не значок копирайта и не хитрые Unicode-символы, которые можно найти и удалить. Меткой служит сам текст.
Точного алгоритма Anthropic пока не раскрывает. Но известные методы работают примерно так:
Допустим, Claude может написать «важный», «значимый» или «существенный». Для нас разницы почти нет. А модель может чуть чаще выбирать определённые варианты по секретному правилу. Один такой выбор ничего не значит, но на длинном тексте возникает статистический рисунок, который специальный детектор способен заметить.
То есть отпечаток находится в том, как именно Claude выбирает слова.
Google делает примерно то же самое с SynthID Text ещё с 2024 года. Там механизм известен: система слегка меняет выбор слов модели, создавая статистический рисунок.
Работает это в Claude, API, Claude Code и других продуктах Anthropic, а также через AWS, Google Cloud и Microsoft Foundry.
Для изображений и других файлов всё проще — туда добавляют подписанные метаданные C2PA.
Повод — европейский AI Act, но маркировка включена глобально.
Разумеется, есть нюансы. На коротком тексте сигнала может не хватить. Сильное редактирование его ослабляет, пересказ или перевод другой моделью может уничтожить совсем. Более того, если вы сами написали письмо, а Claude попросили только его причесать, результат тоже может получить метку. Поэтому наличие метки не означает «это написал ИИ». А отсутствие вообще ничего не доказывает.
Но есть проблема интереснее. Если модель постоянно предпочитает одни варианты текста другим, эти предпочтения можно попытаться вычислить.
В 2024 году исследователи ETH Zurich именно это сделали с несколькими системами маркировки: собрали много помеченных ответов и по статистике приблизительно восстановили правила. После этого смогли как снимать метки, так и добавлять их в чужой текст. Стоимость атаки — меньше $50, успешность — выше 80%.
Реакция — ожидаемая волна хейта. Особенно много аргументов вроде «сначала антропик украли весь контент интернета, а теперь ставят свои ватермарки на всё». Ну и конечно, всех бомбит от того что это из-за европейского закона, а маркируют для всех.
@gostev_future
С 2 августа новые модели Claude встраивают в генерируемый текст невидимую метку. Не значок копирайта и не хитрые Unicode-символы, которые можно найти и удалить. Меткой служит сам текст.
Точного алгоритма Anthropic пока не раскрывает. Но известные методы работают примерно так:
Допустим, Claude может написать «важный», «значимый» или «существенный». Для нас разницы почти нет. А модель может чуть чаще выбирать определённые варианты по секретному правилу. Один такой выбор ничего не значит, но на длинном тексте возникает статистический рисунок, который специальный детектор способен заметить.
То есть отпечаток находится в том, как именно Claude выбирает слова.
Google делает примерно то же самое с SynthID Text ещё с 2024 года. Там механизм известен: система слегка меняет выбор слов модели, создавая статистический рисунок.
Работает это в Claude, API, Claude Code и других продуктах Anthropic, а также через AWS, Google Cloud и Microsoft Foundry.
Для изображений и других файлов всё проще — туда добавляют подписанные метаданные C2PA.
Повод — европейский AI Act, но маркировка включена глобально.
Разумеется, есть нюансы. На коротком тексте сигнала может не хватить. Сильное редактирование его ослабляет, пересказ или перевод другой моделью может уничтожить совсем. Более того, если вы сами написали письмо, а Claude попросили только его причесать, результат тоже может получить метку. Поэтому наличие метки не означает «это написал ИИ». А отсутствие вообще ничего не доказывает.
Но есть проблема интереснее. Если модель постоянно предпочитает одни варианты текста другим, эти предпочтения можно попытаться вычислить.
В 2024 году исследователи ETH Zurich именно это сделали с несколькими системами маркировки: собрали много помеченных ответов и по статистике приблизительно восстановили правила. После этого смогли как снимать метки, так и добавлять их в чужой текст. Стоимость атаки — меньше $50, успешность — выше 80%.
Реакция — ожидаемая волна хейта. Особенно много аргументов вроде «сначала антропик украли весь контент интернета, а теперь ставят свои ватермарки на всё». Ну и конечно, всех бомбит от того что это из-за европейского закона, а маркируют для всех.
@gostev_future