🔐 Как может работать watermarking в Claude.
При генерации текста модель почти никогда не имеет ровно один «правильный» следующий токен. Обычно есть несколько вариантов с близкими вероятностями, и выбор между ними делается через sampling.
Watermarking добавляет ещё один фактор: секретный ключ влияет на то, какой из подходящих токенов будет выбран в конкретной позиции.
Сам текст при этом выглядит обычным.
Но если повторять такой выбор на множестве позиций, появляется статистический паттерн, который крайне маловероятно получить случайно. По нему потом можно определить, что текст был сгенерирован моделью.
Watermark можно добавлять прямо во время inference.
Если механизм нужен из-за требований ЕС, почему включать его для всех пользователей, а не только для европейского трафика?
Технически региональное включение выглядит вполне возможным. Значит, причины могут быть уже не в самой модели, а в эксплуатации, унификации инфраструктуры и политике компании.
https://x.com/AnthropicAI/status/2088343978873966687
При генерации текста модель почти никогда не имеет ровно один «правильный» следующий токен. Обычно есть несколько вариантов с близкими вероятностями, и выбор между ними делается через sampling.
Watermarking добавляет ещё один фактор: секретный ключ влияет на то, какой из подходящих токенов будет выбран в конкретной позиции.
Сам текст при этом выглядит обычным.
Но если повторять такой выбор на множестве позиций, появляется статистический паттерн, который крайне маловероятно получить случайно. По нему потом можно определить, что текст был сгенерирован моделью.
Watermark можно добавлять прямо во время inference.
Если механизм нужен из-за требований ЕС, почему включать его для всех пользователей, а не только для европейского трафика?
Технически региональное включение выглядит вполне возможным. Значит, причины могут быть уже не в самой модели, а в эксплуатации, унификации инфраструктуры и политике компании.
https://x.com/AnthropicAI/status/2088343978873966687