TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Data Secrets

11 Aug, 14:22

Открыть в Telegram Поделиться Пожаловаться

Теперь Anthropic будет метить весь сгенерированный текст. Разбираемся, как это работает.

Стартап подписал Кодекс поведения по прозрачности ИИ-контента в рамках Европейского AI Act. Он вступил в силу 2 августа, и с этого момента провайдеры и деплоеры ИИ-систем, которые выходят в ЕС, обязаны встраивать водяные знаки в сгенерированный текст и файлы.

Собственно, антропики только что обновили документацию по этому поводу: https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content.

Несмотря на то, что это закон ЕС, маркировка будет применяться глобально. Однако это не значит, что прямо с сегодняшнего дня весь ваш текст от моделей Claude будет помечен.

Во-первых, поддерживать маркировку сразу с запуска должны только модели, которые вышли после 2 августа. Для остальных моделей закон предусматривает переходный период в 4 месяца, и у Anthropic старые модели тоже пока остаются без вотерок (в документации написано, что они "работают над добавлением фичи", но сроков нет).

Во-вторых, пока что маркировку не сможет прочитать вообще никто, кроме самих антропиков. Пока что не существует общедоступного инструмента, в который можно вставить текст с вотермаркой и получить ответ типа "да, это Claude" или "нет, не Claude". Стартап обещает выпустить такие инструменты и документацию, но сроков, опять же, нет. Так что еще какое-то время эти метки будут чистой формальностью.

В-третьих, эти метки исчезают, если текст немного отредактировать. Тут надо понимать, как вотермарка в принципе прячется в тексте. На каждом шаге генерации модель по секретному ключу и предыдущим токенам делит словарь на "предпочтительные" и обычные токены, и слегка склоняется в сторону первых там, где это не портит текст. В результате в тексте накапливается статистический паттерн, невидимый на глаз. Детектор с тем же ключом проверяет текст на этот паттерн и по частоте совпадений судит, сгенерирован ли он моделью. Поэтому если вы подредактируете текст, смешаете его с другим текстом, или он, например, будет коротким, статистический паттерн перестанет быть надежно обнаружимым.

(Для файлов это работает немного иначе: там просто встраиваются соответствующие C2PA-метаданные).

Честно говоря, большого смысла в таких пометках пока не видно. Технически интересно, юридически обязательно, но как решение исходной проблемы – довольно дыряво.

22.4k 5 461 42 226
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot