TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Техножрица 👩‍💻👩‍🏫👩‍🔧

3 Nov 2024, 11:45

Открыть в Telegram Поделиться Пожаловаться

Теперь надо рассказать про еще одну статью от нас с коллегами под названием "Robust AI-Generated Text Detection by Restricted Embeddings": https://arxiv.org/abs/2410.08113 . Работа эта была написана несколько месяцев назад и уже была принята на Findings of EMNLP 2024.

Статья снова посвящена нашей старой теме - детекции искусственно сгенерированных текстов, но в этот раз мы подошли к этой теме с новой стороны, а точнее, с нового гиперпространства. 🌚 Мы рассмотрели один из самых простых и распространенных способов детекции - по эмбеддингу с последнего слоя RoBERTы (и других небольших моделей) - и задались вопросом: а не может ли быть так, что в кросс-доменной постановке задачи какая-то часть эмбеддинга не помогает детекции, а, наоборот, вредит? Под "кросс-доменной постановкой" я понимаю в данном случае ситуацию, когда мы тренируем наш детектор детектировать сгенерированный текст по одной тематике (или сгенерированный одной моделью), а потом тестируем его на тексте с другой тематикой (или на тексте, сгенерированном другой моделью). И то, и то (т.е. и другая тематика, и другая порождающая модель) здесь и далее будет называться "другим доменом".

Так вот, действительно оказалось, что некоторые "вредные" подпространства в пространстве эмбеддингов содержат слишком специфические для данного домена признаки, на которые модель как бы переобучается, и от этого ее становится сложнее перенести на другой домен. А если эти признаки убрать, то модель, наоборот, не сможет зацепиться за специфические признаки и будет лучше переноситься.

Эти "вредные" подпространства (и просто "вредные" признаки сами по себе) из эмбеддингов в статье выкорчевывались несколькими способами. Два из них требовали наличие двух "валидационных" доменов:
- из эмбеддингов удалялись те координаты, удаление которых помогало кросс-доменной переносимости между двумя выбранными валидационными доменами;
- прежде, чем считать финальный эмбеддинг, в модели удалялись те головы, удаление которых также помогало кросс-доменной переносимости между двумя доменами.
Также был опробован concept erasure - метод из другой статьи, с помощью которого из эмбеддинга научились удалять некоторую информацию о синтаксисе и семантике текста. Например, оказалось, что удаление информации о глубине синтаксического дерева помогло кросс-доменной переносимости.
Кроме этого, мы пробовали просто "выключать" MHA на целых слоях, и снова оказалось, что существуют слои, выключение которых немного помогает на кросс-домене. Для Роберты это были, например, 1-й и 4-й слои (в статье приведена статистика и по остальным слоям тоже).

Кроме того, мы сравнили эти методы с нашим старым методом детекции по внутренней размерности, и показали, что они работают в тех случаях, в которых внутренняя размерность не работает.

Я была рада работать над этим исследованием и была в целом довольна, что его приняли на Findings. Однако уже после принятия статьи случилось непредвиденное: в тех экспериментах с удалением координат из эмбеддингов, над которыми я работала (selected coordinates), нашлась ошибка... 🔍 (см. следующий пост)

#объяснения_статей
Robust AI-Generated Text Detection by Restricted Embeddings
Growing amount and quality of AI-generated texts makes detecting such content more difficult. In most real-world scenarios, the domain (style and topic) of generated data and the generator model...

4.5k 5 20 3 315
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot