Теперь надо рассказать про еще одну статью от нас с коллегами под названием "Robust AI-Generated Text Detection by Restricted Embeddings": https://arxiv.org/abs/2410.08113 . Работа эта была написана несколько месяцев назад и уже была принята на Findings of EMNLP 2024.
Статья снова посвящена нашей старой теме - детекции искусственно сгенерированных текстов, но в этот раз мы подошли к этой теме с новой стороны, а точнее, с нового гиперпространства. 🌚 Мы рассмотрели один из самых простых и распространенных способов детекции - по эмбеддингу с последнего слоя RoBERTы (и других небольших моделей) - и задались вопросом: а не может ли быть так, что в кросс-доменной постановке задачи какая-то часть эмбеддинга не помогает детекции, а, наоборот, вредит? Под "кросс-доменной постановкой" я понимаю в данном случае ситуацию, когда мы тренируем наш детектор детектировать сгенерированный текст по одной тематике (или сгенерированный одной моделью), а потом тестируем его на тексте с другой тематикой (или на тексте, сгенерированном другой моделью). И то, и то (т.е. и другая тематика, и другая порождающая модель) здесь и далее будет называться "другим доменом".
Так вот, действительно оказалось, что некоторые "вредные" подпространства в пространстве эмбеддингов содержат слишком специфические для данного домена признаки, на которые модель как бы переобучается, и от этого ее становится сложнее перенести на другой домен. А если эти признаки убрать, то модель, наоборот, не сможет зацепиться за специфические признаки и будет лучше переноситься.
Эти "вредные" подпространства (и просто "вредные" признаки сами по себе) из эмбеддингов в статье выкорчевывались несколькими способами. Два из них требовали наличие двух "валидационных" доменов:
- из эмбеддингов удалялись те координаты, удаление которых помогало кросс-доменной переносимости между двумя выбранными валидационными доменами;
- прежде, чем считать финальный эмбеддинг, в модели удалялись те головы, удаление которых также помогало кросс-доменной переносимости между двумя доменами.
Также был опробован concept erasure - метод из другой статьи, с помощью которого из эмбеддинга научились удалять некоторую информацию о синтаксисе и семантике текста. Например, оказалось, что удаление информации о глубине синтаксического дерева помогло кросс-доменной переносимости.
Кроме этого, мы пробовали просто "выключать" MHA на целых слоях, и снова оказалось, что существуют слои, выключение которых немного помогает на кросс-домене. Для Роберты это были, например, 1-й и 4-й слои (в статье приведена статистика и по остальным слоям тоже).
Кроме того, мы сравнили эти методы с нашим старым методом детекции по внутренней размерности, и показали, что они работают в тех случаях, в которых внутренняя размерность не работает.
Я была рада работать над этим исследованием и была в целом довольна, что его приняли на Findings. Однако уже после принятия статьи случилось непредвиденное: в тех экспериментах с удалением координат из эмбеддингов, над которыми я работала (selected coordinates), нашлась ошибка... 🔍 (см. следующий пост)
#объяснения_статей
Статья снова посвящена нашей старой теме - детекции искусственно сгенерированных текстов, но в этот раз мы подошли к этой теме с новой стороны, а точнее, с нового гиперпространства. 🌚 Мы рассмотрели один из самых простых и распространенных способов детекции - по эмбеддингу с последнего слоя RoBERTы (и других небольших моделей) - и задались вопросом: а не может ли быть так, что в кросс-доменной постановке задачи какая-то часть эмбеддинга не помогает детекции, а, наоборот, вредит? Под "кросс-доменной постановкой" я понимаю в данном случае ситуацию, когда мы тренируем наш детектор детектировать сгенерированный текст по одной тематике (или сгенерированный одной моделью), а потом тестируем его на тексте с другой тематикой (или на тексте, сгенерированном другой моделью). И то, и то (т.е. и другая тематика, и другая порождающая модель) здесь и далее будет называться "другим доменом".
Так вот, действительно оказалось, что некоторые "вредные" подпространства в пространстве эмбеддингов содержат слишком специфические для данного домена признаки, на которые модель как бы переобучается, и от этого ее становится сложнее перенести на другой домен. А если эти признаки убрать, то модель, наоборот, не сможет зацепиться за специфические признаки и будет лучше переноситься.
Эти "вредные" подпространства (и просто "вредные" признаки сами по себе) из эмбеддингов в статье выкорчевывались несколькими способами. Два из них требовали наличие двух "валидационных" доменов:
- из эмбеддингов удалялись те координаты, удаление которых помогало кросс-доменной переносимости между двумя выбранными валидационными доменами;
- прежде, чем считать финальный эмбеддинг, в модели удалялись те головы, удаление которых также помогало кросс-доменной переносимости между двумя доменами.
Также был опробован concept erasure - метод из другой статьи, с помощью которого из эмбеддинга научились удалять некоторую информацию о синтаксисе и семантике текста. Например, оказалось, что удаление информации о глубине синтаксического дерева помогло кросс-доменной переносимости.
Кроме этого, мы пробовали просто "выключать" MHA на целых слоях, и снова оказалось, что существуют слои, выключение которых немного помогает на кросс-домене. Для Роберты это были, например, 1-й и 4-й слои (в статье приведена статистика и по остальным слоям тоже).
Кроме того, мы сравнили эти методы с нашим старым методом детекции по внутренней размерности, и показали, что они работают в тех случаях, в которых внутренняя размерность не работает.
Я была рада работать над этим исследованием и была в целом довольна, что его приняли на Findings. Однако уже после принятия статьи случилось непредвиденное: в тех экспериментах с удалением координат из эмбеддингов, над которыми я работала (selected coordinates), нашлась ошибка... 🔍 (см. следующий пост)
#объяснения_статей