smoothie
В репозитории опубликован код Smoothie — метода диффузионной генерации текста, который учитывает и дискретную природу языка, и смысловую близость между токенами. Авторы работают с одной из главных проблем текстовых диффузионных моделей, где обычная гауссовская диффузия в пространстве представлений хорошо сохраняет семантическую геометрию, но потом требует отдельного перехода обратно к токенам, а методы в пространстве словарного симплекса проще декодируются, но почти не используют сходство между словами. Smoothie предлагает промежуточную постановку. Каждый токен описывается не самим embedding, а вектором расстояний от него до всех токенов словаря. В экспериментах Smoothie проверяется на безусловной генерации на ROCStories и на четырёх задачах преобразования текста: QQP, Quasar-T, XSum и ParaDetox. Модель сравнивается с DiffuSeq, SeqDiffuSeq, SSD-LM, TESS, TEncDM, MDLM и авторегрессионными базовыми моделями. Smoothie показывает лучшие результаты среди диффузионных методов на нескольких задачах, включая MAUVE на ROCStories, BLEU на Quasar-T и J-Score на ParaDetox. Отдельно авторы показывают, что предложенное пространство расстояний работает лучше, чем стандартное embedding space и simplex space при одинаковой архитектуре и схожей процедуре обучения. Работа будет полезна исследователям генерации текста, диффузионных языковых моделей и дискретных данных, где между категориями есть содержательная близость, например в графах или белковых последовательностях.
статья | код
В репозитории опубликован код Smoothie — метода диффузионной генерации текста, который учитывает и дискретную природу языка, и смысловую близость между токенами. Авторы работают с одной из главных проблем текстовых диффузионных моделей, где обычная гауссовская диффузия в пространстве представлений хорошо сохраняет семантическую геометрию, но потом требует отдельного перехода обратно к токенам, а методы в пространстве словарного симплекса проще декодируются, но почти не используют сходство между словами. Smoothie предлагает промежуточную постановку. Каждый токен описывается не самим embedding, а вектором расстояний от него до всех токенов словаря. В экспериментах Smoothie проверяется на безусловной генерации на ROCStories и на четырёх задачах преобразования текста: QQP, Quasar-T, XSum и ParaDetox. Модель сравнивается с DiffuSeq, SeqDiffuSeq, SSD-LM, TESS, TEncDM, MDLM и авторегрессионными базовыми моделями. Smoothie показывает лучшие результаты среди диффузионных методов на нескольких задачах, включая MAUVE на ROCStories, BLEU на Quasar-T и J-Score на ParaDetox. Отдельно авторы показывают, что предложенное пространство расстояний работает лучше, чем стандартное embedding space и simplex space при одинаковой архитектуре и схожей процедуре обучения. Работа будет полезна исследователям генерации текста, диффузионных языковых моделей и дискретных данных, где между категориями есть содержательная близость, например в графах или белковых последовательностях.
статья | код