🔥 Разблокировка Разнообразия LLM
По мотивам постов (первый и второй) о креативности контента и анализа исследования.
Коллапс моды (mode collapse) — это явление, при котором большие языковые модели (LLM) после выравнивания (post-training alignment), например, с помощью RLHF, демонстрируют значительное снижение разнообразия ответов, предпочитая узкий набор стереотипных результатов. Авторы исследования определяют, что основной причиной этого является предвзятость типичности (typicality bias), которая широко распространена в данных предпочтений, собранных от аннотаторов. Эта предвзятость основана на когнитивных принципах (например, эффект простого воздействия), заставляющих людей систематически отдавать предпочтение знакомому или типичному тексту.
Теоретический анализ показывает, что эта предвзятость строго обостряет распределение вероятностей, приводя к концентрации вероятностной массы на наиболее типичных ответах, особенно когда множество ответов имеют одинаковую фактическую полезность (например, в креативном письме).
Решение: Вербализованное Сэмплирование (VS)
В качестве решения предлагается Вербализованное Сэмплирование (Verbalized Sampling, VS), простая стратегия промптинга, не требующая дополнительного обучения. Вместо традиционного запроса на один экземпляр ответа (например, "Расскажи мне анекдот...") VS явно запрашивает у модели вербализацию распределения ответов с соответствующими вероятностями (например, "Сгенерируй 5 ответов с их вероятностями").
Результаты и преимущества
VS эффективно обходит коллапс моды, восстанавливая разнообразие, присущее базовой модели. Комплексные эксперименты показали значительные улучшения в:
1. Креативном письме: VS увеличивает разнообразие результатов (стихи, истории, шутки) в 1.6–2.1 раза по сравнению с прямым промптингом.
2. Симуляции диалогов: VS помогает моделям генерировать более разнообразные беседы и симулировать распределение человеческого поведения (например, суммы пожертвований) более реалистично.
3. Открытых вопросах (Open-Ended QA): VS генерирует более широкое и реалистичное распределение ответов, улучшая соответствие исходному распределению данных предобучения.
4. Генерации синтетических данных: VS создает более разнообразные синтетические данные, что, в свою очередь, улучшает производительность моделей в последующих математических задачах.
Важно отметить, что VS достигает этих улучшений в разнообразии без ущерба для фактической точности или безопасности модели. Кроме того, наблюдается тенденция, что более способные (крупные) модели получают больше пользы от VS.
В целом, работа предлагает новый взгляд на проблему коллапса моды, объясняя ее через предвзятость в данных, и предоставляет практическое, легковесное решение, раскрывающее потенциал генеративного разнообразия LLM
#DrMax #LLM
По мотивам постов (первый и второй) о креативности контента и анализа исследования.
Коллапс моды (mode collapse) — это явление, при котором большие языковые модели (LLM) после выравнивания (post-training alignment), например, с помощью RLHF, демонстрируют значительное снижение разнообразия ответов, предпочитая узкий набор стереотипных результатов. Авторы исследования определяют, что основной причиной этого является предвзятость типичности (typicality bias), которая широко распространена в данных предпочтений, собранных от аннотаторов. Эта предвзятость основана на когнитивных принципах (например, эффект простого воздействия), заставляющих людей систематически отдавать предпочтение знакомому или типичному тексту.
Теоретический анализ показывает, что эта предвзятость строго обостряет распределение вероятностей, приводя к концентрации вероятностной массы на наиболее типичных ответах, особенно когда множество ответов имеют одинаковую фактическую полезность (например, в креативном письме).
Решение: Вербализованное Сэмплирование (VS)
В качестве решения предлагается Вербализованное Сэмплирование (Verbalized Sampling, VS), простая стратегия промптинга, не требующая дополнительного обучения. Вместо традиционного запроса на один экземпляр ответа (например, "Расскажи мне анекдот...") VS явно запрашивает у модели вербализацию распределения ответов с соответствующими вероятностями (например, "Сгенерируй 5 ответов с их вероятностями").
Результаты и преимущества
VS эффективно обходит коллапс моды, восстанавливая разнообразие, присущее базовой модели. Комплексные эксперименты показали значительные улучшения в:
1. Креативном письме: VS увеличивает разнообразие результатов (стихи, истории, шутки) в 1.6–2.1 раза по сравнению с прямым промптингом.
2. Симуляции диалогов: VS помогает моделям генерировать более разнообразные беседы и симулировать распределение человеческого поведения (например, суммы пожертвований) более реалистично.
3. Открытых вопросах (Open-Ended QA): VS генерирует более широкое и реалистичное распределение ответов, улучшая соответствие исходному распределению данных предобучения.
4. Генерации синтетических данных: VS создает более разнообразные синтетические данные, что, в свою очередь, улучшает производительность моделей в последующих математических задачах.
Важно отметить, что VS достигает этих улучшений в разнообразии без ущерба для фактической точности или безопасности модели. Кроме того, наблюдается тенденция, что более способные (крупные) модели получают больше пользы от VS.
В целом, работа предлагает новый взгляд на проблему коллапса моды, объясняя ее через предвзятость в данных, и предоставляет практическое, легковесное решение, раскрывающее потенциал генеративного разнообразия LLM
#DrMax #LLM