Попробую новый формат в канале. Обзор статьи Text-to-LoRA: Instant Transformer Adaption | arxiv
TL;DR
Меня заинтересовал концепт гиперсетей, о котором я раньше не слышал, и то, что сделали в статье, вызвало вопрос: можно ли теперь вручную не прописывать LoRA для моделей и тратить "млрды" времени и ресурсов на дообучение? После прочтения оказалось, что можно :)
🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️
О чем статья?
Авторы демонстрируют свою новую гиперсеть T2L, которая может адаптировать базовую LLM с помощью LoRA за мгновенье с помощью естественного языка
т.е. написать для решения математической задачи такой промпт:
Она добавит подходящий адаптер, и тогда базовая модель сможет правильно решить задачу
Архитектура T2L
T2L включает три варианта по размеру: S (small), M (medium) и L (large). Основные компоненты:
Task emb — векторное представление задачи (например, решение математической задачи)
Task enc — кодирование задачи в скрытое представление
Module emb — Для каких модулей нужны адаптеры
Depth emb — На каких слоях ставить адаптеры
MLP — многослойный перцептрон, обрабатывающий полученные эмбеддинги
A/B emb, Rank emb — задают структуру адаптера относительно архитектуры (S, M, L)
Head — итоговый выход — сгенерированные LoRA-адаптеры
Обучение T2L
(Схему обучения прикреплю в коментах). Модель может обучаться двумя способами:
1. Reconstruction W -> Пытается реконструировать, в контексте данной задачи, десцелировать адаптеры, сжимать их
2. SFT , Loss -> Обучается напрямую на задачах с размеченными данными, минуя стадию реконструкции адаптеров и сразу их генерирует
В итоге лучший результат для zero-shot был SFT
Результаты
Модель круто сжимает адаптеры в 64, 128 и 256 раз с небольшой потерей производительности. Архитектуры T2L среднего (M) и большого (L) размеров генерируют LoRA-адаптеры, превосходящие сильный мультизадачный бейзлайн MT-LoRA, который не учитывает специфику каждой задачи, тогда как T2L успешно использует текстовое описание для лучшей адаптации
Плюсы:
✅ Не нужно обучать отдельные адаптеры для каждой задачи — достаточно текстового описания
✅ Мгновенная генерация адаптера позволяет быстро и дёшево адаптировать модель под новые задачи
✅ Делает настройку ИИ-моделей доступной для широкого круга пользователей
Минусы❓
❌ Слишком тонкая настройка под определенную задачу через промпт
❌ Для какой-то сильно уникальной задачи будет тяжко и лучше написать самостоятельно
На пути R&D: 1232
@RnDLabs | #ArtOverview@rndlabs
TL;DR
Меня заинтересовал концепт гиперсетей, о котором я раньше не слышал, и то, что сделали в статье, вызвало вопрос: можно ли теперь вручную не прописывать LoRA для моделей и тратить "млрды" времени и ресурсов на дообучение? После прочтения оказалось, что можно :)
Введем пару терминов и сокращений, чтобы понимать происходящее:
1. Text-to-LoRA (T2L) — модель из статьи, которая по текстовому описанию задачи может генерировать LoRA-адаптеры или сжимать их для больших языковых моделей (LLM).
2. Large Language Model (LLM) — большая языковая модель.
3. Supervised Fine-Tuning (SFT) — контролируемое дообучение модели с учителем (на основе правильных меток).
4. Low-Rank Adapters (LoRA) — метод SFT, добавляющий адаптеры в модель через низкоранговое разложение матриц A и B, что облегчает обучение больших LLM.
5. Zero-shot — способность модели работать с новыми, ранее не встречавшимися данными без дополнительного обучения, как человек, который применяет знания к новым ситуациям.
🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️
О чем статья?
Авторы демонстрируют свою новую гиперсеть T2L, которая может адаптировать базовую LLM с помощью LoRA за мгновенье с помощью естественного языка
We introduce Text-to-LoRA (T2L), a model capable of adapting large language models (LLMs) on the fly solely based on a natural language description of the target task.
т.е. написать для решения математической задачи такой промпт:
This task challenges your problem-solving abilities through mathematical reasoning. You must carefully read each scenario and systematically work through the data to compute the final outcome.
Она добавит подходящий адаптер, и тогда базовая модель сможет правильно решить задачу
Архитектура T2L
T2L включает три варианта по размеру: S (small), M (medium) и L (large). Основные компоненты:
Task emb — векторное представление задачи (например, решение математической задачи)
Task enc — кодирование задачи в скрытое представление
Module emb — Для каких модулей нужны адаптеры
Depth emb — На каких слоях ставить адаптеры
MLP — многослойный перцептрон, обрабатывающий полученные эмбеддинги
A/B emb, Rank emb — задают структуру адаптера относительно архитектуры (S, M, L)
Head — итоговый выход — сгенерированные LoRA-адаптеры
Обучение T2L
(Схему обучения прикреплю в коментах). Модель может обучаться двумя способами:
1. Reconstruction W -> Пытается реконструировать, в контексте данной задачи, десцелировать адаптеры, сжимать их
2. SFT , Loss -> Обучается напрямую на задачах с размеченными данными, минуя стадию реконструкции адаптеров и сразу их генерирует
В итоге лучший результат для zero-shot был SFT
Результаты
Модель круто сжимает адаптеры в 64, 128 и 256 раз с небольшой потерей производительности. Архитектуры T2L среднего (M) и большого (L) размеров генерируют LoRA-адаптеры, превосходящие сильный мультизадачный бейзлайн MT-LoRA, который не учитывает специфику каждой задачи, тогда как T2L успешно использует текстовое описание для лучшей адаптации
Плюсы:
✅ Не нужно обучать отдельные адаптеры для каждой задачи — достаточно текстового описания
✅ Мгновенная генерация адаптера позволяет быстро и дёшево адаптировать модель под новые задачи
✅ Делает настройку ИИ-моделей доступной для широкого круга пользователей
Минусы❓
❌ Слишком тонкая настройка под определенную задачу через промпт
❌ Для какой-то сильно уникальной задачи будет тяжко и лучше написать самостоятельно
На пути R&D: 1232
@RnDLabs | #ArtOverview@rndlabs