TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Путь в R&D - Каюмов Лев

13 Jun 2025, 13:12

Открыть в Telegram Поделиться Пожаловаться

Попробую новый формат в канале. Обзор статьи Text-to-LoRA: Instant Transformer Adaption | arxiv

TL;DR
Меня заинтересовал концепт гиперсетей, о котором я раньше не слышал, и то, что сделали в статье, вызвало вопрос: можно ли теперь вручную не прописывать LoRA для моделей и тратить "млрды" времени и ресурсов на дообучение? После прочтения оказалось, что можно :)
Введем пару терминов и сокращений, чтобы понимать происходящее:
1. Text-to-LoRA (T2L) — модель из статьи, которая по текстовому описанию задачи может генерировать LoRA-адаптеры или сжимать их для больших языковых моделей (LLM).

2. Large Language Model (LLM) — большая языковая модель.

3. Supervised Fine-Tuning (SFT) — контролируемое дообучение модели с учителем (на основе правильных меток).

4. Low-Rank Adapters (LoRA) — метод SFT, добавляющий адаптеры в модель через низкоранговое разложение матриц A и B, что облегчает обучение больших LLM.

5. Zero-shot — способность модели работать с новыми, ранее не встречавшимися данными без дополнительного обучения, как человек, который применяет знания к новым ситуациям.

🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️
О чем статья?
Авторы демонстрируют свою новую гиперсеть T2L, которая может адаптировать базовую LLM с помощью LoRA за мгновенье с помощью естественного языка
We introduce Text-to-LoRA (T2L), a model capable of adapting large language models (LLMs) on the fly solely based on a natural language description of the target task.

т.е. написать для решения математической задачи такой промпт:
This task challenges your problem-solving abilities through mathematical reasoning. You must carefully read each scenario and systematically work through the data to compute the final outcome.

Она добавит подходящий адаптер, и тогда базовая модель сможет правильно решить задачу

Архитектура T2L
T2L включает три варианта по размеру: S (small), M (medium) и L (large). Основные компоненты:

Task emb — векторное представление задачи (например, решение математической задачи)
Task enc — кодирование задачи в скрытое представление
Module emb — Для каких модулей нужны адаптеры
Depth emb — На каких слоях ставить адаптеры
MLP — многослойный перцептрон, обрабатывающий полученные эмбеддинги
A/B emb, Rank emb — задают структуру адаптера относительно архитектуры (S, M, L)
Head — итоговый выход — сгенерированные LoRA-адаптеры

Обучение T2L
(Схему обучения прикреплю в коментах). Модель может обучаться двумя способами:
1. Reconstruction W -> Пытается реконструировать, в контексте данной задачи, десцелировать адаптеры, сжимать их

2. SFT , Loss -> Обучается напрямую на задачах с размеченными данными, минуя стадию реконструкции адаптеров и сразу их генерирует
В итоге лучший результат для zero-shot был SFT


Результаты
Модель круто сжимает адаптеры в 64, 128 и 256 раз с небольшой потерей производительности. Архитектуры T2L среднего (M) и большого (L) размеров генерируют LoRA-адаптеры, превосходящие сильный мультизадачный бейзлайн MT-LoRA, который не учитывает специфику каждой задачи, тогда как T2L успешно использует текстовое описание для лучшей адаптации

Плюсы:
✅ Не нужно обучать отдельные адаптеры для каждой задачи — достаточно текстового описания
✅ Мгновенная генерация адаптера позволяет быстро и дёшево адаптировать модель под новые задачи
✅ Делает настройку ИИ-моделей доступной для широкого круга пользователей

Минусы❓
❌ Слишком тонкая настройка под определенную задачу через промпт
❌ Для какой-то сильно уникальной задачи будет тяжко и лучше написать самостоятельно

На пути R&D: 1232
@RnDLabs | #ArtOverview@rndlabs

128 0 1 4 19
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot