TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Путь в R&D - Каюмов Лев

13 Jun 2025, 13:12

Open in Telegram Share Report

Попробую новый формат в канале. Обзор статьи Text-to-LoRA: Instant Transformer Adaption | arxiv

TL;DR
Меня заинтересовал концепт гиперсетей, о котором я раньше не слышал, и то, что сделали в статье, вызвало вопрос: можно ли теперь вручную не прописывать LoRA для моделей и тратить "млрды" времени и ресурсов на дообучение? После прочтения оказалось, что можно :)
Введем пару терминов и сокращений, чтобы понимать происходящее:
1. Text-to-LoRA (T2L) — модель из статьи, которая по текстовому описанию задачи может генерировать LoRA-адаптеры или сжимать их для больших языковых моделей (LLM).

2. Large Language Model (LLM) — большая языковая модель.

3. Supervised Fine-Tuning (SFT) — контролируемое дообучение модели с учителем (на основе правильных меток).

4. Low-Rank Adapters (LoRA) — метод SFT, добавляющий адаптеры в модель через низкоранговое разложение матриц A и B, что облегчает обучение больших LLM.

5. Zero-shot — способность модели работать с новыми, ранее не встречавшимися данными без дополнительного обучения, как человек, который применяет знания к новым ситуациям.

🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️🌧️
О чем статья?
Авторы демонстрируют свою новую гиперсеть T2L, которая может адаптировать базовую LLM с помощью LoRA за мгновенье с помощью естественного языка
We introduce Text-to-LoRA (T2L), a model capable of adapting large language models (LLMs) on the fly solely based on a natural language description of the target task.

т.е. написать для решения математической задачи такой промпт:
This task challenges your problem-solving abilities through mathematical reasoning. You must carefully read each scenario and systematically work through the data to compute the final outcome.

Она добавит подходящий адаптер, и тогда базовая модель сможет правильно решить задачу

Архитектура T2L
T2L включает три варианта по размеру: S (small), M (medium) и L (large). Основные компоненты:

Task emb — векторное представление задачи (например, решение математической задачи)
Task enc — кодирование задачи в скрытое представление
Module emb — Для каких модулей нужны адаптеры
Depth emb — На каких слоях ставить адаптеры
MLP — многослойный перцептрон, обрабатывающий полученные эмбеддинги
A/B emb, Rank emb — задают структуру адаптера относительно архитектуры (S, M, L)
Head — итоговый выход — сгенерированные LoRA-адаптеры

Обучение T2L
(Схему обучения прикреплю в коментах). Модель может обучаться двумя способами:
1. Reconstruction W -> Пытается реконструировать, в контексте данной задачи, десцелировать адаптеры, сжимать их

2. SFT , Loss -> Обучается напрямую на задачах с размеченными данными, минуя стадию реконструкции адаптеров и сразу их генерирует
В итоге лучший результат для zero-shot был SFT


Результаты
Модель круто сжимает адаптеры в 64, 128 и 256 раз с небольшой потерей производительности. Архитектуры T2L среднего (M) и большого (L) размеров генерируют LoRA-адаптеры, превосходящие сильный мультизадачный бейзлайн MT-LoRA, который не учитывает специфику каждой задачи, тогда как T2L успешно использует текстовое описание для лучшей адаптации

Плюсы:
✅ Не нужно обучать отдельные адаптеры для каждой задачи — достаточно текстового описания
✅ Мгновенная генерация адаптера позволяет быстро и дёшево адаптировать модель под новые задачи
✅ Делает настройку ИИ-моделей доступной для широкого круга пользователей

Минусы❓
❌ Слишком тонкая настройка под определенную задачу через промпт
❌ Для какой-то сильно уникальной задачи будет тяжко и лучше написать самостоятельно

На пути R&D: 1232
@RnDLabs | #ArtOverview@rndlabs

128 0 1 4 19
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot