✏️
Как обучать LLM быстрее и не упереться в память GPU?Претрейнинг — этап, на котором LLM учится на огромном объёме данных.
За то, как на каждом шаге меняются её веса, отвечает оптимизатор — алгоритм, который помогает модели уменьшать ошибку. На больших моделях от его выбора зависят не только качество, но и скорость обучения и расход памяти.👤
Глеб Молодцов, исследователь BRAIn Lab, разобрал, как выбирать оптимизатор с учётом трёх вещей:
качества, памяти и времени обучения.В карточках — база. В лекции — подробнее🔽
🟠 когда вообще стоит экономить память на оптимизаторе;
🟠 чем AdEMAMix отличается от привычного AdamW;
🟠 как FP8 помогает ускорить обучение;
🟠 почему лучший результат за одинаковое число шагов ≠ лучший результат за одинаковое время.
▶️
СМОТРЕТЬ ЛЕКЦИЮ🐘 — нет времени тренировать LLM, тренируюсь сам
😎 — нет времени тренироваться, тренирую LLM
@aitalenthubnews#Microlearning #ITMO #NapoleonIT