Databricks рассказали как уместить большую модель в маленькую память
FlashOptim - свежая работа от Databricks AI Research, посвящённая очень практической проблеме: обучение больших нейросетей требует огромного количества памяти GPU.
FlashOptim — набор техник, который снижает потребление памяти с 16 до 7 байт на параметр (или до 5 байт с gradient release), без потери качества обучения. GitHub.
Авторы показывают, что для ~50% экономии памяти не нужны сложные методы типа LoRA, GaLore или CPU offloading, достаточно умной упаковки уже существующих тензоров.
Это прямой путь к тому, чтобы обучать модели большего размера на том же железе.
Больше полезных материалов у нас на Patreon
FlashOptim - свежая работа от Databricks AI Research, посвящённая очень практической проблеме: обучение больших нейросетей требует огромного количества памяти GPU.
FlashOptim — набор техник, который снижает потребление памяти с 16 до 7 байт на параметр (или до 5 байт с gradient release), без потери качества обучения. GitHub.
Авторы показывают, что для ~50% экономии памяти не нужны сложные методы типа LoRA, GaLore или CPU offloading, достаточно умной упаковки уже существующих тензоров.
Это прямой путь к тому, чтобы обучать модели большего размера на том же железе.
Больше полезных материалов у нас на Patreon