🚀Cerebras представили gigaGPT, которая обучает модели размера GPT-3 всего за 565 строк кода
Сегодня нет простого способа обучения большой модели. nanoGPT занимает около 600 строк кода и обучает модели 1B. Но для обучения модели 175B требуются огромные фреймворки, такие как Megatron с > 20 тысячами строк кода.
GigaGPT обучает модели в 1000 раз больше.
Cerebras использовали gigaGPT для обучения моделей от 111M до 70B. Учитывая, что оборудование Cerebras имеет > 12 ТБ памяти, они смогли обучучить модели GPT за пределами 1T параметров.
Про Cerebras подробнее можно почитать у нас тут.
Сегодня нет простого способа обучения большой модели. nanoGPT занимает около 600 строк кода и обучает модели 1B. Но для обучения модели 175B требуются огромные фреймворки, такие как Megatron с > 20 тысячами строк кода.
GigaGPT обучает модели в 1000 раз больше.
Cerebras использовали gigaGPT для обучения моделей от 111M до 70B. Учитывая, что оборудование Cerebras имеет > 12 ТБ памяти, они смогли обучучить модели GPT за пределами 1T параметров.
Про Cerebras подробнее можно почитать у нас тут.