Репост из: Всеволод Викулин
Нашел небольшую и чудесную методичку по инференсу LLM.
Понятно, наглядно, без сложных подробностей. Читается легко за пару вечеров.
Что там есть
- Как работает инференс LLM (Prefill стадия, декодинг стадия)
- Как посчитать, сколько нужно VRAM у GPU
- Какие есть надежные фреймворки
- Метрики для инференса
- Методы ускорения LLM
и много всего еще
Чего там нет
Нет технических кишок, как устроена модель памяти в GPU, что такое арифметическая интенсивность, Kernel Fusion и тому подобное. Это может пригодиться, если вам не хватит готовых фреймворков и захотите залезть поглубже в кроличью нору.
Тогда вам поможет зубодробительная статья тут и немного менее тут.
Теперь вы знаете, что делать вечером в воскресенье, не благодарите :)
Понятно, наглядно, без сложных подробностей. Читается легко за пару вечеров.
Что там есть
- Как работает инференс LLM (Prefill стадия, декодинг стадия)
- Как посчитать, сколько нужно VRAM у GPU
- Какие есть надежные фреймворки
- Метрики для инференса
- Методы ускорения LLM
и много всего еще
Чего там нет
Нет технических кишок, как устроена модель памяти в GPU, что такое арифметическая интенсивность, Kernel Fusion и тому подобное. Это может пригодиться, если вам не хватит готовых фреймворков и захотите залезть поглубже в кроличью нору.
Тогда вам поможет зубодробительная статья тут и немного менее тут.
Теперь вы знаете, что делать вечером в воскресенье, не благодарите :)