Млечный путь.pdf
Перечень полезных источников "Как приручить LLM"
Друзья, делюсь с вами полезными источниками, на основе которых рассказывал про подбор инфраструктуры для LLM
- Карточка модели Qwen со страницы HuggingFace
- Статья про оценку VRam при подборе GPU
- Онлайн калькулятор подсчета VRam
- Инференс фреймворки Ollama, SGLang, VLLM
- Конфигурация VLLM
- Инструменты нагрузочного тестирования locust, k6, gatling, apache jmeter, яндекс танк
- Инструмент нагрузочного тестирования для инференеса от Nvidia - perf analyzer, gen ai perf
- Режимы gen ai perf - Analyze, Sessions
- Квантиазции GGUF, AWQ, GPTQ
- Бекенды Triton для LLM - VLLM, TensoRT LLM
- Утилита для импорта конфигурации Triton для LLM
- Бенчмарки TensorRT LLM
- Статья сравнения инференсов для LLM от bentoML cloud
Как вам доклад? Оставляйте свои реакции и комменты!
Друзья, делюсь с вами полезными источниками, на основе которых рассказывал про подбор инфраструктуры для LLM
- Карточка модели Qwen со страницы HuggingFace
- Статья про оценку VRam при подборе GPU
- Онлайн калькулятор подсчета VRam
- Инференс фреймворки Ollama, SGLang, VLLM
- Конфигурация VLLM
- Инструменты нагрузочного тестирования locust, k6, gatling, apache jmeter, яндекс танк
- Инструмент нагрузочного тестирования для инференеса от Nvidia - perf analyzer, gen ai perf
- Режимы gen ai perf - Analyze, Sessions
- Квантиазции GGUF, AWQ, GPTQ
- Бекенды Triton для LLM - VLLM, TensoRT LLM
- Утилита для импорта конфигурации Triton для LLM
- Бенчмарки TensorRT LLM
- Статья сравнения инференсов для LLM от bentoML cloud
Как вам доклад? Оставляйте свои реакции и комменты!