LMCache: Оптимизация LLM-инференса через умное кэширование KV
🌟 LMCache: Умное кэширование для LLM-инференса, которое экономит время и ресурсы. Этот проект превращает одноразовые вычисления в многократно используемые блоки, сохраняя KV-кэш на CPU, диске или даже специализированной памяти NIXL. Благодаря LMCache, выгрузка KV-кэшей освобождает GPU для новых задач, снижая TTFT до 10 раз.
LMCache предлагает гибкое решение: кэши можно не только выгружать, но и делиться между разными инстансами LLM, избегая дублирования работы даже для частичных совпадений входных данных. Кроме того, LMCache позволяет разнести prefill и decode, обрабатывая первый этап на мощных узлах, а второй – на оптимизированных для генерации. Это повышает пропускную способность распределенных систем и снижает задержку в 3-10 раз. Проект тесно интегрируется с vLLM и включает примеры, документацию и калькулятор KV-кеша для оценки экономии VRAM.
Github
Источник
📌 Источник: Machinelearning
#ai #ml #mlops #tool #performance #open_source
📢 Канал: @aiml_daily_ru
🌟 LMCache: Умное кэширование для LLM-инференса, которое экономит время и ресурсы. Этот проект превращает одноразовые вычисления в многократно используемые блоки, сохраняя KV-кэш на CPU, диске или даже специализированной памяти NIXL. Благодаря LMCache, выгрузка KV-кэшей освобождает GPU для новых задач, снижая TTFT до 10 раз.
LMCache предлагает гибкое решение: кэши можно не только выгружать, но и делиться между разными инстансами LLM, избегая дублирования работы даже для частичных совпадений входных данных. Кроме того, LMCache позволяет разнести prefill и decode, обрабатывая первый этап на мощных узлах, а второй – на оптимизированных для генерации. Это повышает пропускную способность распределенных систем и снижает задержку в 3-10 раз. Проект тесно интегрируется с vLLM и включает примеры, документацию и калькулятор KV-кеша для оценки экономии VRAM.
Github
Источник
📌 Источник: Machinelearning
#ai #ml #mlops #tool #performance #open_source
📢 Канал: @aiml_daily_ru