Google выпустили TurboQuant, который в 6 раз уменьшает память, нужную ИИ-модели для длинного контекста
Применяется не только для LLM, но и для векторного поиска.
В итоге получается на практике: сжатие до 3.5 бит без потери точности вообще.
Скорость квантизации - 0.0013 секунды.
Работает на Nvidia GPU без переобучения модели. Это решает задачу Gemini при работе с длинным контекстом и на чужом железе.
Применяется не только для LLM, но и для векторного поиска.
В итоге получается на практике: сжатие до 3.5 бит без потери точности вообще.
Скорость квантизации - 0.0013 секунды.
Работает на Nvidia GPU без переобучения модели. Это решает задачу Gemini при работе с длинным контекстом и на чужом железе.