Квантизация LLM часто упирается не в сам размер модели, а в то, как неудобно распределены значения активаций. ConQuR предлагает перед квантизацией вращать пространство признаков так, чтобы активации лучше укладывались в доступное представление.
Название расшифровывается как Corner Aligned Activation Quantization via Optimized Rotations: авторы оптимизируют повороты и выравнивают распределение активаций относительно углов квантизационной области. Идея довольно инженерная, но именно такие детали часто решают, сохранится ли качество после перехода к более дешёвому числовому формату.
Эксперименты в работе проведены на моделях Llama-2 и Llama-3. В описании нет одного эффектного универсального числа, которое честно пересказало бы весь результат, поэтому здесь интереснее сама точка приложения: авторы работают с геометрией активаций, а не просто уменьшают разрядность по шаблону. Работа получила обновлённую версию v2 на arXiv.
Велкам
Название расшифровывается как Corner Aligned Activation Quantization via Optimized Rotations: авторы оптимизируют повороты и выравнивают распределение активаций относительно углов квантизационной области. Идея довольно инженерная, но именно такие детали часто решают, сохранится ли качество после перехода к более дешёвому числовому формату.
Эксперименты в работе проведены на моделях Llama-2 и Llama-3. В описании нет одного эффектного универсального числа, которое честно пересказало бы весь результат, поэтому здесь интереснее сама точка приложения: авторы работают с геометрией активаций, а не просто уменьшают разрядность по шаблону. Работа получила обновлённую версию v2 на arXiv.
Велкам