🛠️ Метод
По существу предлагается не так уж много:
- 📐 Берем квадратичное разложение. Вместо полного Гессиана (матрицы Фишера) берем диагональ, а ее оцениваем через статистики Адама (которые у нас и так есть).
- ⚖️ Диагональ Фишера используем для подбора оптимальных скейлов при заданных квантованных значениях (кодах). Перебирая общий скейл-фактор, находим оптимальные коды.
- 🔢 В основном фокусируются на INT2/3/4, но еще рассматривают и NVFP4, где скейлы перебираются по FP8-сетке.
Дальше много всякой теоретической лабуды, которой я не читал.
🧪 Эксперименты
Для валидации метода рассматривают QAD (дистилляцию на логитах исходной модели) предобученных Qwen3-4B-Thinking-2507 и Llama-3.1-8B-Instruct, а также SFT Qwen3-4B-Base.
По бенчам в 2 битах оно заметно лучше QAT/PTQ-бейзлайнов, в 3 и 4 битах разница не столь существенна. Лосс на обучении ниже и стабильнее.
Ablation показывает, что все компоненты дают пользу:
- 🧠 Hessian-aware взвешивание
- 🔍 Поиск скейлов
Итоговый оверхед якобы небольшой — замедление шага обучения всего на 1,5% против стандартного QAT со STE.
🧾 Выводы
Вроде бы несложная модификация STE, потенциально улучшающая качество. Но эффект провалидирован только на небольших моделях (обучение без FSDP, по всей видимости). Для больших моделей аншардирование статистик Адама может приводить к нетривиальному замедлению. Кроме того, нынче модно учить с Мюоном, а там аналога такой кривизны просто нет. При этом Мюон со STE может быть и не хуже Адама с прибамбасами, кто знает. Но для лечения GGUFов тема вполне рабочая.
По существу предлагается не так уж много:
- 📐 Берем квадратичное разложение. Вместо полного Гессиана (матрицы Фишера) берем диагональ, а ее оцениваем через статистики Адама (которые у нас и так есть).
- ⚖️ Диагональ Фишера используем для подбора оптимальных скейлов при заданных квантованных значениях (кодах). Перебирая общий скейл-фактор, находим оптимальные коды.
- 🔢 В основном фокусируются на INT2/3/4, но еще рассматривают и NVFP4, где скейлы перебираются по FP8-сетке.
Дальше много всякой теоретической лабуды, которой я не читал.
🧪 Эксперименты
Для валидации метода рассматривают QAD (дистилляцию на логитах исходной модели) предобученных Qwen3-4B-Thinking-2507 и Llama-3.1-8B-Instruct, а также SFT Qwen3-4B-Base.
По бенчам в 2 битах оно заметно лучше QAT/PTQ-бейзлайнов, в 3 и 4 битах разница не столь существенна. Лосс на обучении ниже и стабильнее.
Ablation показывает, что все компоненты дают пользу:
- 🧠 Hessian-aware взвешивание
- 🔍 Поиск скейлов
Итоговый оверхед якобы небольшой — замедление шага обучения всего на 1,5% против стандартного QAT со STE.
🧾 Выводы
Вроде бы несложная модификация STE, потенциально улучшающая качество. Но эффект провалидирован только на небольших моделях (обучение без FSDP, по всей видимости). Для больших моделей аншардирование статистик Адама может приводить к нетривиальному замедлению. Кроме того, нынче модно учить с Мюоном, а там аналога такой кривизны просто нет. При этом Мюон со STE может быть и не хуже Адама с прибамбасами, кто знает. Но для лечения GGUFов тема вполне рабочая.