Разбираем нашу новую работу — на этот раз с неожиданным выводом 😳
Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression[статья][код]Тензорные разложения (Tucker, Tensor Train (TT)) выглядят идеальным инструментом для сжатия LLM: экспоненциальная компрессия, красивая теория, естественное соответствие структуре Transformer.
Но работают ли они на реальном деплое? Мы провели первое систематическое исследование — и ответ: нет.
🔍
Что мы сделали:🔵проверили tensor- и matrix-разложения на dense (GPT-J 6B, LLaMA 2 7B) и MoE (Qwen3-30B-A3B, GPT-OSS-20B) архитектурах
🔵сравнили с квантизацией (RTN 4/8 бит) на одинаковых модулях
🔵нашли и формализовали фундаментальную причину провала
💡
Главный вывод: тензорные форматы оптимизируют не ту геометрию.Tucker и TT минимизируют ошибку по Фробениусу, а функциональное поведение модели определяется операторной нормой. На спектрах весов LLM (а они с тяжелыми хвостами: α < 1/2 — мы измерили!) разрыв растёт полиномиально с размером слоя.
Плюс super-weights: чтобы восстановить один критический скаляр с помощью truncated SVD, нужен ранг 1500+. Практические ранги даже близко не подходят.
📊 Результаты:🔵Даже в MoE, где эксперты «должны» быть избыточны, matrix-метод MoBE стабильно бьёт тензорный TD-MoE
🔵Простая RTN-квантизация без потерь качества даёт ≈18% сжатия — недостижимо для любого разложения
🔵LoRA-repair смягчает, но не лечит
Итог честный:
тензорные разложения — не замена квантизации, а в лучшем случае дополнение. И теперь понятно, почему.👇 Листай карточки — объяснили простым языком.
#разборстатьи
@brainlaboratory