сбежавшая нейросеть dan repost
Qwen3.8-27B – новая народная открытая модель
С релиза открытых весов Qwen3.8-27B прошла всего неделя, а сообщество понаделало с ней уже столько разных классных штук, что в один ТГ-пост не влезет. Напомню про саму модель: 27 миллиардов параметров можно утрамбовать в память одной RTX5090 или двух RTX3090, при этом Alibaba сравнивает модель с куда более серьезной Claude Sonnet 5.
Но справедливости ради, в ту же RTX5090 модель лезет впритык – места под длинные диалоги уже не остается. И купить такую могут лишь единицы – в массе у народа карточки попроще. Поэтому сообщество сразу занялось квантованием – сжатием модели за счет хранения весов с меньшей точностью.
Любой квант ухудшает параметры модели, но насколько – зависит от технологии. Сейчас один из топов – это линейка Unsloth. Они используют динамическое квантование: те части модели, которые переносят огрубление “спокойно”, квантуют более агрессивно, а те, которые от него ломаются – почти не трогают. Динамический квант жмет выборочно – как JPEG бережет лицо и не жалеет фон.
В Unsloth утверждают о преимуществе более 10% над другими технологиями квантования. При этом требования к памяти режутся очень мощно: например, экстремальная однобитная сборка держит 77% точности оригинальной модели (по замерам Unsloth), но требует всего 8 гигабайт памяти – можно запускать даже на ноутбуке без видеокарты.
Для моей RTX 3090 рекомендуют UD-Q4_K_XL, которая весит 17,92 ГБ – она не сильно теряет в точности, но оставляет много памяти под контекст. Примерный ориентир по нужному объему памяти для разных квантов дает картинка в начале поста.
За пять дней люди скачали 5,1 млн квантов Unsloth – достойное внимание.
А параллельно сообщество занималось доработкой весов до клубничного вкуса 🍓 Речь о расцензуренных сборках Qwen3.8 – тех, в которых модель не отвечает отказом даже на пограничные вопросы.
Я никогда не закапывался глубоко в то, как с открытых моделей снимают цензуру, а оказалось достаточно интересно. Ответ “не могу помочь” живет внутри модели как направление в ее представлениях. Оно вполне конкретно, а значит может быть удалено с помощью аблитерации – приема, когда направление находят и вырезают из весов.
Интересно, что гонка тут идет в две стороны сразу. Сообщество совершенствует аблитерацию – и даже создало автоматический инструмент расцензуривания Heretic. Инженеры крупных компаний придумывают все более хитрые способы спрятать направление отказа. И в случае с Qwen3.8 почти удалось – после прогона оригинального Heretic модель продолжала говорить “нет” в 97 из 100 случаев.
У модели есть такое понятие, как внимание – это когда каждое слово “смотрит” на все остальные. И есть линейное внимание – упрощенный и дешевый вариант. Alibaba в Qwen3.8 смешали оба вида внимания: 16 слоев дорогих и 48 слоев дешевых. На этом и сломался Heretic – он правил только дорогие слои.
Сразу несколько команд перебрали архитектуру модели, чтобы дотянуться до всех нужных слоев. И сделали это максимально быстро: веса вышли 14 августа, а версии без цензуры начали появляться 16-го.
Расцензура, кстати, не абсолютная: некоторые отказы вырезать не удалось, а некоторые команды оставили намеренно – речь о наиболее чувствительных вопросах. Но это лишь 3 случая на 100, что крохи.
Оригинальный Qwen3.8-27B Alibaba выпускала все-таки не для массового пользователя – нормально он пойдет на профессиональных GPU. Народной модель сделало само сообщество: выпустив кванты и расцензуренные версии. И это только начало – сообщество наверняка придумает что-то новое.
—
Несколько недель назад я выпустил лонгрид с ликбезом по открытым моделям – а сейчас доработал под Qwen3.8-27B. В тексте разобраны основные термины и харкатеристики, какое железо нужно и как запустить модель без больших усилий.
👉 Читаем здесь.
С релиза открытых весов Qwen3.8-27B прошла всего неделя, а сообщество понаделало с ней уже столько разных классных штук, что в один ТГ-пост не влезет. Напомню про саму модель: 27 миллиардов параметров можно утрамбовать в память одной RTX5090 или двух RTX3090, при этом Alibaba сравнивает модель с куда более серьезной Claude Sonnet 5.
Но справедливости ради, в ту же RTX5090 модель лезет впритык – места под длинные диалоги уже не остается. И купить такую могут лишь единицы – в массе у народа карточки попроще. Поэтому сообщество сразу занялось квантованием – сжатием модели за счет хранения весов с меньшей точностью.
Любой квант ухудшает параметры модели, но насколько – зависит от технологии. Сейчас один из топов – это линейка Unsloth. Они используют динамическое квантование: те части модели, которые переносят огрубление “спокойно”, квантуют более агрессивно, а те, которые от него ломаются – почти не трогают. Динамический квант жмет выборочно – как JPEG бережет лицо и не жалеет фон.
В Unsloth утверждают о преимуществе более 10% над другими технологиями квантования. При этом требования к памяти режутся очень мощно: например, экстремальная однобитная сборка держит 77% точности оригинальной модели (по замерам Unsloth), но требует всего 8 гигабайт памяти – можно запускать даже на ноутбуке без видеокарты.
Для моей RTX 3090 рекомендуют UD-Q4_K_XL, которая весит 17,92 ГБ – она не сильно теряет в точности, но оставляет много памяти под контекст. Примерный ориентир по нужному объему памяти для разных квантов дает картинка в начале поста.
За пять дней люди скачали 5,1 млн квантов Unsloth – достойное внимание.
А параллельно сообщество занималось доработкой весов до клубничного вкуса 🍓 Речь о расцензуренных сборках Qwen3.8 – тех, в которых модель не отвечает отказом даже на пограничные вопросы.
Я никогда не закапывался глубоко в то, как с открытых моделей снимают цензуру, а оказалось достаточно интересно. Ответ “не могу помочь” живет внутри модели как направление в ее представлениях. Оно вполне конкретно, а значит может быть удалено с помощью аблитерации – приема, когда направление находят и вырезают из весов.
Интересно, что гонка тут идет в две стороны сразу. Сообщество совершенствует аблитерацию – и даже создало автоматический инструмент расцензуривания Heretic. Инженеры крупных компаний придумывают все более хитрые способы спрятать направление отказа. И в случае с Qwen3.8 почти удалось – после прогона оригинального Heretic модель продолжала говорить “нет” в 97 из 100 случаев.
У модели есть такое понятие, как внимание – это когда каждое слово “смотрит” на все остальные. И есть линейное внимание – упрощенный и дешевый вариант. Alibaba в Qwen3.8 смешали оба вида внимания: 16 слоев дорогих и 48 слоев дешевых. На этом и сломался Heretic – он правил только дорогие слои.
Сразу несколько команд перебрали архитектуру модели, чтобы дотянуться до всех нужных слоев. И сделали это максимально быстро: веса вышли 14 августа, а версии без цензуры начали появляться 16-го.
Расцензура, кстати, не абсолютная: некоторые отказы вырезать не удалось, а некоторые команды оставили намеренно – речь о наиболее чувствительных вопросах. Но это лишь 3 случая на 100, что крохи.
Оригинальный Qwen3.8-27B Alibaba выпускала все-таки не для массового пользователя – нормально он пойдет на профессиональных GPU. Народной модель сделало само сообщество: выпустив кванты и расцензуренные версии. И это только начало – сообщество наверняка придумает что-то новое.
—
Несколько недель назад я выпустил лонгрид с ликбезом по открытым моделям – а сейчас доработал под Qwen3.8-27B. В тексте разобраны основные термины и харкатеристики, какое железо нужно и как запустить модель без больших усилий.
👉 Читаем здесь.