Strata v0.1.31 - большое обновление
Вышла новая версия Strata. Самое интересное:
• Unsloth UD-Q4_K_XL теперь можно запускать даже на ПК с 64 ГБ RAM, хотя сама модель занимает около 111 ГБ. Эксперты делятся на 3 уровня: самые используемые хранятся в VRAM, следующие - в RAM, редкие читаются прямо с SSD. На RTX 5070 12 ГБ + 64 ГБ RAM автор получил примерно 7-8.5 т/с.
• Появился reasoning_budget_tokens — теперь можно жёстко ограничить количество токенов, которое модель тратит на thinking, после чего она переходит к ответу. Это прям мне нехватало.
• Уважили также и АМДэшников. Для AMD RDNA4 decode ускорился до +15%. На Radeon AI PRO R9700 скорость выросла с 67 до 82 т/с.
• Для multi-GPU появился "split_skip_if_fits": true — можно автоматически не делить модель, если первая карта и так вмещает все experts.
• Новый экспериментальный STRATA_GR_V3=1 даёт ещё примерно +2-4% decode.
Multi-GPU теперь поддерживается и на нескольких AMD-картах.
Для обновления достаточно сделать git pull и снова запустить START-HERE.bat. Setup сам установит engine 0.1.31.
Остальные обновы можете почитать тут: https://github.com/Niko1221/Strata/releases/tag/v0.1.31
Испытали уже? Кидайте результаты в комменты!
MrGips • Про LLM / НАШ ЧАТ
Вышла новая версия Strata. Самое интересное:
• Unsloth UD-Q4_K_XL теперь можно запускать даже на ПК с 64 ГБ RAM, хотя сама модель занимает около 111 ГБ. Эксперты делятся на 3 уровня: самые используемые хранятся в VRAM, следующие - в RAM, редкие читаются прямо с SSD. На RTX 5070 12 ГБ + 64 ГБ RAM автор получил примерно 7-8.5 т/с.
• Появился reasoning_budget_tokens — теперь можно жёстко ограничить количество токенов, которое модель тратит на thinking, после чего она переходит к ответу. Это прям мне нехватало.
• Уважили также и АМДэшников. Для AMD RDNA4 decode ускорился до +15%. На Radeon AI PRO R9700 скорость выросла с 67 до 82 т/с.
• Для multi-GPU появился "split_skip_if_fits": true — можно автоматически не делить модель, если первая карта и так вмещает все experts.
• Новый экспериментальный STRATA_GR_V3=1 даёт ещё примерно +2-4% decode.
Multi-GPU теперь поддерживается и на нескольких AMD-картах.
Для обновления достаточно сделать git pull и снова запустить START-HERE.bat. Setup сам установит engine 0.1.31.
Остальные обновы можете почитать тут: https://github.com/Niko1221/Strata/releases/tag/v0.1.31
Испытали уже? Кидайте результаты в комменты!
MrGips • Про LLM / НАШ ЧАТ