Две новости китайского опенсорса: тревожная и хорошая
Начнем с тревожной: Z.ai выпустили GLM-5.3, это крутая модель, но… ее веса мы не увидим как минимум в ближайшие две недели. Причина – модель подхватила американскую заразу и также начала показывать недюжинные киберспособности.
Собственно, про это говорится и в слогане GLM-5.3: “Built to Code. Ready for Cyber Defense” — “Создана для кода. Готова к киберзащите”. Защитные способности действительно хороши.
На CyberGym – тесте, где надо найти уязвимость и доказать, что она настоящая, – GLM-5.3 набрала 84,5% (Claude Mythos 5 – 83,8%, GPT-5.6 Sol – 83,6%, а прошлая GLM-5.2 – 77,2%). Первый раз, когда закрытый американский фронтир в поиске дыр обошла китайская модель.
Вместе с командами Цинхуа, Нанькайского университета и несколькими компаниями по безопасности Z.ai прогнала свои модели по реальному коду. Итог – 2436 уязвимостей в 269 проектах, 1097 из них критические или высокой серьезности. Самая старая находка пролежала в коде с 1981 года, а средний возраст уязвимости до обнаружения – 26,6 года.
Из-за чего же придержали веса? На ExploitBench, где находку надо довести до работающего эксплойта, у GLM-5.3 54,4%, в то время как у GLM-5.2 было 24,4%. При этом у Mythos 5 результат в 78%, а у GPT-5.6 Sol – 76,5% – вроде как GLM сильно позади, но важно понимать, что закрытые модели прижаты классификаторами безопасности прямо на уровне интерфейсов, а с открытыми весами такой трюк не пройдет.
Причем напугало Z.ai не то, что модель хорошо ищет баги – этого как раз и добивались, данные по уязвимостям в дообучение положили осознанно. Расчет был на умеренное улучшение: пусть аккуратнее находит подозрительный код. Но в ходе тестов разработчики заметили: в рассуждениях модель не просто находит баги, а сразу строит опирающийся на них план кибератаки. И чем дальше масштабировали обучение, тем быстрее эта способность разгонялась – быстрее, чем предсказывали собственные прогнозы. Как разработчики планируют это лечить и управятся ли в две недели – незвестно.
Впрочем, GLM-5.3 уже доступна в API и в подписках, под прикрытием классификаторов безопасности, конечно. По всему разнообразию бенчмарков это хорошая модель, которая незначительно уступает Claude Fable 5 / Opus 5, GPT-5.6 Sol и Kimi K3.
Для большинства читателей интерес к GLM-5.3 скорее исследовательский – это большая модель на 763 млрд весов, так что для запуска потребуется несколько профессиональных GPU. Но в один день с ней вышла модель, которую вполне реально крутить на топовых видеокартах RTX 3090/4090/5090 (а с квантизацией – и на картах попроще).
Речь о Qwen3.8-27B.
Модель упакована по полной программе. Во-первых, есть рассуждающий режим – страховка от совсем глупых ответов. Во-вторых, модель не чисто текстовая – на вход также принимает картинки и видео.
Если сравнивать с Qwen3.6-27B, то рост в бенчмарках составляет (совсем грубо) 10-30% – при том же размере модели. В открытых весах сейчас идет очень крутой алгоритмический прогресс – раскошелившись один раз на подержанную RTX 3090, вы каждые несколько месяцев будете получать под нее модель, заметно растущую в результатах.
И растующую не только относительно открытых весов: я дал Opus 5 задачу сравнить, на уровне какого поколения фронтира находится Qwen3.8-27B – он считает, что это GPT-5.3-Codex/Claude Opus 4.6, причем в некоторых областях модель дотягивается до GPT-5.4 и Opus 4.7. То есть уровень ИИ, которые весной казались нам самым топом.
Отмечу, что бенчмарки не дают полной оценки качества. В маленьких моделях меньше знаний, поэтому на многих нишевых вопросах они отвечают хуже. Но прогресс все равно впечатляющий – интересно, как долго его получится добиваться на том же размере, без роста требований к железу.
—
Кстати, на тему открытых моделей у меня недавно вышел большой и подробный лонгрид. Там я разбираю термины и характеристики, которые важно знать, перечисляю, какое железо нужно для запуска разных классов моделей, и рассказываю, как развернуть открытую модель буквально за вечер – да еще и подключить ее к Claude Code или Codex.
Читаем по ссылке.
Начнем с тревожной: Z.ai выпустили GLM-5.3, это крутая модель, но… ее веса мы не увидим как минимум в ближайшие две недели. Причина – модель подхватила американскую заразу и также начала показывать недюжинные киберспособности.
Собственно, про это говорится и в слогане GLM-5.3: “Built to Code. Ready for Cyber Defense” — “Создана для кода. Готова к киберзащите”. Защитные способности действительно хороши.
На CyberGym – тесте, где надо найти уязвимость и доказать, что она настоящая, – GLM-5.3 набрала 84,5% (Claude Mythos 5 – 83,8%, GPT-5.6 Sol – 83,6%, а прошлая GLM-5.2 – 77,2%). Первый раз, когда закрытый американский фронтир в поиске дыр обошла китайская модель.
Вместе с командами Цинхуа, Нанькайского университета и несколькими компаниями по безопасности Z.ai прогнала свои модели по реальному коду. Итог – 2436 уязвимостей в 269 проектах, 1097 из них критические или высокой серьезности. Самая старая находка пролежала в коде с 1981 года, а средний возраст уязвимости до обнаружения – 26,6 года.
Из-за чего же придержали веса? На ExploitBench, где находку надо довести до работающего эксплойта, у GLM-5.3 54,4%, в то время как у GLM-5.2 было 24,4%. При этом у Mythos 5 результат в 78%, а у GPT-5.6 Sol – 76,5% – вроде как GLM сильно позади, но важно понимать, что закрытые модели прижаты классификаторами безопасности прямо на уровне интерфейсов, а с открытыми весами такой трюк не пройдет.
Причем напугало Z.ai не то, что модель хорошо ищет баги – этого как раз и добивались, данные по уязвимостям в дообучение положили осознанно. Расчет был на умеренное улучшение: пусть аккуратнее находит подозрительный код. Но в ходе тестов разработчики заметили: в рассуждениях модель не просто находит баги, а сразу строит опирающийся на них план кибератаки. И чем дальше масштабировали обучение, тем быстрее эта способность разгонялась – быстрее, чем предсказывали собственные прогнозы. Как разработчики планируют это лечить и управятся ли в две недели – незвестно.
Впрочем, GLM-5.3 уже доступна в API и в подписках, под прикрытием классификаторов безопасности, конечно. По всему разнообразию бенчмарков это хорошая модель, которая незначительно уступает Claude Fable 5 / Opus 5, GPT-5.6 Sol и Kimi K3.
Для большинства читателей интерес к GLM-5.3 скорее исследовательский – это большая модель на 763 млрд весов, так что для запуска потребуется несколько профессиональных GPU. Но в один день с ней вышла модель, которую вполне реально крутить на топовых видеокартах RTX 3090/4090/5090 (а с квантизацией – и на картах попроще).
Речь о Qwen3.8-27B.
Модель упакована по полной программе. Во-первых, есть рассуждающий режим – страховка от совсем глупых ответов. Во-вторых, модель не чисто текстовая – на вход также принимает картинки и видео.
Если сравнивать с Qwen3.6-27B, то рост в бенчмарках составляет (совсем грубо) 10-30% – при том же размере модели. В открытых весах сейчас идет очень крутой алгоритмический прогресс – раскошелившись один раз на подержанную RTX 3090, вы каждые несколько месяцев будете получать под нее модель, заметно растущую в результатах.
И растующую не только относительно открытых весов: я дал Opus 5 задачу сравнить, на уровне какого поколения фронтира находится Qwen3.8-27B – он считает, что это GPT-5.3-Codex/Claude Opus 4.6, причем в некоторых областях модель дотягивается до GPT-5.4 и Opus 4.7. То есть уровень ИИ, которые весной казались нам самым топом.
Отмечу, что бенчмарки не дают полной оценки качества. В маленьких моделях меньше знаний, поэтому на многих нишевых вопросах они отвечают хуже. Но прогресс все равно впечатляющий – интересно, как долго его получится добиваться на том же размере, без роста требований к железу.
—
Кстати, на тему открытых моделей у меня недавно вышел большой и подробный лонгрид. Там я разбираю термины и характеристики, которые важно знать, перечисляю, какое железо нужно для запуска разных классов моделей, и рассказываю, как развернуть открытую модель буквально за вечер – да еще и подключить ее к Claude Code или Codex.
Читаем по ссылке.