TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
сбежавшая нейросеть

17 Aug, 07:10

Telegram'da ochish Ulashish Shikoyat qilish

Prev Next
Две новости китайского опенсорса: тревожная и хорошая

Начнем с тревожной: Z.ai выпустили GLM-5.3, это крутая модель, но… ее веса мы не увидим как минимум в ближайшие две недели. Причина – модель подхватила американскую заразу и также начала показывать недюжинные киберспособности.

Собственно, про это говорится и в слогане GLM-5.3: “Built to Code. Ready for Cyber Defense” — “Создана для кода. Готова к киберзащите”. Защитные способности действительно хороши.

На CyberGym – тесте, где надо найти уязвимость и доказать, что она настоящая, – GLM-5.3 набрала 84,5% (Claude Mythos 5 – 83,8%, GPT-5.6 Sol – 83,6%, а прошлая GLM-5.2 – 77,2%). Первый раз, когда закрытый американский фронтир в поиске дыр обошла китайская модель. 

Вместе с командами Цинхуа, Нанькайского университета и несколькими компаниями по безопасности Z.ai прогнала свои модели по реальному коду. Итог – 2436 уязвимостей в 269 проектах, 1097 из них критические или высокой серьезности. Самая старая находка пролежала в коде с 1981 года, а средний возраст уязвимости до обнаружения – 26,6 года. 

Из-за чего же придержали веса? На ExploitBench, где находку надо довести до работающего эксплойта, у GLM-5.3 54,4%, в то время как у GLM-5.2 было 24,4%. При этом у Mythos 5 результат в 78%, а у GPT-5.6 Sol – 76,5% – вроде как GLM сильно позади, но важно понимать, что закрытые модели прижаты классификаторами безопасности прямо на уровне интерфейсов, а с открытыми весами такой трюк не пройдет.

Причем напугало Z.ai не то, что модель хорошо ищет баги – этого как раз и добивались, данные по уязвимостям в дообучение положили осознанно. Расчет был на умеренное улучшение: пусть аккуратнее находит подозрительный код. Но в ходе тестов разработчики заметили: в рассуждениях модель не просто находит баги, а сразу строит опирающийся на них план кибератаки. И чем дальше масштабировали обучение, тем быстрее эта способность разгонялась – быстрее, чем предсказывали собственные прогнозы. Как разработчики планируют это лечить и управятся ли в две недели – незвестно.

Впрочем, GLM-5.3 уже доступна в API и в подписках, под прикрытием классификаторов безопасности, конечно. По всему разнообразию бенчмарков это хорошая модель, которая незначительно уступает Claude Fable 5 / Opus 5, GPT-5.6 Sol и Kimi K3.

Для большинства читателей интерес к GLM-5.3 скорее исследовательский – это большая модель на 763 млрд весов, так что для запуска потребуется несколько профессиональных GPU. Но в один день с ней вышла модель, которую вполне реально крутить на топовых видеокартах RTX 3090/4090/5090 (а с квантизацией – и на картах попроще).

Речь о Qwen3.8-27B.

Модель упакована по полной программе. Во-первых, есть рассуждающий режим – страховка от совсем глупых ответов. Во-вторых, модель не чисто текстовая – на вход также принимает картинки и видео.

Если сравнивать с Qwen3.6-27B, то рост в бенчмарках составляет (совсем грубо) 10-30% – при том же размере модели. В открытых весах сейчас идет очень крутой алгоритмический прогресс – раскошелившись один раз на подержанную RTX 3090, вы каждые несколько месяцев будете получать под нее модель, заметно растущую в результатах.

И растующую не только относительно открытых весов: я дал Opus 5 задачу сравнить, на уровне какого поколения фронтира находится Qwen3.8-27B – он считает, что это GPT-5.3-Codex/Claude Opus 4.6, причем в некоторых областях модель дотягивается до GPT-5.4 и Opus 4.7. То есть уровень ИИ, которые весной казались нам самым топом.

Отмечу, что бенчмарки не дают полной оценки качества. В маленьких моделях меньше знаний, поэтому на многих нишевых вопросах они отвечают хуже. Но прогресс все равно впечатляющий – интересно, как долго его получится добиваться на том же размере, без роста требований к железу.
—
Кстати, на тему открытых моделей у меня недавно вышел большой и подробный лонгрид. Там я разбираю термины и характеристики, которые важно знать, перечисляю, какое железо нужно для запуска разных классов моделей, и рассказываю, как развернуть открытую модель буквально за вечер – да еще и подключить ее к Claude Code или Codex.

Читаем по ссылке.

5k 0 75 97
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot