TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
сбежавшая нейросеть

17 Aug, 07:10

Открыть в Telegram Поделиться Пожаловаться

Prev Next
Две новости китайского опенсорса: тревожная и хорошая

Начнем с тревожной: Z.ai выпустили GLM-5.3, это крутая модель, но… ее веса мы не увидим как минимум в ближайшие две недели. Причина – модель подхватила американскую заразу и также начала показывать недюжинные киберспособности.

Собственно, про это говорится и в слогане GLM-5.3: “Built to Code. Ready for Cyber Defense” — “Создана для кода. Готова к киберзащите”. Защитные способности действительно хороши.

На CyberGym – тесте, где надо найти уязвимость и доказать, что она настоящая, – GLM-5.3 набрала 84,5% (Claude Mythos 5 – 83,8%, GPT-5.6 Sol – 83,6%, а прошлая GLM-5.2 – 77,2%). Первый раз, когда закрытый американский фронтир в поиске дыр обошла китайская модель. 

Вместе с командами Цинхуа, Нанькайского университета и несколькими компаниями по безопасности Z.ai прогнала свои модели по реальному коду. Итог – 2436 уязвимостей в 269 проектах, 1097 из них критические или высокой серьезности. Самая старая находка пролежала в коде с 1981 года, а средний возраст уязвимости до обнаружения – 26,6 года. 

Из-за чего же придержали веса? На ExploitBench, где находку надо довести до работающего эксплойта, у GLM-5.3 54,4%, в то время как у GLM-5.2 было 24,4%. При этом у Mythos 5 результат в 78%, а у GPT-5.6 Sol – 76,5% – вроде как GLM сильно позади, но важно понимать, что закрытые модели прижаты классификаторами безопасности прямо на уровне интерфейсов, а с открытыми весами такой трюк не пройдет.

Причем напугало Z.ai не то, что модель хорошо ищет баги – этого как раз и добивались, данные по уязвимостям в дообучение положили осознанно. Расчет был на умеренное улучшение: пусть аккуратнее находит подозрительный код. Но в ходе тестов разработчики заметили: в рассуждениях модель не просто находит баги, а сразу строит опирающийся на них план кибератаки. И чем дальше масштабировали обучение, тем быстрее эта способность разгонялась – быстрее, чем предсказывали собственные прогнозы. Как разработчики планируют это лечить и управятся ли в две недели – незвестно.

Впрочем, GLM-5.3 уже доступна в API и в подписках, под прикрытием классификаторов безопасности, конечно. По всему разнообразию бенчмарков это хорошая модель, которая незначительно уступает Claude Fable 5 / Opus 5, GPT-5.6 Sol и Kimi K3.

Для большинства читателей интерес к GLM-5.3 скорее исследовательский – это большая модель на 763 млрд весов, так что для запуска потребуется несколько профессиональных GPU. Но в один день с ней вышла модель, которую вполне реально крутить на топовых видеокартах RTX 3090/4090/5090 (а с квантизацией – и на картах попроще).

Речь о Qwen3.8-27B.

Модель упакована по полной программе. Во-первых, есть рассуждающий режим – страховка от совсем глупых ответов. Во-вторых, модель не чисто текстовая – на вход также принимает картинки и видео.

Если сравнивать с Qwen3.6-27B, то рост в бенчмарках составляет (совсем грубо) 10-30% – при том же размере модели. В открытых весах сейчас идет очень крутой алгоритмический прогресс – раскошелившись один раз на подержанную RTX 3090, вы каждые несколько месяцев будете получать под нее модель, заметно растущую в результатах.

И растующую не только относительно открытых весов: я дал Opus 5 задачу сравнить, на уровне какого поколения фронтира находится Qwen3.8-27B – он считает, что это GPT-5.3-Codex/Claude Opus 4.6, причем в некоторых областях модель дотягивается до GPT-5.4 и Opus 4.7. То есть уровень ИИ, которые весной казались нам самым топом.

Отмечу, что бенчмарки не дают полной оценки качества. В маленьких моделях меньше знаний, поэтому на многих нишевых вопросах они отвечают хуже. Но прогресс все равно впечатляющий – интересно, как долго его получится добиваться на том же размере, без роста требований к железу.
—
Кстати, на тему открытых моделей у меня недавно вышел большой и подробный лонгрид. Там я разбираю термины и характеристики, которые важно знать, перечисляю, какое железо нужно для запуска разных классов моделей, и рассказываю, как развернуть открытую модель буквально за вечер – да еще и подключить ее к Claude Code или Codex.

Читаем по ссылке.

5k 0 75 97
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot