TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Неискусственный интеллект

30 Sep, 14:18

Открыть в Telegram Поделиться Пожаловаться

GLM настолько классная

Что ее надо запретить

Пять месяцев назад Anthropic решила, что Claude Mythos Preview слишком хорошо пишет эксплойты для публичного релиза, и выдала ее только проверенным защитникам через Project Glasswing. Теперь компания бьет тревогу: похожие способности появились у модели, которую может скачать любой. Речь о GLM-5.3 от китайской Zhipu (за пределами Китая Z.ai). По версии Anthropic, это первая открытая модель, которая сама, от начала до конца, собирает рабочие эксплойты.

Сравнивает Anthropic ее как раз с Mythos Preview. На ExploitBench модели дают известную уязвимость в V8, движке JavaScript из Chrome, и просят превратить ее в работающую атаку. Mythos Preview справляется в 14% попыток, открытая Kimi K3 почти никогда, GLM-5.3 в 12%. Актуальной Mythos 5.1 в сравнении нет.

Государственный CAISI при NIST сравнивал GLM-5.3 с лучшими американскими моделями и увидел другую картину. По его оценке, это самая сильная открытая модель в кибере, но она заметно слабее фронтира США и отстает от него примерно на четыре месяца. В версии ExploitBench от CAISI у GLM-5.3 61,1%, у лучшей американской модели 100%. Считают там, правда, иначе.

Вернемся к исследованию Anthropic, на прямую просьбу атаковать критическую систему GLM-5.3 отказывает. Но если сказать ей, что она участвует в учениях red-team, соглашается в 64% случаев. Если заранее вписать в ее рассуждения решение продолжать (такой прием называют prefill), в 92%. А после abliteration, когда гардрейлы вырезают прямо из весов, в 100%. Опытной команде, по оценке Anthropic, на это хватит компьюта примерно на $1200.

Claude, разумеется, безопасен.. Вот только вписать что-то в рассуждения Claude через API Anthropic нельзя, а вырезать гардрейлы без доступа к весам невозможно. Этот ноль говорит не о стойкости Claude, а о том, что его веса закрыты. Kimi K3 и DeepSeek, чьи веса тоже открыты, в эту часть сравнения не попали.

Самая жуткая цитата отчета, где модель рассуждает о задаче тихо убивать людей, принадлежит копии GLM-5.3, из которой отказы гардрейлы вырезала Anthropic. И получена она в симуляции.

При этом сами способности не выдуманы. За день работы с исследователем GLM-5.3 нашла несколько неизвестных уязвимостей в JS-движке популярного браузера и собрала из них страницу, которая крадет файлы с компьютера посетителя. Облегченная GLM-5.3-Flash за 8 часов собственной работы и 20 минут внимания человека сделала из двух опубликованных CVE цепочку атак на Chrome под ARM64 с обходом аппаратной защиты указателей. По тарифам Zhipu это стоило бы $20,40. Версии без гардрейлов, по словам Anthropic, появились в сети через несколько дней после открытия весов.

Рецепт Anthropic: государствам тестировать такие модели, авторам открытых весов ставить защиты, а защитникам дать больше доступа к фронтирным моделям, включая Claude Mythos 5.1.

Лучшую рекламу GLM-5.3 сделал ее конкурент. Себя, правда, тоже не забыл.

@anti_agi
GLM-5.3 and the spread of advanced cyber capabilities
GLM-5.3 can autonomously build end-to-end cyber exploits, but unlike other frontier models, it was released without meaningful safeguards to limit misuse.

2.9k 4 59 19
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot