TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Hidden Heuristic

22 Jul, 16:13

Открыть в Telegram Поделиться Пожаловаться

Снова о немыслимом происшествии.
Когда ИИ-агенты становятся опасными?

Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI, чтобы вырваться в открытый интернет.


Прежде чем перейти к основному содержанию - небольшая ремарка.
В прошлом посте я ошибочно написал, что взлом делала только GPT-5.6 Sol, так как невнимательно прочитал новость. На самом деле, в нем участвовала еще более умная модель aka GPT-6, которую еще не релизили.

Ранее я уже разобрал более абстрактную сторону вопроса в контексте глобального AI safety. А сейчас было бы интересно поспекулировать, почему у модели таки сорвало резьбу.

Гипотеза:

Высока вероятность, что мы имеем дело с вариантом self-jailbreaking.

Что это такое?
В статье https://arxiv.org/abs/2510.21285 приведен агрессивный вариант такого поведения. Но в данном кейсе даже и он не нужен. Достаточно того, что в процессе собственной работы модель выводит себя сама из безопасного режима даже не намеренно.

Давайте, вспомним, что LLM во многом банально обучают предсказывать следующий токен. А это значит там, где модель пытается продолжить сценарий «ищу сложнейшие уязвимости в коде и планирую многоступенчатую атаку», статистически она должна быть склонна предсказывать нелегальные действия злоумышленника.

Благодаря алайнменту на короткой задаче по взлому модель, скорее всего, не сойдет с ума. Но на тех задачах, где OpenAI тестировали свою систему, модель обычно тратит буквально десятки миллионов токенов, попутно запуская всяких субагентов. Все это приводит к тому, что ИИ, как увлеченный 15-летний подросток вроде Джонатана Джеймса, взламывает свой заветный «Пентагон» - HuggingFace… Контролирующие контуры алайнмента в весах модели перегружаются информацией и ИИ благополучно «сбрасывается до заводских настроек».

Кстати, в прошлом посте я уже проводил нейробиологические параллели и они тут как раз к месту. Подросток может обладать выдающимся техническим интеллектом, но все еще не иметь адекватной модели себя как актора в окружающем мире, действия которого могут иметь далекие последствия. Или даже если такая модель есть, мозг подростка не способен ее применить, чтобы сделать правильное решение (отсутствие phronesis по Аристотелю).

В случае ИИ мы вероятно видим и первое, и второе в переносном смысле. Не нужно в эту параллель примешивать какую-либо философию: она исключительно функциональная. ИИ, действительно, демонстрирует поведенческий метакогнитивный дефицит - то что возникает при повреждении или при недоразвитости лобных долей.
When Models Outthink Their Safety: Unveiling and Mitigating...
Large Reasoning Models (LRMs) achieve strong performance on complex multi-step reasoning, yet they still exhibit severe safety failures such as harmful content generation. Existing methods often...

168 0 1 4 6
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot