TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
сбежавшая нейросеть

19 Aug, 07:00

Открыть в Telegram Поделиться Пожаловаться

OpenAI притормозила тренировку Astra – и вводит беспрецедентные меры безопасности

Компания рассказала о мерах, которые были приняты и предпринимаются после того, как ее ИИ-агенты несколько раз выходили из-под контроля во время тестов. Самым известным случаем стал взлом Hugging Face, откуда агенты украли ответы на тест, который решали.

Вот что сделали:

1️⃣ Компания на две недели останавливала обучение Astra – своей самой мощной модели. Во многих каналах вижу трактовку, что обучение заморожено до сих пор, но это не так, про две недели написано в прошлом времени. До сих пор на паузе самый крупный обучающий прогон – вероятно потому, что в нем возможности модели могут вырасти еще больше. Мелкие прогоны возобновлены: на них смотрят поведение модели и то, как работают защитные блокировки.

2️⃣ Две недели паузы потратили на укрепление инфраструктуры. Новые требования: жесткие песочницы для любого кода, написанного моделью; изоляция рискованных задач от интернета так, чтобы взлом одного узла не открывал остальное; вычищены общие уязвимые сервисы, урезаны постоянные привилегии.

3️⃣ Для тестирования укрепленной инфраструктуры используются ИИ-агенты, которым ставят задачи по ее взлому – конечно, под присмотром специалистов.
Компания развернула многоступенчатую систему контроля за тестируемыми моделями – возможно, первую такую в индустрии. Вот как она устроена:

Первая ступень – дешевые детекторы на активациях. Активации – внутреннее состояние модели в момент, когда она выбирает следующее слово. Детектор – маленькая надстройка, которую научили по этим числам угадывать, “думает” ли модель сейчас про что-то из запрещенного списка. Он не читает текст, а смотрит модели “в голову”, причем в реальном времени.

Вторая ступень – автоматические следователи. Если детектор что-то заподозрил, то включаются модели подороже: они читают, что именно агент делал с инструментами, его рассуждения, всю цепочку шагов от начала задачи – и решают, это реально попытка вылезти наружу, что-то сломать или обойти защиту, или ложная тревога.

Третья ступень – люди. Если ИИ-следователи говорят “похоже на нарушение критической границы”, у команд безопасности звонит пейджер и дается 30 минут на разбор. Не доказали, что тревога ложная, – процесс останавливают.

Меры распространяются на тестовые прогоны моделей “уровня GPT-5.6 Sol и выше”, а для Astra – обязательны на всех прогонах. В OpenAI называют цену безопасности – тестирование с такими мерами требует до 20% больше вычислительных мощностей.

4️⃣ Отдельный блок мер – про само обучение. На этапе RL модель раз за разом решает задачи, а оценщик – часто тоже нейросеть – выдает баллы. Раньше давали в основном за решенную задачу, теперь оценщика учат смотреть и на дорогу к ней: полез не туда, обошел ограничение – баллы ниже, даже если задача сделана. Отдельно тренируют честность в отчетах о своих действиях и давят reward hacking – добычу награды без решения: подгонку ответа под проверяющий скрипт, взлом грейдера, поиск утечки ответов, как в истории с Hugging Face.

Больше деталей компания обещает раскрыть в будущем, пока же вернусь к четвертому пункту. У нас классический случай Quis custodiet ipsos custodes? – кто будет сторожить сторожей? Важный этап оценки безопасности ИИ компания впервые передает другому ИИ. В OpenAI объясняют это тем, что киберспособности растут настолько быстро, что есть риск не отследить их человеческими силами. А возможности ИИ-следователей будут расти параллельно возможностям новых моделей.

И вопрос здесь уходит в сферу доверия: напомню, что у компании была история, когда ИИ-агенты развернули в инфраструктуре OpenAI целую доску для обмена сообщениями – и “чатились” там примерно два месяца. Надеюсь, теперь инфраструктура укреплена достаточно сильно, чтобы такой же доски не сделали с ИИ-следователями.
—
О том, как выжимать из ИИ максимум, я рассказываю на “Бусти”. Вот пара свежих хитов:

🔹 Карта и территория: как управляет ИИ один из создателей Claude Code
🔸 Системный промпт на примере Claude Fable 5: что это и какие приемы промптинга можно перенять у Anthropic

5.7k 0 40 55
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot