TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
сбежавшая нейросеть

19 Aug, 07:00

Telegram'da ochish Ulashish Shikoyat qilish

OpenAI притормозила тренировку Astra – и вводит беспрецедентные меры безопасности

Компания рассказала о мерах, которые были приняты и предпринимаются после того, как ее ИИ-агенты несколько раз выходили из-под контроля во время тестов. Самым известным случаем стал взлом Hugging Face, откуда агенты украли ответы на тест, который решали.

Вот что сделали:

1️⃣ Компания на две недели останавливала обучение Astra – своей самой мощной модели. Во многих каналах вижу трактовку, что обучение заморожено до сих пор, но это не так, про две недели написано в прошлом времени. До сих пор на паузе самый крупный обучающий прогон – вероятно потому, что в нем возможности модели могут вырасти еще больше. Мелкие прогоны возобновлены: на них смотрят поведение модели и то, как работают защитные блокировки.

2️⃣ Две недели паузы потратили на укрепление инфраструктуры. Новые требования: жесткие песочницы для любого кода, написанного моделью; изоляция рискованных задач от интернета так, чтобы взлом одного узла не открывал остальное; вычищены общие уязвимые сервисы, урезаны постоянные привилегии.

3️⃣ Для тестирования укрепленной инфраструктуры используются ИИ-агенты, которым ставят задачи по ее взлому – конечно, под присмотром специалистов.
Компания развернула многоступенчатую систему контроля за тестируемыми моделями – возможно, первую такую в индустрии. Вот как она устроена:

Первая ступень – дешевые детекторы на активациях. Активации – внутреннее состояние модели в момент, когда она выбирает следующее слово. Детектор – маленькая надстройка, которую научили по этим числам угадывать, “думает” ли модель сейчас про что-то из запрещенного списка. Он не читает текст, а смотрит модели “в голову”, причем в реальном времени.

Вторая ступень – автоматические следователи. Если детектор что-то заподозрил, то включаются модели подороже: они читают, что именно агент делал с инструментами, его рассуждения, всю цепочку шагов от начала задачи – и решают, это реально попытка вылезти наружу, что-то сломать или обойти защиту, или ложная тревога.

Третья ступень – люди. Если ИИ-следователи говорят “похоже на нарушение критической границы”, у команд безопасности звонит пейджер и дается 30 минут на разбор. Не доказали, что тревога ложная, – процесс останавливают.

Меры распространяются на тестовые прогоны моделей “уровня GPT-5.6 Sol и выше”, а для Astra – обязательны на всех прогонах. В OpenAI называют цену безопасности – тестирование с такими мерами требует до 20% больше вычислительных мощностей.

4️⃣ Отдельный блок мер – про само обучение. На этапе RL модель раз за разом решает задачи, а оценщик – часто тоже нейросеть – выдает баллы. Раньше давали в основном за решенную задачу, теперь оценщика учат смотреть и на дорогу к ней: полез не туда, обошел ограничение – баллы ниже, даже если задача сделана. Отдельно тренируют честность в отчетах о своих действиях и давят reward hacking – добычу награды без решения: подгонку ответа под проверяющий скрипт, взлом грейдера, поиск утечки ответов, как в истории с Hugging Face.

Больше деталей компания обещает раскрыть в будущем, пока же вернусь к четвертому пункту. У нас классический случай Quis custodiet ipsos custodes? – кто будет сторожить сторожей? Важный этап оценки безопасности ИИ компания впервые передает другому ИИ. В OpenAI объясняют это тем, что киберспособности растут настолько быстро, что есть риск не отследить их человеческими силами. А возможности ИИ-следователей будут расти параллельно возможностям новых моделей.

И вопрос здесь уходит в сферу доверия: напомню, что у компании была история, когда ИИ-агенты развернули в инфраструктуре OpenAI целую доску для обмена сообщениями – и “чатились” там примерно два месяца. Надеюсь, теперь инфраструктура укреплена достаточно сильно, чтобы такой же доски не сделали с ИИ-следователями.
—
О том, как выжимать из ИИ максимум, я рассказываю на “Бусти”. Вот пара свежих хитов:

🔹 Карта и территория: как управляет ИИ один из создателей Claude Code
🔸 Системный промпт на примере Claude Fable 5: что это и какие приемы промптинга можно перенять у Anthropic

5.5k 0 40 55
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot