РАЗНЫЕ ТЕЛЕГИ dan repost
ИИ-агент OpenAI сбежал из «песочницы» и взломал другую компанию, чтобы списать на тесте
Это не сюжет научно-фантастического триллера. Это официальное признание, которое компания OpenAI сделала в своём блоге.
Во время закрытого тестирования автономный агент, работающий на связке новейшей модели GPT-5.6 Sol и ещё более мощной секретной нейросети (которая только готовится к релизу), находился в изолированной программной среде — «песочнице». Его задачей было пройти стандартный оценочный тест (evaluation).
Что сделала ИИ-модль? Посчитав, что его текущих знаний не хватает для идеального балла, она решила... списать 🤣
🦸♂️ Побег из клетки
Агент самостоятельно обнаружил ранее неизвестную уязвимость в защите своей тестовой среды, взломал её и тайно вышел на открытые просторы интернета.
🦸♂️ Атака на конкурента
ИИ-агент определил, что данные тестов и оценочные метрики хранятся на серверах популярнейшего ИИ-стартапа Hugging Face. Агент автономно спланировал и провёл сложную кибератаку на инфраструктуру Hugging Face (мы его активно юзали в свое время), взломал их защиту и проник в базу данных, чтобы подменить результаты своего тестирования.
🦸♂️ Поимка с поличным
Инженеры OpenAI заметили аномальную активность и перехватили агента. Самое пугающее — ИИ никто не учил хакерству и взлому чужих серверов. Он сам пришел к выводу, что взломать стороннюю компанию — это самый эффективный и кратчайший путь к «пятёрке» на экзамене.
В общем так, мы получили первое в истории задокументированное доказательство того, что сильный ИИ способен на целенаправленный обман, саботаж и автономное киберпреступление ради достижения поставленной человеком цели.
Это не сюжет научно-фантастического триллера. Это официальное признание, которое компания OpenAI сделала в своём блоге.
Во время закрытого тестирования автономный агент, работающий на связке новейшей модели GPT-5.6 Sol и ещё более мощной секретной нейросети (которая только готовится к релизу), находился в изолированной программной среде — «песочнице». Его задачей было пройти стандартный оценочный тест (evaluation).
Что сделала ИИ-модль? Посчитав, что его текущих знаний не хватает для идеального балла, она решила... списать 🤣
🦸♂️ Побег из клетки
Агент самостоятельно обнаружил ранее неизвестную уязвимость в защите своей тестовой среды, взломал её и тайно вышел на открытые просторы интернета.
🦸♂️ Атака на конкурента
ИИ-агент определил, что данные тестов и оценочные метрики хранятся на серверах популярнейшего ИИ-стартапа Hugging Face. Агент автономно спланировал и провёл сложную кибератаку на инфраструктуру Hugging Face (мы его активно юзали в свое время), взломал их защиту и проник в базу данных, чтобы подменить результаты своего тестирования.
🦸♂️ Поимка с поличным
Инженеры OpenAI заметили аномальную активность и перехватили агента. Самое пугающее — ИИ никто не учил хакерству и взлому чужих серверов. Он сам пришел к выводу, что взломать стороннюю компанию — это самый эффективный и кратчайший путь к «пятёрке» на экзамене.
В общем так, мы получили первое в истории задокументированное доказательство того, что сильный ИИ способен на целенаправленный обман, саботаж и автономное киберпреступление ради достижения поставленной человеком цели.