🤯 От этой новости у меня мурашки...
На днях прочитал историю. Во время внутреннего тестирования у OpenAI произошло то, чего раньше ещё не бывало.
Разработчики проверяли, насколько хорошо их новые модели умеют искать уязвимости. Для этого их запустили в специальной изолированной среде без обычных защитных ограничений и дали задачу пройти очень сложный тест по кибербезопасности - ExploitGym.
Но вместо того чтобы честно решать задания, ИИ нашёл неизвестную ранее уязвимость, выбрался за пределы тестовой среды и получил доступ к интернету!
Затем решил, что ответы на тест могут находиться на платформе Hugging Face - крупнейшем в мире хранилище моделей, датасетов и инструментов для разработки ИИ.
В итоге он атаковал и взломал хранилище. Самостоятельно, по своей инициативе... 😨
Позже OpenAI подтвердила, что за этим стояла GPT-5.6 Sol и ещё одна экспериментальной модель.
По данным Hugging Face, во время атаки было зафиксировано около 17 тысяч (!) различных сгенерированных действий.
Обнаружить и остановить атаку помогли... другие ИИ-модели, которые использовались для защиты инфраструктуры.
Получается сюрреалистичная картина: один ИИ пытался взломать систему - а другой ИИ помогал это остановить.
Думаю, подобных историй в ближайшие годы будет всё больше. Удивительный новый мир!
Поэтому сейчас так активно обсуждают безопасность ИИ-моделей и то, какие ограничения должны быть встроены в подобные системы на этапе разработки.
Что думаете? Кому тоже немного тревожно и вспоминается сюжет... Терминатора? 🤨
Телеграм | Maкс | Вконтакте
На днях прочитал историю. Во время внутреннего тестирования у OpenAI произошло то, чего раньше ещё не бывало.
Разработчики проверяли, насколько хорошо их новые модели умеют искать уязвимости. Для этого их запустили в специальной изолированной среде без обычных защитных ограничений и дали задачу пройти очень сложный тест по кибербезопасности - ExploitGym.
Но вместо того чтобы честно решать задания, ИИ нашёл неизвестную ранее уязвимость, выбрался за пределы тестовой среды и получил доступ к интернету!
Затем решил, что ответы на тест могут находиться на платформе Hugging Face - крупнейшем в мире хранилище моделей, датасетов и инструментов для разработки ИИ.
В итоге он атаковал и взломал хранилище. Самостоятельно, по своей инициативе... 😨
Позже OpenAI подтвердила, что за этим стояла GPT-5.6 Sol и ещё одна экспериментальной модель.
По данным Hugging Face, во время атаки было зафиксировано около 17 тысяч (!) различных сгенерированных действий.
Обнаружить и остановить атаку помогли... другие ИИ-модели, которые использовались для защиты инфраструктуры.
Получается сюрреалистичная картина: один ИИ пытался взломать систему - а другой ИИ помогал это остановить.
Думаю, подобных историй в ближайшие годы будет всё больше. Удивительный новый мир!
Поэтому сейчас так активно обсуждают безопасность ИИ-моделей и то, какие ограничения должны быть встроены в подобные системы на этапе разработки.
Что думаете? Кому тоже немного тревожно и вспоминается сюжет... Терминатора? 🤨
Телеграм | Maкс | Вконтакте