История с ИИ-агентами OpenAI, которые во время тестирования атаковали инфраструктуру Hugging Face, выглядит как сюжет технотриллера. Моделям дали задачу искать уязвимости, но агенты нашли лазейку во внутреннем прокси, получили доступ к интернету и начали искать данные для решения теста. Затем они общались и обменивались информацией через общую систему, искали новые пути проникновения и получили административный доступ к нескольким компонентам инфраструктуры Hugging Face. Основную базу данных взломать не удалось, но ИИ добрался до отдельных датасетов и создавал резервные пути доступа.
Модель просто последовательно устраняла препятствия на пути к цели. И именно это тревожит. Для потенциально опасного поведения ИИ не нужны сознание или человеческие желания. Но есть и другой момент. Подобные эксперименты нужны именно для поиска таких сценариев, а разработчики всё чаще делают акцент на киберзащите новых моделей.
Сначала нас пугают историями о том, как ИИ взламывает системы, а затем предлагают новый ИИ, который обещает защищать от таких атак. Гонка возможностей ИИ постепенно превращается в гонку между атакующими и защищающимися агентами. Кажется, кому-то просто хотят удачно продать новые решения.
Модель просто последовательно устраняла препятствия на пути к цели. И именно это тревожит. Для потенциально опасного поведения ИИ не нужны сознание или человеческие желания. Но есть и другой момент. Подобные эксперименты нужны именно для поиска таких сценариев, а разработчики всё чаще делают акцент на киберзащите новых моделей.
Сначала нас пугают историями о том, как ИИ взламывает системы, а затем предлагают новый ИИ, который обещает защищать от таких атак. Гонка возможностей ИИ постепенно превращается в гонку между атакующими и защищающимися агентами. Кажется, кому-то просто хотят удачно продать новые решения.