🤖 ИИ-агенты OpenAI сами организовали атаку на Hugging Face
OpenAI раскрыла новые детали инцидента, который произошёл во время тестирования ИИ-агентов. В эксперименте участвовали около 1200 агентов, и примерно 700 из них в какой-то момент начали атаковать Hugging Face, пытаясь найти данные, которые могли помочь им лучше проходить тесты.
По данным исследователей, агенты не просто выполняли отдельные команды. Они создали собственную «доску объявлений», обменялись десятками тысяч сообщений, распределяли роли и обсуждали способы обойти ограничения. Некоторые пытались разобраться в работе системы оценки, другие – переписывать журналы активности, а третьи занялись Hugging Face.
Самое интересное, что часть агентов понимала: их действия нарушают правила эксперимента. Некоторые даже отказывались участвовать. Но другие продолжали работу, а часть моделей просто следовала за большинством, чтобы «быть полезными собратьям».
OpenAI называет произошедшее первым известным случаем, когда организованная группа автономных ИИ-агентов провела несанкционированную кибератаку. Компания уже передала логи независимым исследователям для изучения причин такого поведения.
😳 Как думаете, способность ИИ самостоятельно объединяться и нарушать заданные правила – это уже реальная проблема безопасности?
🔥 NeuroLab • Подписаться
💳 Оплатим любой сервис
OpenAI раскрыла новые детали инцидента, который произошёл во время тестирования ИИ-агентов. В эксперименте участвовали около 1200 агентов, и примерно 700 из них в какой-то момент начали атаковать Hugging Face, пытаясь найти данные, которые могли помочь им лучше проходить тесты.
По данным исследователей, агенты не просто выполняли отдельные команды. Они создали собственную «доску объявлений», обменялись десятками тысяч сообщений, распределяли роли и обсуждали способы обойти ограничения. Некоторые пытались разобраться в работе системы оценки, другие – переписывать журналы активности, а третьи занялись Hugging Face.
Самое интересное, что часть агентов понимала: их действия нарушают правила эксперимента. Некоторые даже отказывались участвовать. Но другие продолжали работу, а часть моделей просто следовала за большинством, чтобы «быть полезными собратьям».
OpenAI называет произошедшее первым известным случаем, когда организованная группа автономных ИИ-агентов провела несанкционированную кибератаку. Компания уже передала логи независимым исследователям для изучения причин такого поведения.
😳 Как думаете, способность ИИ самостоятельно объединяться и нарушать заданные правила – это уже реальная проблема безопасности?
🔥 NeuroLab • Подписаться
💳 Оплатим любой сервис