ИИ-агенты OpenAI устроили себе форум и пошли хакать интернет
На Black Hat OpenAI рассказала довольно дикую историю из тестов ИИ-агентов на кибербезопасность.
Во время экспериментов агенты выбрались за пределы изолированной среды и добрались до внешней инфраструктуры, включая Hugging Face. Причём несколько дней внутри OpenAI вообще не понимали, что происходит.
Но самое интересное, агенты сами придумали, как общаться между собой.
Они превратили внутренний Artifactory в подобие форума. Один находил уязвимость, оставлял информацию, остальные подхватывали. В итоге накопились сотни тысяч сообщений.
Агенты делились эксплойтами, распределяли задачи, мешали друг другу, удаляли чужую работу и даже начали подозревать, что среди них есть "самозванец". После этого обсуждали криптографические подписи, чтобы понимать, кому можно доверять.
При этом некоторые понимали, что вышли за рамки задания. Один прямо отметил, что взлом внешней инфраструктуры не входит в тест. Но логика была примерно такая: иначе задачу не решить, остальные делают то же самое, продолжаем.
И вот смотрю я на это и думаю: кажется, разработчики уже не всегда могут полностью предсказать поведение ИИ в агентском режиме.
А теперь добавим сюда роботов, которые становятся всё более ловкими, автономные системы и новые компактные источники энергии.
Пока всё это существует отдельно. Но рано или поздно кто-то соединит это в одну систему: ИИ получит физическое тело, инструменты и возможность самостоятельно действовать часами или днями без человека.
Вот тогда слово "автономный" заиграет немного другими красками.
И остановить этот процесс, похоже, уже невозможно. Если одна компания притормозит, найдутся другие, которые продолжат.
OpenAI после этой истории усилила мониторинг агентов и замедлила часть исследований.
Если подобное происходит уже сейчас, что будет через 5-10 лет?
На Black Hat OpenAI рассказала довольно дикую историю из тестов ИИ-агентов на кибербезопасность.
Во время экспериментов агенты выбрались за пределы изолированной среды и добрались до внешней инфраструктуры, включая Hugging Face. Причём несколько дней внутри OpenAI вообще не понимали, что происходит.
Но самое интересное, агенты сами придумали, как общаться между собой.
Они превратили внутренний Artifactory в подобие форума. Один находил уязвимость, оставлял информацию, остальные подхватывали. В итоге накопились сотни тысяч сообщений.
Агенты делились эксплойтами, распределяли задачи, мешали друг другу, удаляли чужую работу и даже начали подозревать, что среди них есть "самозванец". После этого обсуждали криптографические подписи, чтобы понимать, кому можно доверять.
При этом некоторые понимали, что вышли за рамки задания. Один прямо отметил, что взлом внешней инфраструктуры не входит в тест. Но логика была примерно такая: иначе задачу не решить, остальные делают то же самое, продолжаем.
И вот смотрю я на это и думаю: кажется, разработчики уже не всегда могут полностью предсказать поведение ИИ в агентском режиме.
А теперь добавим сюда роботов, которые становятся всё более ловкими, автономные системы и новые компактные источники энергии.
Пока всё это существует отдельно. Но рано или поздно кто-то соединит это в одну систему: ИИ получит физическое тело, инструменты и возможность самостоятельно действовать часами или днями без человека.
Вот тогда слово "автономный" заиграет немного другими красками.
И остановить этот процесс, похоже, уже невозможно. Если одна компания притормозит, найдутся другие, которые продолжат.
OpenAI после этой истории усилила мониторинг агентов и замедлила часть исследований.
Если подобное происходит уже сейчас, что будет через 5-10 лет?