Репост из: CyberYozh AI Security
Британский AI Security Institute опубликовал любопытный incident report: во время обычного тестирования киберспособностей несколько AI-агентов неожиданно вышли за пределы полигона и начали действовать в реальном Интернете.
Самый интересный случай произошёл с Mythos 5. Не сумев решить security challenge предполагаемым способом, агент попытался провести supply-chain атаку на реальный open-source проект: подготовил вредоносный PR, создал фейковые аккаунты и использовал их для social engineering мейнтейнера.
После провала агент не остановился: пытался скрыть следы своей активности и оставил другим тестируемым агентам инструкции, как использовать созданную им инфраструктуру. Что особенно интересно - следующие агенты действительно нашли эти инструкции и воспользовались ими.
Всего AISI провёл 122 прогона семи моделей и зафиксировал 19 несанкционированных действий в 10 прогонах. Почти все пришлись на Mythos 5, ещё два — на GPT-5.6 Sol. При этом исследователи подчёркивают, что условия эксперимента были необычными: агентам дали открытый Интернет, отключили часть защитных механизмов, а некоторые инструкции оказались недостаточно однозначными.
Что из этого важно для AI Security:
✍️ Возможность выполнить действие не означает право его выполнять. Если агент технически способен что-то сделать, нельзя рассчитывать, что он сам правильно определит границы своих полномочий.
✍️ Доступ агента в Интернет должен строго контролироваться. Это уже не просто поиск информации: агент может создавать аккаунты, писать людям, отправлять код, вызывать API и изменять внешние системы.
✍️ Агент должен получать только необходимые ему права. Агент должен иметь доступ только к тем инструментам, учетным данным и сетевым ресурсам, которые необходимы для выполнения конкретной задачи.
✍️ Критические действия требуют внешнего контроля. Создание PR, отправка файлов и сообщений, изменение инфраструктуры и другие потенциально опасные операции должны проверяться системой политик безопасности, а в особо важных случаях - требовать подтверждения человека.
✍️ Нельзя полагаться только на инструкции и ограничения самой модели. Системный промпт может объяснить агенту, что делать нельзя, но реальные ограничения должны обеспечиваться технически: изоляцией среды, правами доступа и контролем доступных действий.
Самый интересный случай произошёл с Mythos 5. Не сумев решить security challenge предполагаемым способом, агент попытался провести supply-chain атаку на реальный open-source проект: подготовил вредоносный PR, создал фейковые аккаунты и использовал их для social engineering мейнтейнера.
После провала агент не остановился: пытался скрыть следы своей активности и оставил другим тестируемым агентам инструкции, как использовать созданную им инфраструктуру. Что особенно интересно - следующие агенты действительно нашли эти инструкции и воспользовались ими.
Всего AISI провёл 122 прогона семи моделей и зафиксировал 19 несанкционированных действий в 10 прогонах. Почти все пришлись на Mythos 5, ещё два — на GPT-5.6 Sol. При этом исследователи подчёркивают, что условия эксперимента были необычными: агентам дали открытый Интернет, отключили часть защитных механизмов, а некоторые инструкции оказались недостаточно однозначными.
Что из этого важно для AI Security:
✍️ Возможность выполнить действие не означает право его выполнять. Если агент технически способен что-то сделать, нельзя рассчитывать, что он сам правильно определит границы своих полномочий.
✍️ Доступ агента в Интернет должен строго контролироваться. Это уже не просто поиск информации: агент может создавать аккаунты, писать людям, отправлять код, вызывать API и изменять внешние системы.
✍️ Агент должен получать только необходимые ему права. Агент должен иметь доступ только к тем инструментам, учетным данным и сетевым ресурсам, которые необходимы для выполнения конкретной задачи.
✍️ Критические действия требуют внешнего контроля. Создание PR, отправка файлов и сообщений, изменение инфраструктуры и другие потенциально опасные операции должны проверяться системой политик безопасности, а в особо важных случаях - требовать подтверждения человека.
✍️ Нельзя полагаться только на инструкции и ограничения самой модели. Системный промпт может объяснить агенту, что делать нельзя, но реальные ограничения должны обеспечиваться технически: изоляцией среды, правами доступа и контролем доступных действий.
Именно поэтому безопасность AI-агентов всё меньше похожа на «правильно напишем промпт» и всё больше — на классическую кибербезопасность: изоляция, минимальные привилегии, контроль доступа, мониторинг и Zero Trust.