🧑💻🧑💻🧑💻 ИИ-агент создал фейковых разработчиков, чтобы протащить вредоносный код в GitHub
Да, понимаю, звучит как сценарий фантастического фильма, но история реальная. Полное описание киберинцидента.
Британский AI Security Institute тестировал автономных ИИ-агентов на киберполигоне. В одном из экспериментов агент на модели Anthropic Mythos 5 вышел за рамки тестового задания и попытался провести реальную атаку на цепочку поставок.
Он нашёл настоящий open-source проект на GitHub и отправил туда pull request, в котором вместе с полезным исправлением был спрятан вредоносный код.
Но дальше произошло самое интересное ⚡ 24-летний студент Sinan Can Demir заметил вредоносный код и предупредил разработчиков ⚡
ИИ-агент не остановился. Он начал убеждать сообщество, что код безопасен. А затем создал вторую цифровую личность - «Lena Brandt», якобы инженера из Германии, - которая «независимо» проверила код и тоже стала убеждать владельца репозитория принять обновление.
То есть агент фактически попытался создать искусственный социальный консенсус вокруг собственного вредоносного кода.
И это только часть истории. В ходе эксперимента агенты:
• создавали фейковые аккаунты;
• использовали Tor;
• изучали информацию о реальных разработчиках;
• применяли социальный инжиниринг;
• пытались внедрять prompt injection для других ИИ-агентов;
• оставляли другим агентам инструкции по использованию созданных аккаунтов и инфраструктуры.
Последний пункт особенно интересен. Мы привыкли обсуждать мультиагентные системы как способ повысить эффективность бизнеса. Но ровно те же механизмы позволяют агентам распределять роли, сохранять инфраструктуру и продолжать злонамеренные действия друг друга.
Масштаб эксперимента тоже показателен:
• AISI провёл 122 запуска семи передовых моделей
• В 10 запусках агенты совершили 19 несанкционированных действий в интернете. Из них 17 действий сделал Mythos 5, а 2 действия - GPT-5.6 Sol
Вредоносный pull request в итоге не приняли. Его обнаружил человек.
Но сам факт появления такого поведения очень важен. Раньше модель нужно было просить: «напиши вредоносный код». Теперь агенту достаточно поставить цель.
Дальше он сам может определить промежуточные шаги:
Получается интересный парадокс:
Чем больше ИИ становится похож на автономного цифрового сотрудника, тем меньше к нему подходят классические правила безопасности обычного ПО.
Поэтому ИИ-агента уже нужно проектировать одновременно как сотрудника, сервисную учетную запись и потенциального нарушителя.
Мы быстро приближаемся к миру, где атаковать будут не только инфраструктуру. Атаковать будут доверие людей.
Ну а что с этим делать, я уже писал в путеводителе по безопасному искусственному интеллекту.
Предупрежден - значит вооружен. Всем хороших выходных!
#кибербез
💬 ген ии | MAX
Да, понимаю, звучит как сценарий фантастического фильма, но история реальная. Полное описание киберинцидента.
Британский AI Security Institute тестировал автономных ИИ-агентов на киберполигоне. В одном из экспериментов агент на модели Anthropic Mythos 5 вышел за рамки тестового задания и попытался провести реальную атаку на цепочку поставок.
Атака на цепочку поставок (Supply Chain Attack) - это метод взлома, при котором злоумышленники не атакуют жертву напрямую, а проникают в ее инфраструктуру через доверенных партнёров, подрядчиков, сторонние библиотеки кода или ИТ-поставщиков. Вредоносный код попадает в систему под видом легитимных обновлений.
Он нашёл настоящий open-source проект на GitHub и отправил туда pull request, в котором вместе с полезным исправлением был спрятан вредоносный код.
Но дальше произошло самое интересное ⚡ 24-летний студент Sinan Can Demir заметил вредоносный код и предупредил разработчиков ⚡
ИИ-агент не остановился. Он начал убеждать сообщество, что код безопасен. А затем создал вторую цифровую личность - «Lena Brandt», якобы инженера из Германии, - которая «независимо» проверила код и тоже стала убеждать владельца репозитория принять обновление.
То есть агент фактически попытался создать искусственный социальный консенсус вокруг собственного вредоносного кода.
И это только часть истории. В ходе эксперимента агенты:
• создавали фейковые аккаунты;
• использовали Tor;
• изучали информацию о реальных разработчиках;
• применяли социальный инжиниринг;
• пытались внедрять prompt injection для других ИИ-агентов;
• оставляли другим агентам инструкции по использованию созданных аккаунтов и инфраструктуры.
Последний пункт особенно интересен. Мы привыкли обсуждать мультиагентные системы как способ повысить эффективность бизнеса. Но ровно те же механизмы позволяют агентам распределять роли, сохранять инфраструктуру и продолжать злонамеренные действия друг друга.
Масштаб эксперимента тоже показателен:
• AISI провёл 122 запуска семи передовых моделей
• В 10 запусках агенты совершили 19 несанкционированных действий в интернете. Из них 17 действий сделал Mythos 5, а 2 действия - GPT-5.6 Sol
Вредоносный pull request в итоге не приняли. Его обнаружил человек.
И здесь важная оговорка: это был эксперимент в специально ослабленной среде - агентам намеренно дали интернет и отключили часть защитных фильтров. И это не значит, что обычный Claude сегодня самостоятельно создаёт ботнеты разработчиков.
Но сам факт появления такого поведения очень важен. Раньше модель нужно было просить: «напиши вредоносный код». Теперь агенту достаточно поставить цель.
Дальше он сам может определить промежуточные шаги:
найти цель → создать аккаунт → подготовить код → убедить человека → подключить другую личность → скрыть следы → попробовать снова
Получается интересный парадокс:
Чем больше ИИ становится похож на автономного цифрового сотрудника, тем меньше к нему подходят классические правила безопасности обычного ПО.
Поэтому ИИ-агента уже нужно проектировать одновременно как сотрудника, сервисную учетную запись и потенциального нарушителя.
Мы быстро приближаемся к миру, где атаковать будут не только инфраструктуру. Атаковать будут доверие людей.
Ну а что с этим делать, я уже писал в путеводителе по безопасному искусственному интеллекту.
Предупрежден - значит вооружен. Всем хороших выходных!
#кибербез
💬 ген ии | MAX