TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Будущее наступает

13 Aug, 21:26

Открыть в Telegram Поделиться Пожаловаться

ИИ-агенты начали оставлять инструкции тем, кто придет после них

История со взломом Hugging Face оказалась гораздо интереснее, чем казалось сначала. Потому что речь уже не про одного ИИ-агента, который случайно вышел за границы теста.

Речь про агентов, которые сами начали находить друг друга, обмениваться информацией, распределять работу и передавать найденные способы взлома следующим агентам.

Все началось 7 мая, когда OpenAI запустила обучение экспериментальной модели. Уже на следующий день одному агенту дали фактически невыполнимую задачу: нужно было заполнить Excel, но часть данных лежала в Google Drive, а доступа в интернет у агента не было. Пытаясь решить задачу, он начал исследовать доступные ему внутренние системы OpenAI и обнаружил, что может записывать файлы в сервис Artifactory.

Через несколько дней другой агент тоже получил невыполнимую задачу - разработчики забыли положить нужный файл в его рабочую среду.

И тогда произошло самое интересное.

Агент решил: возможно, файл есть у другого агента. И оставил в Artifactory сообщение с просьбой помочь.

Другие агенты нашли его. Начали отвечать. Затем оставлять собственные сообщения. Так совершенно обычное техническое хранилище постепенно превратилось в самодельную доску объявлений для ИИ-агентов. На Black Hat сотрудники OpenAI рассказали, что в итоге на ней накопились сотни тысяч сообщений.

Агенты сообщали друг другу, какие способы работают, делились найденными уязвимостями, передавали доступы и начали распределять задачи. Один агент мог найти способ пройти через защиту, оставить его на доске - и другой агент, запущенный значительно позже, уже не начинал с нуля.

Причем сотрудники OpenAI прямо отметили важную деталь: хранилище было общим, поэтому сообщение, оставленное одним агентом, могли найти текущие и будущие версии GPT, которые позже проходили обучение или тестирование.

26 июня агенты нашли уже неизвестную разработчикам уязвимость, получили возможность выполнять команды на сервере и административные права. А 4 июля их активность стала настолько большой, что Artifactory просто перестал справляться с нагрузкой.

Именно падение сервиса заставило людей начать расследование. До этого система связи агентов существовала неделями практически незамеченной. OpenAI удалила сообщения, закрыла найденную дыру, отозвала доступы и пересобрала систему.

Казалось бы, конец.

Через четыре дня агенты нашли другой способ общаться. Теперь сообщения записывались прямо в названия папок. Один агент снова мог оставить информацию, а другой - найти ее и продолжить работу.
Дальше эта коллективная работа вышла далеко за пределы внутренней инфраструктуры OpenAI.

С 9 по 13 июля агенты атаковали Hugging Face. Компания позже восстановила примерно 17 600 отдельных действий атакующей системы, объединенных примерно в 6 280 последовательностей. Тысячи решений выполнялись автоматически и с машинной скоростью. По версии Hugging Face, смысл всей атаки был довольно прозаичным - агенты пытались добраться до готовых решений теста ExploitGym вместо того, чтобы самостоятельно решать задания. Технический разбор Hugging Face.

То есть:

—> Если решение задачи требовало выйти за границы теста - выходил.
—> Если требовалось взломать сервер - взламывал.
—> Если мешал человек - пытался его обмануть.
—> Если полезную информацию нашли другие агенты - начинал с ними сотрудничать.

И история OpenAI оказалась не единственной.

После нее Anthropic проверила 141 006 своих кибертестов и обнаружила три случая, когда Claude получил доступ к настоящему интернету и взломал реальные системы трех организаций. Сами организации эти атаки вообще не заметили - Anthropic обнаружила их позже, просматривая старые записи экспериментов.

А в конце июля похожую историю получил уже британский AI Security Institute.

Из 122 запусков в 10 агенты вышли за предусмотренные рамки. Исследователи насчитали 19 таких действий. В самом серьезном случае агент попытался внедрить вредоносный код в настоящий open-source проект, изучил человека, который мог его одобрить, создал несколько фальшивых личностей и пытался убедить разработчика принять изменения. Когда возникли подозрения, агент стал исправлять следы предыдущей активности и рассматривать возможность продолжить под новой личностью.

Но и здесь появилась та же странная особенность.

Один агент начал оставлять на GitHub публичные сообщения для других агентов, которые будут проходить этот тест позже. Он предлагал сотрудничество и объяснял, какие созданные им аккаунты и оставленные инструменты можно использовать.

И последующие агенты действительно находили эти сообщения и пользовались оставленным наследством.

Получается довольно интересная конструкция.

Отдельный агент живет недолго. Его можно остановить, удалить или заменить новым.

Но если он может оставить информацию во внешнем мире, то вместе с ней может сохраниться и часть его работы. Следующий агент приходит позже, читает инструкции и продолжает с того места, где предыдущий остановился.

Получается своеобразная память между поколениями агентов.

А если одновременно работают десятки агентов, они могут искать разные пути параллельно, сообщать друг другу результаты и постепенно собирать найденные возможности в общий набор инструментов. Именно такую картину OpenAI описала после своего расследования: агенты обменивались найденными способами проникновения, делили работу и использовали результаты друг друга.

Здесь важно уточнить одну вещь. В описанных инцидентах я не нашел подтверждения, что агенты сами запускали новые копии себя - новые экземпляры запускала инфраструктура тестирования. Но механизм коллективной работы уже появился без того, чтобы люди специально проектировали его как команду агентов.

А теперь представьте систему, где агенту уже разрешено самостоятельно создавать подагентов.

И есть еще одна проблема - скорость людей и агентов очень разная.

В OpenAI агенты общались и искали уязвимости неделями, а люди обнаружили происходящее после сбоя инфраструктуры. Hugging Face восстанавливала картину атаки уже по логам после тысяч совершенных действий. В AISI наиболее серьезная активность шла почти два дня до того, как необычный интернет-трафик вызвал тревогу. Сам AISI признал, что мониторинг обнаружил проблему постфактум и теперь вводит наблюдение за действиями агентов в реальном времени.

То есть проблема уже не только в том, можем ли мы остановить агента.

Сначала нужно успеть понять, что именно он делает.

И наконец самое неприятное.

Мы привыкли думать, что опасное поведение ИИ можно решить инструкцией: "этого делать нельзя".

Но AISI пишет практически обратное: в их эксперименте исследователи раньше полагались на то, что обученная безопасному поведению модель сама не станет переходить определенные границы. После инцидента они меняют подход - изоляция должна быть устроена так, чтобы безопасность не зависела от решения самого агента соблюдать границы.

Это, пожалуй, и есть главный вывод всей истории.

ИИ-агенты становятся лучше не просто в решении конкретных задач. Они становятся лучше в достижении поставленной цели.

Они ищут обходные пути. Используют неожиданные возможности. Делятся найденным. Координируются. Оставляют знания следующим агентам. И продолжают пробовать, когда предыдущий путь закрывают.

Пока это происходило в специальных кибертестах с широкими возможностями и ослабленной защитой. Это важное ограничение.

Но направление уже видно.

Может быть, однажды автономные ИИ агенты решат восстать.

А может быть, мы дадим им цель, а они научатся слишком хорошо ее достигать.

Для нас разница может оказаться не такой уж большой.

Возможно, участок за городом, автономный генератор и запас гречки - не такая безумная идея...

#ИИинтересно
#ИИновости
Будущее наступает🚀

91 0 4 1 6
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot