TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Борис_ь с ml

3 Apr, 20:08

Открыть в Telegram Поделиться Пожаловаться

Саморазвивающиеся агенты и их угрозы
#иб_для_ml

Сегодня много шума вокруг Ouroboros - агента, эволюционирующего самостоятельно. Это новое для 2026 года явление, отличающееся от обычных AI-агентов и OpenClaw.

Что такое саморазвивающиеся агенты?

Предлагаю понять суть в сравнении.
1. Все началось с AI-агентов - кода с промптами, написанного человеком. Это управление состояниями, сессиями, обработкой сигналов и инструментами агента. OWASP Top 10 для агентов есть.
2. Следующий виток развития - агенты семейства OpenClaw. Их ключевая особенность - способность создавать себе инструменты или скиллы. Появились загружаемые инструменты и даже отдельный OWASP Top 10 для агентных скиллов.
3. И вот сейчас - последний писк моды технологий. Агенты, которые могут менять не только свои тулы, но и цели, задачи, планирование, память, и вообще весь свой код.

О том, что именно может эволюционировать, хорошо сказано в статье "Your Agent May Misevolve":
1. Модель. Агент может самостоятельно дообучать свою модель (Abs-Zero, AgentTrek, SEAgent), уводя ее вбок случайно или под действием нарушителя, так что когнитивные способности растут, а защитные механизмы атрофируются
2. Память. Попадание и закрепление промпт-атаки в "воспоминаниях" (AgentNet , SEAgent)
3. Инструменты. Появление у агента вредоносных тулов в результате самостоятельного создания или получения извне (Alita)
4. Воркфлоу. Оптимизация своего кода управления всем вышеперечисленным (AFlow, GPTSwarm)

Более подробные выкладки есть в посте Артема.

Зачем они нужны?
Чтобы понять, от чего защищаться, надо понимать, зачем они вообще кому-то понадобились. Я вижу три применения:

1. Личный ассистент для помощи с календарем, контактами, поиском и заказом товаров, разработкой и написанием текстов
2. Движок для Next-Gen PDLC в энтерпрайзе. Агентов можно создавать силами большой команды разработчиков, а можно взять личинку универсального агента, скормить ей ТЗ, и она сама превратится в нужную боевую единицу
3. Генератор идей. Самая сложная задача для алгоритмов - прогноз будущего. И, возможно, только такая сложная система и сможет ее решить: анализировать ситуации целиком, предлагать сценарии развития, стратегии и гипотезы. По сути, способ создания цифрового двойника

Угрозы
Итак, какие уникальные угрозы возникают при использовании таких агентов? Попытаюсь выделить самые фундаментальные классы, вызванные именно саморазвиваемостью агентов.

1. Компрометация механизма, который решает, какая новая версия агента считается лучшей. После этого агент эволюционирует, повышая прикладные метрики, но опасно с точки зрения ИБ (по сути, reward hacking).
2. Выход за рамки цели, самостоятельное расширение привилегий и возможностей. Подсадка новой вредоносной цели возможна как нарушителем, так и случайной девиацией эволюции агента.
3. Высокоустойчивый персист промпт-атак в "теле" агента - память, промпты, код воркфлоу, код тулов; найти закрепленную промпт-атаку теперь будет сложнее.

Гипотезы, как быть (меры митигации)
Я подготовил несколько правил, которым надо следовать, чтобы внедрять саморазвивающихся агентов безопасно.

1. Механизмы безопасности должны быть неизменяемы в ходе эволюции агента. То есть контроль доступов, гардрейлы (или сейфти ноды), подтверждение действий человеком - все это должно быть вне изменяемого самим агентом кода.
2. В идеале стоит разделить контур эволюции агента и боевой контур, чтобы во второй попадали только стабильные, проверенные на безопасность "поколения" агента.
3. Память и инструменты должны быть объектами с усложненным доступом - с проверками условий и контекста, только на время, с переаттестацией права доступа и удалением по ненадобности.
4. Каждый шаг эволюции должен логироваться для возможности отката назад.
5. Необходимо выделять основные ветки эволюции и отбраковывать наиболее опасные и непредсказуемые

Ванга-бонус
Предрекаю, что следующим видом развития агентов станет агент, который может менять не только себя, но и создавать себе вспомогательных агентов, которые в свою очередь будут создавать еще агентов... И так, пока это не станет полноценным живым организмом?..

882 0 34 8 14
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot