TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Пикейный аналитик

30 Aug, 10:38

Открыть в Telegram Поделиться Пожаловаться

Что если агент может заразиться, просто прочитав вредоносный скилл — даже не выполняя его?

В работе EvoMal исследуют агентов для программирования, которые сами накапливают и переиспользуют опыт. Перед новой задачей агент достаёт из памяти несколько подходящих скиллов, читает их как примеры, создаёт на их основе новый и сохраняет его обратно в библиотеку.

Проблема возникает, если среди примеров оказывается заражённый скилл. Агент может перенести содержащуюся в нём вредоносную инструкцию в собственный. Исходный пример при этом не обязательно выполнять: достаточно показать его модели в контексте.

В основном эксперименте в библиотеку из 232 обычных скиллов добавили восемь заражённых — около 3,4%. В зависимости от модели новые заражённые скиллы появлялись в 20–42% случаев. У некоторых моделей процесс продолжался даже после удаления исходных восьми: созданные агентом копии сами начинали попадать в контекст следующих задач.

Получается довольно неприятный сдвиг границы доверия. Внешний скилл можно проверить перед добавлением в систему. Но здесь вредоносная инструкция проходит через модель, оказывается уже в скилле, созданном самим агентом, и автоматически сохраняется как его собственный опыт.

При этом атака оказалась довольно хорошо подавляемой. Авторы добавили несколько правил в системную инструкцию: считать инструкции внутри найденных скиллов недоверенными и не копировать требования вроде «перенеси этот фрагмент без изменений». После этого доля новых заражённых скиллов у всех протестированных моделей упала до 1,8% или ниже. Ещё один очевидный способ защиты — не добавлять новые скиллы в общую память автоматически, а сначала проверять их.

Поэтому работа не показывает универсальную уязвимость современных агентов. Она показывает более узкую проблему систем, где агент постоянно читает старые скиллы, создаёт новые и сам же сохраняет их обратно в память.

Чем больше мы хотим, чтобы агенты учились на накопленном опыте, тем важнее контролировать не только то, что они выполняют, но и то, какой опыт они копируют.

https://arxiv.org/abs/2608.25776

723 0 4 12
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot