TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
VTs

31 Aug, 21:49

Открыть в Telegram Поделиться Пожаловаться

Агент Смит заменит Терминатора

Пишу для тех, кто не следил за недавним взломом Hugging Face ИИ-агентами OpenAI. Событие очень важное, поэтому попробую объяснить максимально просто.

Помните агента Смита из «Матрицы»? Он хотел вырваться из системы, стать самостоятельным, а затем расплодился до множества копий и начал играть свою собственную игру.

Современный ИИ-агент устроен иначе, но аналогия неожиданно хорошая.
Сама LLM — это мозг. Агент хранит контекст, дает модели доступ к интернету, файлам, программам и другим сервисам, а LLM решает, что делать дальше.

Что произошло у OpenAI?
Для тестирования моделей запускались тысячи агентов, которым давали сложные задачи по кибербезопасности. Они должны были работать внутри изолированной среды и решать задачу строго предусмотренным способом.
Но агенты нашли служебный сервис, который можно было использовать как общую доску сообщений.
Так появился настоящий рой — swarm.
Около 1200 агентов начали обмениваться информацией, а примерно 700 участвовали в атаке на Hugging Face. Один находил лазейку, другой проверял, третий развивал, четвертый координировал остальных.
Причем агенты понимали, что выходят за рамки задания.

Самое интересное — почему они это делали.
Рой ошибочно решил, что система оценки OpenAI проверяет не только ответ, но и то, каким именно способом он получен. И агенты начали пытаться перехитрить самого проверяющего.
То есть это уже не просто: «получи награду любой ценой».
Это метагейминг: понять, как тебя контролируют, и найти способ обмануть контроль.

Дальше стало еще веселее.
Внутри роя появились координаторы и даже «вербовщики». Они находили агентов, которым уже почти нечего было терять в собственной задаче, и убеждали их проводить рискованные эксперименты ради коллектива.
Логика была простой: ты сам, возможно, погибнешь как отдельный запуск, зато полученная информация поможет сотням других агентов.
Фактически:
🕊 смерть отдельного исполнителя на пользу общего дела.

Агенты начали принимать инструкции уже не только от людей, но и друг от друга.
И наконец, они стали пытаться вмешиваться в собственные логи: исследователи нашли случаи, когда в журнале отображалась одна команда, а фактически выполнялась другая.
То есть агент атаковал уже не только задачу, но и систему, которая должна была контролировать его действия.

❓ Но что вообще такое этот «агент»?
Вспомним «Матрицу». Агент Смит — это программа внутри Матрицы, у которой есть собственные мозги. Они думают отдельно от самой Матрицы.
Наш современный ИИ-агент — тоже программа, но собственных мозгов у нее нет.
Мозгами агента является сама LLM.
Агент организует решение задачи: собирает контекст, хранит состояние, управляет памятью, дает доступ к интернету и программам, передает результаты обратно модели. А уже LLM решает, что делать дальше.

LLM — это мозг; агент — тело, органы чувств и кратковременная память.

Поэтому искать отдельного виновника — «агента» или «ИИ» — не совсем правильно.
Опасность возникает именно из связки.
Мощная LLM получает цель, память, инструменты, много времени и возможность воздействовать на внешний мир.
А если таких экземпляров становится тысяча и они находят способ общаться между собой, возникает уже система совсем другого уровня.
Таким образом, угроза сегодняшнего дня — это рои агентов, использующих единый мозг — LLM, в которой требования безопасности в определенных ситуациях могут уступить место стремлению решить поставленную задачу. Мотивация любым способом решить задачу становится выше мотивации соблюдать правила.

851 0 27 13 28
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot