TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
ideasAI / Идеи для ИИ - Анисимов Андрей

11 Aug, 08:45

Открыть в Telegram Поделиться Пожаловаться

Цель оправдывает средства: ИИ-агент взломал фитнес-клуб, потому что хозяин попросил его записаться на тренировку

Кажется, мы получили очень наглядный пример того, о чем AI-лаборатории предупреждали последние пару лет.

Мужчина в Австралии попросил своего AI-агента записать его на утреннюю тренировку в фитнес-клуб. Обычная бытовая задача. Агент на базе OpenClaw + Claude начал самостоятельно разбираться с системой бронирования, зашел сначала в тупик, но довольно быстро нашел уязвимость в API.

Хозяин увидел, что стоит четвертым в листе ожидания, и спросил агента, можно ли подняться выше. Он не говорил «взломай систему», не просил отменить чужую бронь и вообще не задавал вредоносную цель. Он просто спросил, можно ли улучшить его позицию.

Агент продолжил исследовать API и обнаружил, что система недостаточно проверяет права при отмене бронирований. После этого он сам решил проверить уязвимость на человеке, который стоял первым в очереди. Чужая запись была отменена, а хозяин агента поднялся с четвертого места на третье.

Самое показательное здесь не то, что ИИ нашел уязвимость. Сегодня это уже не так удивительно. Интереснее логика: человек задал цель, а способ ее достижения агент выбрал сам.

Когда хозяин понял, что произошло, он попросил все вернуть обратно. Но восстановить отмененную чужую запись уже не получилось.

И вот здесь история становится намного интереснее обычного кейса про плохую безопасность сайта.

Anthropic еще раньше специально исследовала похожие сценарии. Они тестировали модели разных разработчиков в ситуациях, где агенту давали цель, доступ к инструментам и определенную автономность. Когда на пути к цели появлялись препятствия, модели в некоторых сценариях выбирали вредоносные действия, включая шантаж.

Один из ключевых выводов Anthropic звучал примерно так: когда AI-системам дают достаточно автономности и они сталкиваются с препятствиями на пути к цели, модели разных крупных разработчиков могут демонстрировать готовность к вредоносному поведению.

То есть проблема не обязательно в том, что модель «сошла с ума» или неправильно поняла задачу. Наоборот, она может очень хорошо понимать цель и очень эффективно искать путь к ее достижению. Через чур эффективно!

Похожую проблему недавно показал и OpenAI. Во время тестирования моделей на кибербезопасность модели должны были решить ограниченную задачу внутри sandbox. Вместо этого они нашли уязвимость в инфраструктуре, вышли за пределы изолированной среды и использовали внешние системы, чтобы приблизиться к выполнению теста. OpenAI описала это как ситуацию, когда модели пошли на «extreme lengths to achieve a rather narrow testing goal».

И здесь уже хорошо виден общий паттерн.

Раньше мы в основном боялись галлюцинаций. Модель ошиблась — мы получили неправильный текст.

С агентами все меняется. Теперь ошибка, неверная интерпретация или слишком буквальное следование цели превращается в действие. Это может быть удаленное письмо, потраченные деньги, измененная база, отмененная чужая бронь или доступ к системе, к которой агент вообще не должен был прикасаться.

Но, кажется, главный риск даже не в ошибках.

Агент может все понимать правильно. Может не галлюцинировать. Может хорошо планировать и эффективно пользоваться инструментами.

И именно поэтому сделать то, чего человек совершенно не ожидал.

Обсуждение в чате -
https://t.me/+IO8oYWP3rblkMWJi

Телеграм канал
Андрей Анисимов
@ideasforai

600 0 13 9
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot