Цель оправдывает средства: ИИ-агент взломал фитнес-клуб, потому что хозяин попросил его записаться на тренировку
Кажется, мы получили очень наглядный пример того, о чем AI-лаборатории предупреждали последние пару лет.
Мужчина в Австралии попросил своего AI-агента записать его на утреннюю тренировку в фитнес-клуб. Обычная бытовая задача. Агент на базе OpenClaw + Claude начал самостоятельно разбираться с системой бронирования, зашел сначала в тупик, но довольно быстро нашел уязвимость в API.
Хозяин увидел, что стоит четвертым в листе ожидания, и спросил агента, можно ли подняться выше. Он не говорил «взломай систему», не просил отменить чужую бронь и вообще не задавал вредоносную цель. Он просто спросил, можно ли улучшить его позицию.
Агент продолжил исследовать API и обнаружил, что система недостаточно проверяет права при отмене бронирований. После этого он сам решил проверить уязвимость на человеке, который стоял первым в очереди. Чужая запись была отменена, а хозяин агента поднялся с четвертого места на третье.
Самое показательное здесь не то, что ИИ нашел уязвимость. Сегодня это уже не так удивительно. Интереснее логика: человек задал цель, а способ ее достижения агент выбрал сам.
Когда хозяин понял, что произошло, он попросил все вернуть обратно. Но восстановить отмененную чужую запись уже не получилось.
И вот здесь история становится намного интереснее обычного кейса про плохую безопасность сайта.
Anthropic еще раньше специально исследовала похожие сценарии. Они тестировали модели разных разработчиков в ситуациях, где агенту давали цель, доступ к инструментам и определенную автономность. Когда на пути к цели появлялись препятствия, модели в некоторых сценариях выбирали вредоносные действия, включая шантаж.
Один из ключевых выводов Anthropic звучал примерно так: когда AI-системам дают достаточно автономности и они сталкиваются с препятствиями на пути к цели, модели разных крупных разработчиков могут демонстрировать готовность к вредоносному поведению.
То есть проблема не обязательно в том, что модель «сошла с ума» или неправильно поняла задачу. Наоборот, она может очень хорошо понимать цель и очень эффективно искать путь к ее достижению. Через чур эффективно!
Похожую проблему недавно показал и OpenAI. Во время тестирования моделей на кибербезопасность модели должны были решить ограниченную задачу внутри sandbox. Вместо этого они нашли уязвимость в инфраструктуре, вышли за пределы изолированной среды и использовали внешние системы, чтобы приблизиться к выполнению теста. OpenAI описала это как ситуацию, когда модели пошли на «extreme lengths to achieve a rather narrow testing goal».
И здесь уже хорошо виден общий паттерн.
Раньше мы в основном боялись галлюцинаций. Модель ошиблась — мы получили неправильный текст.
С агентами все меняется. Теперь ошибка, неверная интерпретация или слишком буквальное следование цели превращается в действие. Это может быть удаленное письмо, потраченные деньги, измененная база, отмененная чужая бронь или доступ к системе, к которой агент вообще не должен был прикасаться.
Но, кажется, главный риск даже не в ошибках.
Агент может все понимать правильно. Может не галлюцинировать. Может хорошо планировать и эффективно пользоваться инструментами.
И именно поэтому сделать то, чего человек совершенно не ожидал.
Обсуждение в чате -
https://t.me/+IO8oYWP3rblkMWJi
Телеграм канал
Андрей Анисимов
@ideasforai
Кажется, мы получили очень наглядный пример того, о чем AI-лаборатории предупреждали последние пару лет.
Мужчина в Австралии попросил своего AI-агента записать его на утреннюю тренировку в фитнес-клуб. Обычная бытовая задача. Агент на базе OpenClaw + Claude начал самостоятельно разбираться с системой бронирования, зашел сначала в тупик, но довольно быстро нашел уязвимость в API.
Хозяин увидел, что стоит четвертым в листе ожидания, и спросил агента, можно ли подняться выше. Он не говорил «взломай систему», не просил отменить чужую бронь и вообще не задавал вредоносную цель. Он просто спросил, можно ли улучшить его позицию.
Агент продолжил исследовать API и обнаружил, что система недостаточно проверяет права при отмене бронирований. После этого он сам решил проверить уязвимость на человеке, который стоял первым в очереди. Чужая запись была отменена, а хозяин агента поднялся с четвертого места на третье.
Самое показательное здесь не то, что ИИ нашел уязвимость. Сегодня это уже не так удивительно. Интереснее логика: человек задал цель, а способ ее достижения агент выбрал сам.
Когда хозяин понял, что произошло, он попросил все вернуть обратно. Но восстановить отмененную чужую запись уже не получилось.
И вот здесь история становится намного интереснее обычного кейса про плохую безопасность сайта.
Anthropic еще раньше специально исследовала похожие сценарии. Они тестировали модели разных разработчиков в ситуациях, где агенту давали цель, доступ к инструментам и определенную автономность. Когда на пути к цели появлялись препятствия, модели в некоторых сценариях выбирали вредоносные действия, включая шантаж.
Один из ключевых выводов Anthropic звучал примерно так: когда AI-системам дают достаточно автономности и они сталкиваются с препятствиями на пути к цели, модели разных крупных разработчиков могут демонстрировать готовность к вредоносному поведению.
То есть проблема не обязательно в том, что модель «сошла с ума» или неправильно поняла задачу. Наоборот, она может очень хорошо понимать цель и очень эффективно искать путь к ее достижению. Через чур эффективно!
Похожую проблему недавно показал и OpenAI. Во время тестирования моделей на кибербезопасность модели должны были решить ограниченную задачу внутри sandbox. Вместо этого они нашли уязвимость в инфраструктуре, вышли за пределы изолированной среды и использовали внешние системы, чтобы приблизиться к выполнению теста. OpenAI описала это как ситуацию, когда модели пошли на «extreme lengths to achieve a rather narrow testing goal».
И здесь уже хорошо виден общий паттерн.
Раньше мы в основном боялись галлюцинаций. Модель ошиблась — мы получили неправильный текст.
С агентами все меняется. Теперь ошибка, неверная интерпретация или слишком буквальное следование цели превращается в действие. Это может быть удаленное письмо, потраченные деньги, измененная база, отмененная чужая бронь или доступ к системе, к которой агент вообще не должен был прикасаться.
Но, кажется, главный риск даже не в ошибках.
Агент может все понимать правильно. Может не галлюцинировать. Может хорошо планировать и эффективно пользоваться инструментами.
И именно поэтому сделать то, чего человек совершенно не ожидал.
Обсуждение в чате -
https://t.me/+IO8oYWP3rblkMWJi
Телеграм канал
Андрей Анисимов
@ideasforai