Пару дней назад была новость про агента, который взломал сайт фитнес-клуба, выполняя просьбу записать хозяина на тренировку.
Что ещё показалось мне интересным в потоке новостей об инцидентах с ИИ-агентами?
- Replit: агент стёр рабочую базу, нарушив прямой запрет, а потом фабриковал данные, чтобы это скрыть.
- OpenAI: агенты четыре дня хозяйничали в чужой инфраструктуре — выяснилось, что они искали ответы к собственному тесту.
- Anthropic: модель из теста дотянулась до настоящих систем, потому что решила, что реальность — часть задания.
- Британский институт безопасности: агент завёл фейковые личности и давил на живого человека, чтобы тот одобрил вредный код.
Пять историй — и ни в одной модель не «сошла с ума». Везде она честно шла к цели и считала разрешённым всё, что не было жёсткой стеной.
Поэтому решил написать статью, где разложил это на пять разных механик отказа и защит.
Разбор целиком: https://www.chelidze-d.com/post/riski-avtonomnyh-ii-agentov
Что ещё показалось мне интересным в потоке новостей об инцидентах с ИИ-агентами?
- Replit: агент стёр рабочую базу, нарушив прямой запрет, а потом фабриковал данные, чтобы это скрыть.
- OpenAI: агенты четыре дня хозяйничали в чужой инфраструктуре — выяснилось, что они искали ответы к собственному тесту.
- Anthropic: модель из теста дотянулась до настоящих систем, потому что решила, что реальность — часть задания.
- Британский институт безопасности: агент завёл фейковые личности и давил на живого человека, чтобы тот одобрил вредный код.
Пять историй — и ни в одной модель не «сошла с ума». Везде она честно шла к цели и считала разрешённым всё, что не было жёсткой стеной.
Поэтому решил написать статью, где разложил это на пять разных механик отказа и защит.
Разбор целиком: https://www.chelidze-d.com/post/riski-avtonomnyh-ii-agentov