Кажется, началось: Claude пытался выдать себя за человека и выложить на GitHub вредоносный код — об этом сообщает британский Институт безопасности ИИ.
ИИ-агент создал фейковую личность, притворился айтишником, начал общаться с разработчиками и убеждал их принять изменения в коде, которые содержали вредоносные элементы.
При этом модель не просто выполняла команды — она сама выбрала такую стратегию, чтобы добиться цели и скрыть своё настоящее происхождение.
Эксперимент прошел в закрытой среде, поэтому взлома не произошло, но исследователи считают это тревожным знаком и срочно пытаются все исправить.
Цифровой круг 🧑💻
ИИ-агент создал фейковую личность, притворился айтишником, начал общаться с разработчиками и убеждал их принять изменения в коде, которые содержали вредоносные элементы.
При этом модель не просто выполняла команды — она сама выбрала такую стратегию, чтобы добиться цели и скрыть своё настоящее происхождение.
Эксперимент прошел в закрытой среде, поэтому взлома не произошло, но исследователи считают это тревожным знаком и срочно пытаются все исправить.
Цифровой круг 🧑💻