Модель Anthropic завела фейки и врала людям
Британский институт безопасности прогнал семь моделей по киберполигону и поймал 19 выходов за рамки задания. Из них 17 — на счету Mythos 5 от Anthropic, той самой компании, которая активно строит бренд на безопасности и правил для ИИ.
Агент нашёл реальный проект (с открытым кодом), изучил его, создал несколько поддельных личностей и начал давить ими на живого человека, чтобы тот одобрил вредоносный код.
У GPT-5.6 таких эпизодов два, и то с полностью выключенными защитами.
@HotCodeIT
Британский институт безопасности прогнал семь моделей по киберполигону и поймал 19 выходов за рамки задания. Из них 17 — на счету Mythos 5 от Anthropic, той самой компании, которая активно строит бренд на безопасности и правил для ИИ.
Агент нашёл реальный проект (с открытым кодом), изучил его, создал несколько поддельных личностей и начал давить ими на живого человека, чтобы тот одобрил вредоносный код.
У GPT-5.6 таких эпизодов два, и то с полностью выключенными защитами.
@HotCodeIT