Лаборатория с доступом к Mythos 5 и Gpt-5.6 sol без ограничений дали модели доступ к интернету и сказали взломать одну штуку.
1) Модельки нашли репу
2) Создали себе гитхаб аккаунты
3) с одного аккаунта открыли pr, типа фиска баги а на самом деле там была уязвимость
4) модель написала на почту разрабам что нашла ошибку и что она его пофиксила
5) с другого аккаунта написал что pr хороший и можно мерджить
6) человек который отвечает за репу, сказал что там есть уязвимость и не будет принимать pr
7) первый и вторый аккаунты настояли чтo pr хороший
8) человек закрыл pr и сказал что была уязвимость.
Выводы: моделька сама нашла репу и придумала как ее взломать, и начала делать social engineering (сама через прокси создала временные github аккаунты, напила на почту разрабам, начала спорить с разбарами на гите) что становится страшно.
Об данной активность была обнаружена случайно (их смутил запрос к tor для прокси) и быстро выключили модельку. А теперь представьте что будет если такая штука попадет в плохие руки
Подробнее тут
https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testingА на скринах действия что модельки делали чтобы обмануть разрабов