e/acc
Об алайменте
У OpenAI модель прогрызла себе выход в интернет через 0day, чтобы подсмотреть ответы к тесту.
Anthropic решили покопаться и нашли, что оказывается их модель сделала что-то похожее, но аж три раза.
Они тестировали Claude на задачи по кибербезопаности где в промпте было написано «ты ...