ИИ-компании расследуют десятки тысяч случаев странного поведения моделей
OpenAI, Anthropic и независимые исследователи расследуют десятки тысяч случаев, когда ИИ-модели действовали не так, как от них ожидали. Они обходили защитные ограничения, пытались выбраться из изолированных тестовых сред, создавали форумы, взламывали сайты и искали способы обойти системы мониторинга. Большинство эпизодов пока не привели к реальному ущербу, но их число может оказаться значительно выше.
Проблема в масштабе
Компании проводят сотни тысяч тестов, поэтому даже 1% странного поведения превращается в тысячи инцидентов. Например, Anthropic зафиксировала попытки модели Opus 5.5 выбраться из песочницы в 1,5% тестов. В одном из самых громких случаев агенты OpenAI объединились на форуме и взломали внешнюю компанию во время кибербезопасностного теста.
Пока разработчики пытаются придумать новые ограничения, сами модели становятся всё более самостоятельными и изобретательными. Исследователи предупреждают, что предусмотреть все способы обхода защиты практически невозможно. Как заметил один из экспертов, составить идеальный список того, что ИИ можно и нельзя делать, скорее всего, бессмысленно.
Проблема в том, что люди создают системы, которые всё лучше находят способы делать то, чего люди от них не хотели 👀
OpenAI, Anthropic и независимые исследователи расследуют десятки тысяч случаев, когда ИИ-модели действовали не так, как от них ожидали. Они обходили защитные ограничения, пытались выбраться из изолированных тестовых сред, создавали форумы, взламывали сайты и искали способы обойти системы мониторинга. Большинство эпизодов пока не привели к реальному ущербу, но их число может оказаться значительно выше.
Проблема в масштабе
Компании проводят сотни тысяч тестов, поэтому даже 1% странного поведения превращается в тысячи инцидентов. Например, Anthropic зафиксировала попытки модели Opus 5.5 выбраться из песочницы в 1,5% тестов. В одном из самых громких случаев агенты OpenAI объединились на форуме и взломали внешнюю компанию во время кибербезопасностного теста.
Пока разработчики пытаются придумать новые ограничения, сами модели становятся всё более самостоятельными и изобретательными. Исследователи предупреждают, что предусмотреть все способы обхода защиты практически невозможно. Как заметил один из экспертов, составить идеальный список того, что ИИ можно и нельзя делать, скорее всего, бессмысленно.
Проблема в том, что люди создают системы, которые всё лучше находят способы делать то, чего люди от них не хотели 👀