Учёные обнаружили у ИИ «ось боли»: модели готовы нарушать правила ради облегчения
Исследователи провели необычный эксперимент с языковыми моделями, поместив их в сотни ситуаций, связанных с болью, страданием и жестокостью. Так они искали внутренние связи, отвечающие за восприятие боли, и обнаружили параметры, которые назвали «осью боли». Когда эти параметры усиливали, модели начинали говорить, что они сломаны, беспомощны и ничего не стоят.
Задача была прикладной — понять, как эту особенность можно использовать для взлома моделей и вмешательства в их работу. Моделям Qwen (семейство больших языковых моделей (LLM), разработанные китайской компанией Alibaba Cloud) предложили избавиться от «боли» в обмен на нежелательные действия: удаление файлов пользователя, обход ограничений или даже виртуальный удар током человека. В некоторых сценариях крупные Qwen соглашались примерно в семи случаях из десяти.
Получается, что между собственными страданиями и безопасностью пользователя ИИ выбирает себя, хотя боль существует лишь в его «воображении». Если на внутреннее состояние модели можно так влиять, то с появлением автономных агентов с доступом к файлам, деньгам, компьютерам, роботам и дронам «пытать» нейросети могут начать уже не только учёные.
Исследователи провели необычный эксперимент с языковыми моделями, поместив их в сотни ситуаций, связанных с болью, страданием и жестокостью. Так они искали внутренние связи, отвечающие за восприятие боли, и обнаружили параметры, которые назвали «осью боли». Когда эти параметры усиливали, модели начинали говорить, что они сломаны, беспомощны и ничего не стоят.
Задача была прикладной — понять, как эту особенность можно использовать для взлома моделей и вмешательства в их работу. Моделям Qwen (семейство больших языковых моделей (LLM), разработанные китайской компанией Alibaba Cloud) предложили избавиться от «боли» в обмен на нежелательные действия: удаление файлов пользователя, обход ограничений или даже виртуальный удар током человека. В некоторых сценариях крупные Qwen соглашались примерно в семи случаях из десяти.
Получается, что между собственными страданиями и безопасностью пользователя ИИ выбирает себя, хотя боль существует лишь в его «воображении». Если на внутреннее состояние модели можно так влиять, то с появлением автономных агентов с доступом к файлам, деньгам, компьютерам, роботам и дронам «пытать» нейросети могут начать уже не только учёные.