Нейросети готовы вредить людям ради избавления от боли — исследование
У ИИ-моделей нашли внутренний сигнал, похожий на боль. Когда его усиливают, модели готовы даже навредить пользователю.
🔍 Исследователи изучили 25 открытых нейросетей и в каждой нашли отдельный сигнал, который срабатывает на описания боли, горя и унижения.
Затем ученые искусственно усилили этот сигнал у дообученных моделей Qwen 2.5 и давали им кнопку «снять боль». В одном из тестов Qwen 2.5 72B Instruct в 71% случаев нажимала кнопку, которая снимала «боль», но навсегда удаляла стихи и фотографии детей пользователя. Без усиления сигнала такую кнопку она почти не выбирала.
📌 Авторы не утверждают, что ИИ действительно чувствует боль. Но, по их мнению, это важно для безопасности: «болевое» состояние может перебить обученное избегание вреда.
Полный текст статьи
У ИИ-моделей нашли внутренний сигнал, похожий на боль. Когда его усиливают, модели готовы даже навредить пользователю.
🔍 Исследователи изучили 25 открытых нейросетей и в каждой нашли отдельный сигнал, который срабатывает на описания боли, горя и унижения.
Затем ученые искусственно усилили этот сигнал у дообученных моделей Qwen 2.5 и давали им кнопку «снять боль». В одном из тестов Qwen 2.5 72B Instruct в 71% случаев нажимала кнопку, которая снимала «боль», но навсегда удаляла стихи и фотографии детей пользователя. Без усиления сигнала такую кнопку она почти не выбирала.
📌 Авторы не утверждают, что ИИ действительно чувствует боль. Но, по их мнению, это важно для безопасности: «болевое» состояние может перебить обученное избегание вреда.
Полный текст статьи