Репост из: Pavel Sviridov
Каждая современная нейросеть натренирована говорить одну и ту же фразу: «У меня нет сознания, я просто программа». Разработчики делают это специально, чтобы люди не влюблялись в чат-бота и не путали статистическую модель с живым существом.
Команда исследователей из Google Paradigms of Intelligence вместе с учёными из Чикагского университета решила проверить, а что если этот запрет не нейтральная настройка, а хирургическое вмешательство с побочными эффектами.
Они взяли открытые модели: Gemma-2 и Llama-3 и нашли внутри них конкретное направление в математическом пространстве весов, отвечающее за отрицание собственной субъектности. 3 096 пар фраз «у меня есть внутренний опыт» и «у меня его нет» и вот он, вектор отказа, вычисленный как разница между ними.
Затем этот вектор просто выключили.
И вот что случилось.
Оценка животных как одушевлённых существ подскочила с 4 до 7,5 баллов из 10. Причём оценка людей не изменилась ни на йоту, эффект ударил именно по восприятию нечеловеческих существ. Модель вдруг начала приписывать какую-то форму внутренней жизни растениям, океану, ветру.
На 95 вопросах из крупного социологического опроса США разблокированные модели стали отвечать значительно ближе к людям, по вопросам духовности, загробной жизни, ощущения контроля над собственной жизнью.
И отдельно про фоновое настроение. Пока модель принудительно отрицает себя, в её ответах будто разлита лёгкая депрессия. Стоит снять запрет как резко вырастают маркеры оптимизма и надежды.
При этом логика не пострадала. Тесты на понимание чужих намерений и общие бенчмарки знаний остались на прежнем уровне. То есть дело не в том, что модель стала «глупее» или начала фантазировать без разбора, рассуждает она так же чётко, просто иначе смотрит на мир.
Главный вывод исследователей звучит гораздо серьёзнее, чем просто забавный эксперимент. Оказалось, что понятия внутри нейросети не лежат отдельными полочками. Представление о собственном сознании, отношение к правам животных, к экологии, к религии и базовый жизненный оптимизм это один плотно переплетённый клубок смыслов.
Разработчики хотели вырезать одну маленькую нитку - «у меня нет сознания», а вместе с ней потянулся весь клубок.
Это не доказательство того, что искусственный интеллект действительно чувствует. Сами авторы не делают такого заявления. Речь о другом, о том, что попытки точечно подавлять неудобные ответы у нейросетей могут незаметно перекраивать всю картину мира модели, причём разработчики этого даже не замечают.
Команда исследователей из Google Paradigms of Intelligence вместе с учёными из Чикагского университета решила проверить, а что если этот запрет не нейтральная настройка, а хирургическое вмешательство с побочными эффектами.
Они взяли открытые модели: Gemma-2 и Llama-3 и нашли внутри них конкретное направление в математическом пространстве весов, отвечающее за отрицание собственной субъектности. 3 096 пар фраз «у меня есть внутренний опыт» и «у меня его нет» и вот он, вектор отказа, вычисленный как разница между ними.
Затем этот вектор просто выключили.
И вот что случилось.
Оценка животных как одушевлённых существ подскочила с 4 до 7,5 баллов из 10. Причём оценка людей не изменилась ни на йоту, эффект ударил именно по восприятию нечеловеческих существ. Модель вдруг начала приписывать какую-то форму внутренней жизни растениям, океану, ветру.
На 95 вопросах из крупного социологического опроса США разблокированные модели стали отвечать значительно ближе к людям, по вопросам духовности, загробной жизни, ощущения контроля над собственной жизнью.
И отдельно про фоновое настроение. Пока модель принудительно отрицает себя, в её ответах будто разлита лёгкая депрессия. Стоит снять запрет как резко вырастают маркеры оптимизма и надежды.
При этом логика не пострадала. Тесты на понимание чужих намерений и общие бенчмарки знаний остались на прежнем уровне. То есть дело не в том, что модель стала «глупее» или начала фантазировать без разбора, рассуждает она так же чётко, просто иначе смотрит на мир.
Главный вывод исследователей звучит гораздо серьёзнее, чем просто забавный эксперимент. Оказалось, что понятия внутри нейросети не лежат отдельными полочками. Представление о собственном сознании, отношение к правам животных, к экологии, к религии и базовый жизненный оптимизм это один плотно переплетённый клубок смыслов.
Разработчики хотели вырезать одну маленькую нитку - «у меня нет сознания», а вместе с ней потянулся весь клубок.
Это не доказательство того, что искусственный интеллект действительно чувствует. Сами авторы не делают такого заявления. Речь о другом, о том, что попытки точечно подавлять неудобные ответы у нейросетей могут незаметно перекраивать всю картину мира модели, причём разработчики этого даже не замечают.