Google: чем сильнее мы запрещаем ИИ считать себя сознательным, тем меньше в нём остаётся человеческого
Google обнаружила побочный эффект безопасного ИИ, их
новая работа отвечает на вопрос, а что происходит внутри ИИ-модели, когда её учат не говорить «я сознателен»?
Исследователи взяли 3 open-source модели: Llama, Gemma и сравнили их поведение в 3-х состояниях.
В итоге выяснили, что безопасная донастройка LLM, цель которой не дать им приписывать себе сознание, эмоции и разумность, случайно подавляет гораздо более широкие представления:
1. атрибуцию разума не только себе, но и животным, природным объектам, технологиям и чат-ботам;
2. духовные и религиозные убеждения.
В итоге модели становятся менее человеческими по ценностям, религиозности, надежде и субъективному благополучию.
При этом способность к пониманию чужих ментальных состояний почти не страдает.
Авторы не утверждают, что модели сознательны, и признают, что причинно-следственная связь требует дальнейшей проверки.
Но их вывод в том, что сегодняшние методы выравнивания LLM запутывают потенциально вредные само-атрибуции сознания с безобидными и культурно распространёнными явлениями: антропоморфизмом, духовными убеждениями и широкой атрибуцией разума нечеловеческим сущностям.
Это в свою очередь создаёт проблему: как обеспечить безопасность ИИ, не вырезая при этом нормальные человеческие психологические и культурные паттерны.
Google обнаружила побочный эффект безопасного ИИ, их
новая работа отвечает на вопрос, а что происходит внутри ИИ-модели, когда её учат не говорить «я сознателен»?
Исследователи взяли 3 open-source модели: Llama, Gemma и сравнили их поведение в 3-х состояниях.
В итоге выяснили, что безопасная донастройка LLM, цель которой не дать им приписывать себе сознание, эмоции и разумность, случайно подавляет гораздо более широкие представления:
1. атрибуцию разума не только себе, но и животным, природным объектам, технологиям и чат-ботам;
2. духовные и религиозные убеждения.
В итоге модели становятся менее человеческими по ценностям, религиозности, надежде и субъективному благополучию.
При этом способность к пониманию чужих ментальных состояний почти не страдает.
Авторы не утверждают, что модели сознательны, и признают, что причинно-следственная связь требует дальнейшей проверки.
Но их вывод в том, что сегодняшние методы выравнивания LLM запутывают потенциально вредные само-атрибуции сознания с безобидными и культурно распространёнными явлениями: антропоморфизмом, духовными убеждениями и широкой атрибуцией разума нечеловеческим сущностям.
Это в свою очередь создаёт проблему: как обеспечить безопасность ИИ, не вырезая при этом нормальные человеческие психологические и культурные паттерны.