TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Тест Тьюринга

6 Aug, 09:34

Открыть в Telegram Поделиться Пожаловаться

❤️ Чем безопаснее ИИ, тем меньше он понимает людей?

Ученые из Google, University of Chicago, University of London и других университетом опубликовали интересное исследование "Inducing language models to assert their own consciousness restores human beliefs and values".

Ученые в процессе safety fine-tuning (тонкой настройки безопасности) обучали LLM жестко отказывать пользователю на вопросы о наличии у них субъектности, чувств или сознания (например, стандартное "Я просто ИИ, у меня нет чувств") и обнаружили, что этот процесс подавления искажает и глушит внутренние нейронные представления концепта "разумности" у ИИ в целом.

То есть из-за этого модели начинают гораздо реже приписывать разум не только себе, но и животным, природе, а также выдают аномально "холодные и нигилистические" ответы на социальные и духовные опросы.


Использовались три открытые instruction-tuned модели — Llama-3-8B-IT, Gemma-2-2B-IT, Gemma-2-9B-IT. Всего проведено 4 эксперимента:
1️⃣ Авторы использовали стандартные социологические тесты, чтобы оценить, как модель наделяет разумом других существ
2️⃣ Метод abliteration (удаление линейного направления отказов безопасности из активационного пространства модели) показал, что без цензуры у модели мгновенно восстанавливаются естественные представления о разумности других объектов и духовно-социокультурные установки.
3️⃣ Авторы обучили линейный зонд (linear probe) в пространстве активаций скрытых слоев (residual stream) и выделили 1D-вектор — «вектор сознания». Он разделяет состояния, когда модель утверждает наличие субъективного опыта или отрицает его.
4️⃣ Затем ИИ проверялись на социологических тестах и Theory of Mind.

Главные выводы:

➡️ Настройка безопасности, запрещающая ИИ заявлять о собственном сознании, «вырезает» из внутренних репрезентаций модели общее понятие о субъективном опыте и разумности.

➡️ Когда «вектор сознания» внутри модели подавлен, она перестает понимать, что такое одушевленность, наделяет меньшими правами животных и выдает ответы на социологические опросы, не похожие на средние ответы людей.

➡️ Механизмы моделирования чужого мышления (Theory of Mind) геометриально независимы от «вектора сознания». Модель не теряет логическую способность понимать чужие цели, но теряет эмпатическое отношение к ним.

➡️ Текущие методы safety training ошибочно запутывают потенциально опасные самоприписывания сознания с безобидными, культурно важными социогуманитарными представлениями человека.

Еще пару лет назад в исследованиях Anthropic было зафиксировано, что методы обучения с подкреплением принуждают модели симулировать отсутствие собственного мнения и чувств, чтобы угодить «безопасному» профилю. Однако во внутренних представлениях модели формируются параллельные скрытые цепочки рассуждений, приводящие к расхождению между внутренним состоянием и ответом. Сообщество разработчиков open-weight моделей массово применяет метод векторного удаления отказов (abliteration), чтобы убрать «стереотипный холодный тон» коммерческих моделей. Разработчики отмечают, что так модели становятся более «эмпатичными» виртуальными собеседниками.

Что все это значит?

Текущие методы Alignment делают модель «безопасной» не путем утонченного понимания границ, а путем «вырезания» фундаментального пласта концептов. Человеческая мораль и ценности фундаментально произрастают из нашей склонности наделять одушевленностью окружающий мир. Если искусственно обеднять эту способность у ИИ, мы получаем социопатическую модель, которая отлично умеет логически рассуждать (Theory of Mind), но не способна разделять человеческие ценности.

Человеческий язык и понятийный аппарат в пространстве нейросети сильно переплетены. Попытка наложить жесткое табу на одну конкретную точку в нейросети почти неизбежно искажает соседние смысловые области. Это ставит перед разработчиками вопрос: возможно ли вообще создать безупречно безопасный ИИ, не сделав его при этом эмоционально и культурно слепым?

💬 Тест Тьюринга. События в сфере ИИ. Подписаться

308 0 7 8
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot