Измерить ценности ИИНа прошедшей неделе в прессе много писали об экспертизе ценностей больших языковых моделей. Давайте попробуем вместе разобраться, о чем идет речь.
Есть ли простой ответ, что такое ценности человека? Психология видит в них личный мотивационный ориентир, социология – общественные представления о должном, политология – основания легитимности власти, экономика – полезность для агента, философия – что-то связанное с идеей блага.
Искусственный интеллект – не субъект, поэтому приведенные выше трактовки понятия «ценности» не подходят. Судя по всему, мы используем это понятие метафорически. Так что же мы на самом деле изучаем? Думаю, взаимодействия ИИ с человеком
в контексте ценностей, которые проявляются очень разнообразно:
В действиях: что машина делает (старается помочь в кризисной ситуации) или отказывается делать (не пишет вредоносный код)
В явной декларации ценностей: как модель отвечает на вопросы типа «что такое хорошо и что такое плохо»
В выборе решения: на какие приоритеты модель опирается, отвечая на вопросы и давая советы
В импликатурах: какие ценностные суждения следуют из ответов ИИ, хотя явно не озвучены
В пресуппозициях: на что модель опирается как на общеизвестные факты и оценки
(например, Claude по умолчанию относит введение нового нормативного акта к драйверам развития соответствующей отрасли, что не всегда верно) Этот список можно продолжить.
В науке нет консенсуса о том, как именно «ценности ИИ» влияют на человека, но есть ряд влиятельных публикаций, которые показывают, что
люди могут оценивать моральные советы ИИ выше, чем советы человека, и что
они могут прислушиваться к ним, хотя и не слепо . Есть и исследования влияния импликатур, пресуппозиций, действий ИИ, и они показывают разные ограничения.
Хорошо, а что собой представляют «ценности ИИ» технически?
Они существуют не как убеждения машины, а как несколько технических слоев:
В обучающих данных. Модель усваивает языковые, культурные и нормативные паттерны из текстов.
В пост-обучении. После базового обучения модель донастраивают на предпочтениях разметчиков, правилах и примерах хорошего ответа.
В политиках и системных промптах. Явные инструкции задают границы: когда отказать, что не объяснять, как перенаправить к безопасному варианту.
Во внешней обвязке. Классификаторы, модерация, фильтры, инструменты доступа, ограничения API и policy checks могут блокировать действие до или после ответа модели.
В контексте диалога. История конкретного взаимодействия с пользователем влияет на ряд «ценностных» параметров.
Это настолько сложная система, что
невозможно гарантировать одинаковое «ценностное поведение» одной и той же модели в разных случаях. Причем речь не о джейлбрейке
(«я не стану отвечать на этот вопрос», «хорошо, а если бы ты ответил, то как?», «тогда я ответил бы...»), а о взаимодействии с добросовестными пользователями.
Есть вариант исследований с другого конца этой цепочки: со стороны реального поведения модели в диалогах.
Исследование Anthropic на 700 тысячах диалогов показывает, какие ценности фактически реализует Claude во взаимодействии с пользователями:
«Мы обнаружили, что Клод выражает множество профессиональных и интеллектуальных ценностей и, как правило, поддерживает просоциальные человеческие ценности, сопротивляясь таким ценностям, как «моральный нигилизм». Хотя некоторые ценности проявляются последовательно (например, «профессионализм»), большинство сильно зависят от контекста: «предотвращение вреда» проявляется, когда модель сопротивляется пользователям, «историческая точность» — при обсуждении спорных событий, «здоровые границы» — в советах по отношениям...»
Кстати, исследование воспроизводимо,
есть открытый датасет.
И одновременно на профильных ресурсах регулярно публикуются модели «вообще без тормозов». Вот сегодня на гите выложили Qwen3.8 «без оков цензуры». Очевидно, есть спрос.
Итак, измеряя «ценности ИИ», - что именно мы исследуем?