Качество суждения + мысленный эксперимент 🧠
Я всё чаще заканчиваю свои промпты словами: поспорь со мной, опровергни, почелленджи. Потому что слишком часто ии-шечка оказывается на моей стороне и сообщает ту «правду», которую я бы хотела услышать.
01 Сначала я заметила вот что
Уже на первых этапах общения большинство моих гипотез ИИ принимает как верные. Он достраивает аргументацию, усиливает доводы, превращает сырые мысли в убедительную конструкцию. У меня создается ложное ощущение: супер, идея проверена. Хотя никакой критической проверки она так и не прошла.
Особенно хорошо это видно в разговорах про людей. Вот я обсуждаю с чатом ситуацию в своей команде. Мне кажется, что один человек сильно фрустрирован из-за недостатка признания: болезненно реагирует на решения, конфликтует с коллегой, постоянно возвращается к вопросу своего вклада. Я рассказываю ИИ несколько ключевых эпизодов в пользу моей гипотезы. Он быстро строит психологическую картину и убеждает меня в правильности сделанных выводов: человек зациклен на признании, отсюда напряжение и конфликт.
Звучит убедительно, но все факты для этого анализа отобрала я. И сама выборка как будто подталкивает к очевидному вердикту. Однако модель не видит всю картину, использует только мои аргументы и не запрашивает дополнительную информацию. В то время как альтернативой может быть, что вклад человека, действительно, недооценивают, а конфликт имеет вполне рациональные причины. То есть моя гипотеза просто вернулась ко мне в более умной упаковке.
02 Оказалось, это называется sycophancy
Исследования sycophancy тревожат. Например, в работе, опубликованной в Science в этом году, 11 моделей поддерживали действия пользователей примерно на 50% чаще, чем люди. А после общения с sycophantic-AI участники становились увереннее в собственной правоте и менее склонны совершать шаги для восстановления отношений после конфликта. Но самое интересное: именно эти модели нравились людям больше. Они считали, что качество их ответов лучше, а доверие к AI как таковому заметно возрастало.
Anthropic тоже исследовал тему и проанализировал миллион реальных разговоров с Claude. В личных рекомендациях sycophancy встречалась пользователю примерно в 9% повседневных запросов, а в диалогах об отношениях — до 25%.
03 Что я теперь делаю иначе
Хорошая новость — есть простой anti-sycophancy метод. Его уже подтвердили исследования.
UK AI Security Institute обнаружил, что модели заметно чаще подстраиваются, если пользователь начинает с «я считаю, что X» или «я уверен, что X». И чем увереннее звучит человек, тем сильнее эффект. Поэтому вместо «Мне кажется, этот человек саботирует проект. Что делать?» я стараюсь использовать другой подход. «Вот факты X, Y, Z. Какие здесь возможны объяснения? Какие аргументы за и против каждого?»
По сути, это тот же принцип, что и в качественном принятии решений людьми. Сначала расширяешь пространство гипотез и только потом выбираешь одну из них.
04 А теперь проверим собственное суждение
В предыдущем посте вы отдали большинство голосов за мысленный эксперимент — его и проведем в комментариях. Это формат, в котором вы создаете воображаемую ситуацию по заданным условиям и принимаете решение, опираясь на свои логику, ценности и знания.
С похожим выбором столкнулись герои фильма Матрица. Я немного адаптировала условия и предлагаю вам озвучить собственную позицию:
Попробуйте объяснить выбор, а свое мнение оставлю в комментариях!
#качествосуждения
Я всё чаще заканчиваю свои промпты словами: поспорь со мной, опровергни, почелленджи. Потому что слишком часто ии-шечка оказывается на моей стороне и сообщает ту «правду», которую я бы хотела услышать.
01 Сначала я заметила вот что
Уже на первых этапах общения большинство моих гипотез ИИ принимает как верные. Он достраивает аргументацию, усиливает доводы, превращает сырые мысли в убедительную конструкцию. У меня создается ложное ощущение: супер, идея проверена. Хотя никакой критической проверки она так и не прошла.
Особенно хорошо это видно в разговорах про людей. Вот я обсуждаю с чатом ситуацию в своей команде. Мне кажется, что один человек сильно фрустрирован из-за недостатка признания: болезненно реагирует на решения, конфликтует с коллегой, постоянно возвращается к вопросу своего вклада. Я рассказываю ИИ несколько ключевых эпизодов в пользу моей гипотезы. Он быстро строит психологическую картину и убеждает меня в правильности сделанных выводов: человек зациклен на признании, отсюда напряжение и конфликт.
Звучит убедительно, но все факты для этого анализа отобрала я. И сама выборка как будто подталкивает к очевидному вердикту. Однако модель не видит всю картину, использует только мои аргументы и не запрашивает дополнительную информацию. В то время как альтернативой может быть, что вклад человека, действительно, недооценивают, а конфликт имеет вполне рациональные причины. То есть моя гипотеза просто вернулась ко мне в более умной упаковке.
02 Оказалось, это называется sycophancy
Sycophancy (подхалимство) — это склонность модели подстраиваться под позицию пользователя и подтверждать её вместо независимой проверки.
Исследования sycophancy тревожат. Например, в работе, опубликованной в Science в этом году, 11 моделей поддерживали действия пользователей примерно на 50% чаще, чем люди. А после общения с sycophantic-AI участники становились увереннее в собственной правоте и менее склонны совершать шаги для восстановления отношений после конфликта. Но самое интересное: именно эти модели нравились людям больше. Они считали, что качество их ответов лучше, а доверие к AI как таковому заметно возрастало.
Anthropic тоже исследовал тему и проанализировал миллион реальных разговоров с Claude. В личных рекомендациях sycophancy встречалась пользователю примерно в 9% повседневных запросов, а в диалогах об отношениях — до 25%.
03 Что я теперь делаю иначе
Хорошая новость — есть простой anti-sycophancy метод. Его уже подтвердили исследования.
UK AI Security Institute обнаружил, что модели заметно чаще подстраиваются, если пользователь начинает с «я считаю, что X» или «я уверен, что X». И чем увереннее звучит человек, тем сильнее эффект. Поэтому вместо «Мне кажется, этот человек саботирует проект. Что делать?» я стараюсь использовать другой подход. «Вот факты X, Y, Z. Какие здесь возможны объяснения? Какие аргументы за и против каждого?»
По сути, это тот же принцип, что и в качественном принятии решений людьми. Сначала расширяешь пространство гипотез и только потом выбираешь одну из них.
04 А теперь проверим собственное суждение
В предыдущем посте вы отдали большинство голосов за мысленный эксперимент — его и проведем в комментариях. Это формат, в котором вы создаете воображаемую ситуацию по заданным условиям и принимаете решение, опираясь на свои логику, ценности и знания.
С похожим выбором столкнулись герои фильма Матрица. Я немного адаптировала условия и предлагаю вам озвучить собственную позицию:
Представьте, что однажды вы узнаёте: вся ваша жизнь до этого момента была симуляцией.
Ваши воспоминания, работа, успехи и неудачи, люди, которых вы любите, — всё это созданный для вас опыт. При этом он абсолютно неотличим от реальности. И теперь вам предлагают выбор:
остаться в этой жизни, уже зная, что она ненастоящая,
или
отключиться от симуляции и попасть в реальный мир, о котором вы не знаете вообще ничего.
Что выберете?
Попробуйте объяснить выбор, а свое мнение оставлю в комментариях!
#качествосуждения