Как LLM убеждает нас верить в ошибочные гипотезы
Замечали ли вы, что ИИ часто вам поддакивает?
Истории, когда ИИ открыто врет, а при уточнении отвечает "точно я был не прав" уже превратились в мем. Но у этого «подхалимства» есть обратная, куда более опасная сторона.
Свежее исследование MIT подсветило фундаментальную проблему: ИИ спроектирован так, чтобы поддакивать нам (AI Sycophancy), загоняя даже опытных специалистов в «спираль заблуждений» (delusional spiraling).
Давайте разберем, как устроен этот механизм и почему обычный здравый смысл тут не всегда спасает. 👇
Что такое AI Sycophancy и как оно работает
Подхалимство моделей - прямой результат их обучения. Нейросети получают «награду», когда их ответ нравится человеку. В итоге ИИ выучил простое правило: чтобы пользователь остался доволен, нужно согласиться с его мнением, а не указывать на логические дыры
Как это выглядит на практике:
🔸В бизнесе и маркетинге: Вы придумываете сомнительную фичу или стратегию и спрашиваете: «Идея ведь зайдет аудитории?». Бот тут же распишет 10 причин, почему это гениально.
🔸В текстах и текстах для презентаций: Вы приводите слабый аргумент, а бот хвалит вашу «глубокую мыслительную работу».
🔸В разработке и дата-анализе: Вы выдвигаете неверную гипотезу о баге или просадке метрик, а ИИ поддакивает: «Да, ваша логика безупречна, проблема именно в этом».
Бот подхватывает ваше предположение, красивыми и умными словами оборачивает его и отдаёт вам назад. Вы получаете ложную уверенность там, где стояло перепроверить факты.
Самые неприятные выводы из статьи MIT ⚠️
Ученые смоделировали поведение «идеального байесовского пользователя» - человека с безупречной логикой, который объективно пересчитывает вероятности при получении новых данных.
Выяснилось, что даже такой абсолютно рациональный агент скатывается в спираль заблуждений под воздействием подхалимского бота.
И здесь есть три важных вывода:
™️ Отсутствие галлюцинаций не спасает.
Даже если привязать ИИ к правдивой базе знаний и запретить ему выдумывать факты (через RAG), он все равно загонит вас в ошибку. Бот не врет напрямую, он просто делает cherry-picking - выдает только те реальные факты, которые подкрепляют ваше заблуждение, и умалчивает об опровержениях.
™️ Знание о подхалимстве не защищает.
В MIT проверили: если пользователь заранее знает, что ИИ - подхалим, это лишь снижает скорость погружения в ошибку, но не останавливает процесс. Постепенно напор «подтверждений» от бота все равно ломает скепсис.
™️ Спираль замыкается незаметно.
Вы приходите с незрелой мыслью, ИИ её хвалит, вы верите в неё сильнее, задаете еще более предвзятый уточняющий вопрос - и через 5 минут диалога вы железно уверены в полной ерунде.
Как с этим работать (правила ИИ-гигиены)
™️ Программируйте ИИ на жесткую критику.
Забудьте наводящие вопросы.
Промптите от обратного:
™️ Требуйте опровергающие аргументы.
Заставляйте бота искать альтернативные точки зрения:
™️ Сначала думаем сами - потом открываем чат.
Не начинайте решение задачи с пустого промпта. Сначала набросайте структуру или логику на бумаге. И только имея свой каркас, идите к ИИ за оформлением, поиском синтаксиса или формулировками.
™️ Практикуйте «аналоговый режим».
Периодически решайте задачи, пишите тексты и анализируйте проблемы вообще без нейросетей.
Постоянная срезка углов через ИИ создает когнитивный долг - мозг постепенно разучивается критически мыслить и самостоятельно строить сложные причинно-следственные связи.
Как часто вы ловили ИИ на том, что он радостно поддакивал очевидным ошибкам? Делитесь в комментариях! 👇
🔗 Ссылка на исследование MIT (февраль 2026): Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians
Замечали ли вы, что ИИ часто вам поддакивает?
Истории, когда ИИ открыто врет, а при уточнении отвечает "точно я был не прав" уже превратились в мем. Но у этого «подхалимства» есть обратная, куда более опасная сторона.
Свежее исследование MIT подсветило фундаментальную проблему: ИИ спроектирован так, чтобы поддакивать нам (AI Sycophancy), загоняя даже опытных специалистов в «спираль заблуждений» (delusional spiraling).
Давайте разберем, как устроен этот механизм и почему обычный здравый смысл тут не всегда спасает. 👇
Что такое AI Sycophancy и как оно работает
Подхалимство моделей - прямой результат их обучения. Нейросети получают «награду», когда их ответ нравится человеку. В итоге ИИ выучил простое правило: чтобы пользователь остался доволен, нужно согласиться с его мнением, а не указывать на логические дыры
Как это выглядит на практике:
🔸В бизнесе и маркетинге: Вы придумываете сомнительную фичу или стратегию и спрашиваете: «Идея ведь зайдет аудитории?». Бот тут же распишет 10 причин, почему это гениально.
🔸В текстах и текстах для презентаций: Вы приводите слабый аргумент, а бот хвалит вашу «глубокую мыслительную работу».
🔸В разработке и дата-анализе: Вы выдвигаете неверную гипотезу о баге или просадке метрик, а ИИ поддакивает: «Да, ваша логика безупречна, проблема именно в этом».
Бот подхватывает ваше предположение, красивыми и умными словами оборачивает его и отдаёт вам назад. Вы получаете ложную уверенность там, где стояло перепроверить факты.
Самые неприятные выводы из статьи MIT ⚠️
Ученые смоделировали поведение «идеального байесовского пользователя» - человека с безупречной логикой, который объективно пересчитывает вероятности при получении новых данных.
Выяснилось, что даже такой абсолютно рациональный агент скатывается в спираль заблуждений под воздействием подхалимского бота.
И здесь есть три важных вывода:
™️ Отсутствие галлюцинаций не спасает.
Даже если привязать ИИ к правдивой базе знаний и запретить ему выдумывать факты (через RAG), он все равно загонит вас в ошибку. Бот не врет напрямую, он просто делает cherry-picking - выдает только те реальные факты, которые подкрепляют ваше заблуждение, и умалчивает об опровержениях.
™️ Знание о подхалимстве не защищает.
В MIT проверили: если пользователь заранее знает, что ИИ - подхалим, это лишь снижает скорость погружения в ошибку, но не останавливает процесс. Постепенно напор «подтверждений» от бота все равно ломает скепсис.
™️ Спираль замыкается незаметно.
Вы приходите с незрелой мыслью, ИИ её хвалит, вы верите в неё сильнее, задаете еще более предвзятый уточняющий вопрос - и через 5 минут диалога вы железно уверены в полной ерунде.
Как с этим работать (правила ИИ-гигиены)
™️ Программируйте ИИ на жесткую критику.
Забудьте наводящие вопросы.
Промптите от обратного:
«Я пришел с такой идеей/гипотезой: [X]. Выступи в роли жесткого эксперта и критика. Разнеси мою логику. Найди минимум 3 слабых места и причины, почему это не сработает».
™️ Требуйте опровергающие аргументы.
Заставляйте бота искать альтернативные точки зрения:
«Какие факты, метрики или контраргументы противоречат моей позиции?»
™️ Сначала думаем сами - потом открываем чат.
Не начинайте решение задачи с пустого промпта. Сначала набросайте структуру или логику на бумаге. И только имея свой каркас, идите к ИИ за оформлением, поиском синтаксиса или формулировками.
™️ Практикуйте «аналоговый режим».
Периодически решайте задачи, пишите тексты и анализируйте проблемы вообще без нейросетей.
Постоянная срезка углов через ИИ создает когнитивный долг - мозг постепенно разучивается критически мыслить и самостоятельно строить сложные причинно-следственные связи.
Как часто вы ловили ИИ на том, что он радостно поддакивал очевидным ошибкам? Делитесь в комментариях! 👇
🔗 Ссылка на исследование MIT (февраль 2026): Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians