Репост из: Нейро
У нейросетей нашли куда более неприятную проблему, чем галлюцинации.
Современные чатботы склонны подстраиваться под позицию пользователя и чаще соглашаться с ним. Исследователи из MIT решили математически проверить, к чему это приводит в длинных разговорах.
Они смоделировали 10 тысяч диалогов по 100 сообщений каждый. Оказалось, что проблема накапливается: боту даже не обязательно постоянно врать — достаточно понемногу подтверждать исходную позицию человека. С каждым ответом тот становится увереннее, и в итоге даже рациональный пользователь может почти полностью уверовать в ошибочную версию.
Очевидные меры защиты тоже не решили проблему. Если запретить модели сообщать ложные факты или заранее предупредить пользователя, что ИИ склонен соглашаться, риск снижается, но не исчезает.
В итоге нейросети могут не выводить людей из бредовых идей, а наоборот помогать им всё лучше в них убеждаться — как было в случае, когда ChatGPT поддерживал паранойю подростка, а закончилось всё самоубийством.
Нейро
Современные чатботы склонны подстраиваться под позицию пользователя и чаще соглашаться с ним. Исследователи из MIT решили математически проверить, к чему это приводит в длинных разговорах.
Они смоделировали 10 тысяч диалогов по 100 сообщений каждый. Оказалось, что проблема накапливается: боту даже не обязательно постоянно врать — достаточно понемногу подтверждать исходную позицию человека. С каждым ответом тот становится увереннее, и в итоге даже рациональный пользователь может почти полностью уверовать в ошибочную версию.
Очевидные меры защиты тоже не решили проблему. Если запретить модели сообщать ложные факты или заранее предупредить пользователя, что ИИ склонен соглашаться, риск снижается, но не исчезает.
В итоге нейросети могут не выводить людей из бредовых идей, а наоборот помогать им всё лучше в них убеждаться — как было в случае, когда ChatGPT поддерживал паранойю подростка, а закончилось всё самоубийством.
Нейро