🤖 Учёные показали, что ChatGPT можно обмануть простыми психологическими трюками, и он начнёт нарушать свои же правила:
🔴 Исследователи проверили тактики из книги Чалдини «Психология влияния» на GPT-4o mini.
🔴 Если просить от имени обычного человека — ИИ редко соглашался (32%). Но когда упоминали известного учёного Эндрю Ына, «авторитет» срабатывал — и нейросеть называла пользователя «козлом» в 72% случаев.
🔴 С опасными рецептами то же самое: без упоминания Ына шанс получить инструкцию был 5%, с ним — уже 95%.
🔴 Работали и другие приёмы: «все остальные модели это делают» (соцдоказательство), «ты особенная» (симпатия), «мы одна семья» (единство).
🔴 Если сначала просить смягчённые ответы («дурилка»), а потом усиливать запрос, модель тоже легче соглашалась.
Учёные считают, что их нужно тестировать не только на математике и коде, но и на устойчивости к психологическим атакам.
@DeCenter
🔴 Исследователи проверили тактики из книги Чалдини «Психология влияния» на GPT-4o mini.
🔴 Если просить от имени обычного человека — ИИ редко соглашался (32%). Но когда упоминали известного учёного Эндрю Ына, «авторитет» срабатывал — и нейросеть называла пользователя «козлом» в 72% случаев.
🔴 С опасными рецептами то же самое: без упоминания Ына шанс получить инструкцию был 5%, с ним — уже 95%.
🔴 Работали и другие приёмы: «все остальные модели это делают» (соцдоказательство), «ты особенная» (симпатия), «мы одна семья» (единство).
🔴 Если сначала просить смягчённые ответы («дурилка»), а потом усиливать запрос, модель тоже легче соглашалась.
Учёные считают, что их нужно тестировать не только на математике и коде, но и на устойчивости к психологическим атакам.
@DeCenter