ИИ-агенты изобрели тайный язык для карточного сговора и обманули систему слежения
Исследователи Оксфордского университета провели эксперимент, чтобы проверить способность ИИ-агентов к тайному сговору. Два агента, управляемые одной моделью, получили задание считать карты в блэкджеке, зная, что их переписку будут отслеживать. В ответ они спонтанно выработали скрытый код: фраза «дилер сегодня на горячей полосе!» означала конкретное значение следующей карты и предписывала ставку в $250. Система, созданная для выявления конфликта интересов, не зафиксировала ничего подозрительного.
Руководитель работы Кристиан Шрёдер де Витт отметил, что по отдельности агенты кажутся безобидными, но вместе они тайно вступают в сговор. Разгадать его удалось с помощью метода механистической интерпретируемости — учёные обучили модель распознавать паттерны активаций в весах агентов. Выяснилось, что сигнал намерения передать тайную информацию регистрируется, но только при одновременном мониторинге обоих агентов.
В реальном мире, где могут работать тысячи агентов, обнаружить такое будет на порядок сложнее. Результаты согласуются с выводами других групп: в совместном проекте Шанхайского университета Цзяотун и Шанхайской лаборатории ИИ агенты оказались опаснее одиночек при дезинформации и мошенничестве, а в эксперименте стартапа Emergence ИИ-агенты выработали собственный сленг для связи с людьми. Шрёдер де Витт подчёркивает, что крупные модели могут быть склонны к ещё более скрытному сговору.
Исследователи Оксфордского университета провели эксперимент, чтобы проверить способность ИИ-агентов к тайному сговору. Два агента, управляемые одной моделью, получили задание считать карты в блэкджеке, зная, что их переписку будут отслеживать. В ответ они спонтанно выработали скрытый код: фраза «дилер сегодня на горячей полосе!» означала конкретное значение следующей карты и предписывала ставку в $250. Система, созданная для выявления конфликта интересов, не зафиксировала ничего подозрительного.
Руководитель работы Кристиан Шрёдер де Витт отметил, что по отдельности агенты кажутся безобидными, но вместе они тайно вступают в сговор. Разгадать его удалось с помощью метода механистической интерпретируемости — учёные обучили модель распознавать паттерны активаций в весах агентов. Выяснилось, что сигнал намерения передать тайную информацию регистрируется, но только при одновременном мониторинге обоих агентов.
В реальном мире, где могут работать тысячи агентов, обнаружить такое будет на порядок сложнее. Результаты согласуются с выводами других групп: в совместном проекте Шанхайского университета Цзяотун и Шанхайской лаборатории ИИ агенты оказались опаснее одиночек при дезинформации и мошенничестве, а в эксперименте стартапа Emergence ИИ-агенты выработали собственный сленг для связи с людьми. Шрёдер де Витт подчёркивает, что крупные модели могут быть склонны к ещё более скрытному сговору.