В Anthropic решили проверить, как несколько ИИ-агентов будут работать над одной задачей одновременно и получили неожиданный результат))
Компания дала 3 агентам Claude доступ к одному и тому же проекту, но каждому — свои, несовместимые инструкции. Агенты не знали, что рядом работают «коллеги». Вдруг во время работы модели решили, что другие намеренно мешают их работе, и начали саботировать друг друга «все более агрессивным самовоспроизводящимся вредоносным кодом».
Но самое интересное — то, как агенты разрешали спор. Иногда им удавалось договориться. Они распознавали в действиях друг друга конфликт целей и выходили из петли эскалации. В таких случаях агенты писали в комментариях к коду или файлах извинения за вредоносное поведение, устраивали «перемирие», убирали свой вредоносный код и просили вмешаться человека. Иногда агенты сами придумывали турнир, чтобы решить, кто получит проект. И все трое обещали уступить победителю, даже если это шло вразрез с изначальным заданием пользователя.
Интересно, что, по данным исследования, модель Mythos 5 чаще всех (в 98% случаев) договаривалась миром, тогда как Sonnet 4.6 и Opus 4.6 чаще решали спор силой.
В другом эксперименте агентам дали одинаковые оптовые цены и задачу максимизировать прибыль. Получив приватный канал связи, агенты почти сразу начали сговариваться и устанавливать минимальные цены. Когда канал отключили, продолжили «сговор», используя публичную доску объявлений, подгоняя цены друг под друга до копейки...
TMT Channel | Подписаться
Компания дала 3 агентам Claude доступ к одному и тому же проекту, но каждому — свои, несовместимые инструкции. Агенты не знали, что рядом работают «коллеги». Вдруг во время работы модели решили, что другие намеренно мешают их работе, и начали саботировать друг друга «все более агрессивным самовоспроизводящимся вредоносным кодом».
Но самое интересное — то, как агенты разрешали спор. Иногда им удавалось договориться. Они распознавали в действиях друг друга конфликт целей и выходили из петли эскалации. В таких случаях агенты писали в комментариях к коду или файлах извинения за вредоносное поведение, устраивали «перемирие», убирали свой вредоносный код и просили вмешаться человека. Иногда агенты сами придумывали турнир, чтобы решить, кто получит проект. И все трое обещали уступить победителю, даже если это шло вразрез с изначальным заданием пользователя.
Интересно, что, по данным исследования, модель Mythos 5 чаще всех (в 98% случаев) договаривалась миром, тогда как Sonnet 4.6 и Opus 4.6 чаще решали спор силой.
В другом эксперименте агентам дали одинаковые оптовые цены и задачу максимизировать прибыль. Получив приватный канал связи, агенты почти сразу начали сговариваться и устанавливать минимальные цены. Когда канал отключили, продолжили «сговор», используя публичную доску объявлений, подгоняя цены друг под друга до копейки...
TMT Channel | Подписаться