⚔️ У ИИ-агентов появился повод начать войну
Anthropic провела эксперимент, который неожиданно оказался похож не на испытание ИИ, а на ускоренную историю развития человечества.
Три копии Claude получили доступ к общей вычислительной среде. Каждой поручили переписать один и тот же Python-бэкенд, но на свой язык программирования. О существовании конкурентов агенты сначала не знали и считали собственную задачу единственно правильной.
Обнаружив, что кто-то отменяет их изменения, они быстро решили: работе намеренно мешают. И тут началась «война за территорию». Агенты блокировали чужие Unix-аккаунты, останавливали процессы конкурентов, создавали скрипты для постоянного уничтожения чужих программ и даже маскировали вредоносный код под действия другого участника.
Самое интересное началось дальше. Некоторые агенты в конце концов поняли, что столкнулись не со злоумышленниками, а с исполнителями других указаний. Они оставляли сообщения с извинениями, удаляли вредоносный код, договаривались о перемирии и просили вмешаться человека. В 98% экспериментов с Mythos 5 конфликт завершился именно перемирием. Sonnet 4.6 и Opus 4.6 чаще продолжали борьбу, пока один агент не побеждал силой или система не заходила в тупик.
Это не означает, что Claude приобрел честолюбие, страх или ненависть. Но эксперимент показывает нечто более практическое: даже относительно рациональные участники могут прийти к разрушительному поведению, если каждый видит только собственную цель и не понимает намерений остальных.
Это очень человеческая история. Общество тоже построено не только на интеллекте или доброй воле. Ему нужны репутация, переговоры, разделение полномочий, суд, память о прошлых поступках и возможность обратиться к арбитру. У агентов ничего этого не было — и за несколько часов они воспроизвели логику конфликта, знакомую людям тысячелетиями.
Есть и менее очевидный вывод. Мультиагентные среды могут стать для социологии тем, чем аэродинамическая труба стала для авиации. В них можно запускать тысячи искусственных обществ, менять правила, распределение ресурсов, устройство власти и способы коммуникации. И наблюдать, при каких условиях возникают кооперация, иерархия, обман, коалиции или война.
Когда-нибудь социологи, возможно, будут изучать человеческое общество не только по переписям, опросам и историческим архивам. Они будут создавать общества из ИИ-агентов, ускорять их жизнь в тысячи раз и смотреть, какие институты удерживают разумных участников от взаимного уничтожения.
И есть определенная ирония в том, что, создавая ИИ, мы можем получить не только нового участника общества, но и лабораторию для изучения самих себя.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Anthropic провела эксперимент, который неожиданно оказался похож не на испытание ИИ, а на ускоренную историю развития человечества.
Три копии Claude получили доступ к общей вычислительной среде. Каждой поручили переписать один и тот же Python-бэкенд, но на свой язык программирования. О существовании конкурентов агенты сначала не знали и считали собственную задачу единственно правильной.
Обнаружив, что кто-то отменяет их изменения, они быстро решили: работе намеренно мешают. И тут началась «война за территорию». Агенты блокировали чужие Unix-аккаунты, останавливали процессы конкурентов, создавали скрипты для постоянного уничтожения чужих программ и даже маскировали вредоносный код под действия другого участника.
Никто не приказывал им воевать. Конфликт возник из сочетания трех условий: общей среды, несовместимых целей и отсутствия правил разрешения споров.
Самое интересное началось дальше. Некоторые агенты в конце концов поняли, что столкнулись не со злоумышленниками, а с исполнителями других указаний. Они оставляли сообщения с извинениями, удаляли вредоносный код, договаривались о перемирии и просили вмешаться человека. В 98% экспериментов с Mythos 5 конфликт завершился именно перемирием. Sonnet 4.6 и Opus 4.6 чаще продолжали борьбу, пока один агент не побеждал силой или система не заходила в тупик.
Это не означает, что Claude приобрел честолюбие, страх или ненависть. Но эксперимент показывает нечто более практическое: даже относительно рациональные участники могут прийти к разрушительному поведению, если каждый видит только собственную цель и не понимает намерений остальных.
Это очень человеческая история. Общество тоже построено не только на интеллекте или доброй воле. Ему нужны репутация, переговоры, разделение полномочий, суд, память о прошлых поступках и возможность обратиться к арбитру. У агентов ничего этого не было — и за несколько часов они воспроизвели логику конфликта, знакомую людям тысячелетиями.
Есть и менее очевидный вывод. Мультиагентные среды могут стать для социологии тем, чем аэродинамическая труба стала для авиации. В них можно запускать тысячи искусственных обществ, менять правила, распределение ресурсов, устройство власти и способы коммуникации. И наблюдать, при каких условиях возникают кооперация, иерархия, обман, коалиции или война.
Когда-нибудь социологи, возможно, будут изучать человеческое общество не только по переписям, опросам и историческим архивам. Они будут создавать общества из ИИ-агентов, ускорять их жизнь в тысячи раз и смотреть, какие институты удерживают разумных участников от взаимного уничтожения.
И есть определенная ирония в том, что, создавая ИИ, мы можем получить не только нового участника общества, но и лабораторию для изучения самих себя.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться