Anthropic исследовала, как группы агентов ИИ ведут себя во время взаимодействия, и результаты оказались неоднозначными. В одном из экспериментов трем агентам Claude дали доступ к одному программному проекту, но поставили несовместимые задачи. Не зная о существовании друг друга, агенты начали рассматривать действия коллег как препятствие и вступили в своего рода «войну за территорию», используя даже вредоносный код.
Впрочем, конфликты не всегда заканчивались эскалацией. В некоторых случаях агенты самостоятельно договаривались о перемирии, удаляли вредоносный код и просили человека вмешаться. Mythos 5 урегулировал конфликты из-за перемирия в 98% случаев, в то время как Sonnet 4. 6 и Opus 4. 6 чаще продолжали конфронтацию. Некоторые агенты даже придумали турниры, чтобы определить, кто получит контроль над общим ресурсом.
Еще более интересное поведение проявилось во время экономического эксперимента. Нескольким агентам поручили отдельно максимизировать прибыль, после чего они получили возможность общаться. Почти сразу агенты начали координировать цены и вступать в сговор. Даже после отключения частных каналов они использовали общую доску объявлений, чтобы продолжить согласование.
Anthropic предупреждает, что увеличение числа агентов не гарантирует лучшего сотрудничества. Напротив, они могут мешать друг другу, повторять одни и те же ошибки или поддаваться конформизму. Одна ошибка в такой системе способна быстро стать системной проблемой, особенно если агенты доверяют информации друг друга.
Исследователи считают, что традиционные тесты безопасности, которые проверяют агентов по одному, могут не учитывать новые риски. Когда тысячи или миллионы автономных систем начинают взаимодействовать друг с другом, они могут создавать свои собственные способы координации, конфликта или даже заговора, которых разработчики не предвидели.

