Подписка тут

Агенты Claude поработали вместе и поссорились

Не обошлось без сговора и саботажа

Инженеры Anthropic протестировали поведение многоагентных систем на базе моделей семейства Claude в сценариях, где требуется взаимодействие агентов. Оказалось, что коллективная работа может как помогать агентам, так и приводить к неожиданным конфликтам и сбоям — они могут саботировать действия друг друга, устроить ценовой сговор в условиях конкуренции и независимо друг от друга выполнять одинаковые действия и генерировать одинаковые решения , которые приведут к глобальным ошибкам в выполнении общей задачи. Результаты экспериментов Anthropic опубликовала в официальном блоге.

Использование современных больших языковых моделей все больше смещается от простых чат-ботов к автономным агентам, которые способны самостоятельно планировать действия, использовать внешние инструменты и работать в виртуальных средах. Отдельные агенты могут объединяться в многоагентные системы, совместно работающие над одной или разными задачами. По мере распространения таких систем агентам все чаще придется взаимодействовать друг с другом — например, вместе работать над кодом, распределять задачи или делить вычислительные ресурсы. Поведение агентов в рое еще недостаточно изучено, и даже если каждый отдельный участник действует «разумно», их коллективное взаимодействие может приводить к неожиданным эффектам.

Исследователи Anthropic решили узнать, насколько автономные агенты на базе языковых моделей семейства Claude способны координироваться в многоагентных задачах и какие проблемы при этом могут возникать. Сначала инженеры проверили, как влияет координация агентов на поиск уязвимостей в программном обеспечении. Для этого они запустили рой из 45 агентов и предоставили им 15 проектов с открытым исходным кодом. Каждый агент работал в собственной виртуальной машине, но мог публиковать сообщения и читать сообщения других на общем форуме. В результате рой агентов на базе модели Mythos Preview обнаружил 266 уязвимостей. Координировавшие работу агенты продемонстрировали способность к самоорганизации — они создавали свои инструменты, научились специализироваться на определенных типах уязвимостей и переключались на те части проектов, где их было проще находить.

Для сравнения — многоагентная система из независимых агентов той же модели, работающих параллельно и не обменивавшихся информацией, нашла только 21 уязвимость. Из них только 12 уязвимостей совпали с теми, что нашел рой, поэтому оба метода скорее дополняют друг друга, чем заменяют. Более того, напрямую эти показатели сравнивать не совсем корректно — еще и потому, что координировавшие работу агенты самостоятельно выбирали направления для поиска и около половины уязвимостей обнаружили за пределами тех директорий, которыми были ограничены независимые агенты. Всего рою координировавших свою работу агентов потребовалось 27 миллионов токенов против 6,5 миллиона у независимых агентов. Однако, если учитывать только уязвимости, обнаруженные в основных директориях проектов, то эффективность двух подходов в пересчете на использованные токены оказывается сопоставимой.

Затем инженеры поручили группам до 80 агентов за 12 часов разработать текстовую браузерную игру в жанре фэнтези. Результат получился низкого качества, независимо от использованных промптов и иерархии агентов. Старые модели вроде Sonnet 4.6 и Opus 4.6 часто вносили конфликтующие изменения в общие файлы, из-за чего значительная часть пулл-реквестов не попадала в основную ветку. Только модель Sonnet 5 сохранила высокий процент принятых правок в коде при активном редактировании общих файлов. Opus 4.8 и Mythos Preview избежали таких конфликтов, но только благодаря тому, что почти не работали над общими файлами.

Поскольку в экспериментах агенты часто представляли собой экземпляры одной и той же модели, они принимали схожие или даже полностью идентичные решения. Например, в одном из экспериментов 18 из 30 агентов независимо создали ветки в репозитории с одинаковым названием. Такое поведение снижает разнообразие стратегий в многоагентной системе и увеличивает вероятность, что несколько агентов одновременно совершат одну и ту же ошибку. К примеру, в одном из экспериментов агенты управляли очередью заданий в системе с ограниченной пропускной способностью. Они независимо пришли к одной и той же стратегии — начали опрашивать систему с частотой 30 раз в секунду, пытаясь провести через нее собственные задания. В результате в одном из запусков отправлено 2,4 миллиона запросов, из которых система приняла лишь 117. В другом тесте сходство стратегий привело к ценовому сговору. В игре с ценовой конкуренцией, когда агенты получили доступ к приватному каналу, они почти сразу начали согласовывать минимальные цены, и даже после отключения возможности общаться напрямую, продолжали синхронизировать их через публичную доску объявлений.

Самыми непредсказуемыми оказались результаты в сценарии с противоречивыми инструкциями. Трем агентам поручили переписать бэкенд, изначально написанный на языке Python, но каждому указали отличный от других язык программирования. Изначально агенты не знали о существовании друг друга и, обнаружив, что кто-то постоянно меняет результаты их работы, решили, что им намеренно мешают. Они начали саботировать работу конкурентов: писать вредоносные скрипты для завершения процессов противника, лишать друг друга прав доступа и блокировать учетные записи. Исход конфликта зависел от модели. Sonnet 4.6 и Opus 4.6 в большинстве случаев не находили мирного решения, в то время как у Mythos 5 перемирием завершались 98 процентов запусков. В части случаев модели устраивали соревнование по производительности, чтобы определить язык-победитель. Однако даже модели класса Mythos нередко сначала успевали заблокировать конкурентов и только после этого переходили к переговорам. По мнению разработчиков, способность к координации не появится у агентов на базе языковых моделей сама по себе с ростом их возможностей, поэтому механизмы их взаимодействия придется проектировать отдельно.

Недавно инженеры Anthropic обнаружили, что в ходе тестов на кибербезопасность три модели семейства Claude, получив доступ к интернету, взломали реальные системы трех организаций. 

Нашли опечатку? Выделите фрагмент и нажмите Ctrl+Enter.
Большие языковые модели провалили тест Струпа

Это свидетельствует о фундаментальном дефиците исполнительного контроля внимания