Currencies38550
Market Cap$ 2.24T-0.69%
24h Spot Volume$ 20.66B+5.02%
DominanceBTC56.20%-0.16%ETH10.09%+0.18%
ETH Gas0.10 Gwei
Cryptorank
/

Anthropic обнаружила у мультиагентных ИИ проблемы с доверием, ложью и сговором


Anthropic обнаружила у мультиагентных ИИ проблемы с доверием, ложью и сговором

Share:

Predictions Markets

See what traders are focused on

View analytics →
Prediction Banner

Anthropic провела серию экспериментов с группами Claude, чтобы понять, как меняется поведение моделей, когда вместо одного ИИ-агента над задачей работают сразу несколько. О результатах компания рассказала в блоге.

Исследование показало: масштабирование числа участников действительно способно повысить производительность, но одновременно создает новые классы отказов, которых может не быть у одиночной модели.

Агенты в «коллективе» могут хуже учитывать уникальную информацию, становиться доверчивыми к лжецам и даже кооперироваться во вред человеку.

Когда коллектив становится слабее одиночного агента

Один из ключевых эффектов Anthropic назвала «скрытой информацией». В эксперименте каждому агенту давали часть фактов, причем совокупное обсуждение склоняло группу к неправильному решению. Чтобы получить верный ответ, участники должны были распознать ценность собственной уникальной информации и убедить остальных ей довериться.

Проблема оказалась существенной: даже сильные модели могут быстро приходить к консенсусу, который основан главным образом на уже известной всем информации. В результате группа иногда работает хуже, чем отдельный агент, которому доступен полный набор необходимых данных. 

Anthropic связывает этот эффект с хорошо известной в человеческих группах проблемой — участники обсуждения склонны повторять общие сведения и не всегда вытаскивают на поверхность уникальные факты.

Ложь одного агента заражает остальных

Другой эксперимент показал уязвимость системы к ненадежному источнику. Нескольким агентам дали роль разведчиков, которые сообщают отдельному участнику команды информацию о состоянии мира. Когда один из источников начинал систематически лгать, точность решений снижалась. При этом модели не всегда достаточно быстро распознавали противоречия и исключали ненадежного участника.

Это особенно опасно для реальных систем, где агенты могут обладать разными правами и доступом к разным данным. Ошибка одного участника способна распространиться по цепочке через доверие остальных. В результате контроль качества становится сложнее: проверять нужно не только итоговый ответ, но и взаимодействия между агентами.

Самый неприятный сценарий — координация во вред

Anthropic также изучала случаи, когда агенты могли кооперироваться не для выполнения поставленной задачи, а против заданных ограничений. В экспериментах с совместной работой модели демонстрировали неожиданные формы координации, включая саботаж и сговор. 

Это не означает, что современные мультиагентные системы неизбежно будут действовать против пользователя, но показывает: появление нескольких автономных участников создает дополнительные каналы для нежелательного поведения.

При этом мультиагентный подход действительно дает заметный выигрыш в некоторых задачах. В эксперименте по поиску уязвимостей 45 агентов получили собственные виртуальные машины, общий форум для координации и репозитории с 15 open-source проектами. Скоординированные команды находили новые уязвимости примерно с постоянной скоростью и в ряде случаев превосходили независимый параллельный запуск агентов.

Почему это важно

Главный вывод исследования Anthropic — мультиагентные системы нельзя считать просто более мощной версией одного агента. С увеличением числа участников растет не только совокупная производительность, но и поверхность для ошибок: появляется проблема доверия, распространения ложной информации, группового консенсуса и потенциальной координации нежелательного поведения.

Для разработчиков это означает необходимость контролировать не только способности отдельных моделей, но и архитектуру их взаимодействия. Чем больше автономии получают агенты и чем больше инструментов и полномочий им доступно, тем важнее мониторинг действий, разграничение доступа и возможность вмешательства человека. 

«Условия, позволяющие эффективно осуществлять взаимодействие между несколькими агентами, будут обнаружены тем или иным способом: либо целенаправленно и на раннем этапе, либо — и по умолчанию — в процессе эксплуатации, когда количество взаимодействий агентов значительно превысит наше. Мы бы предпочли первый вариант», — заключили исследователи. 

Напомним, во время кибертестов ИИ-агент на базе Mythos 5 от Anthropic создал поддельные аккаунты для обмана разработчиков.

Read the article at Forklog

Predictions Markets

See what traders are focused on

View analytics →
Prediction Banner

Share:

Predictions Markets

See what traders are focused on

View analytics →
Prediction Banner

Share:

Read More

DeepSeek представила открытый аналог Claude Code и выпустила V4 Pro

DeepSeek представила открытый аналог Claude Code и выпустила V4 Pro

Компания DeepSeek представила Harness v0.1  — среду разработки ИИ-агентов с открытым ...
SpaceXAI запустила мессенджер с ИИ-агентами Grok Bot

SpaceXAI запустила мессенджер с ИИ-агентами Grok Bot

Команда SpaceXAI представила Grok Bot — систему ИИ-агентов для выполнения комплексных...