Криптовалюты38392
Капитал. рынка$ 2.27T+0.44%
Объём 24ч$ 23.80B+5.32%
ДоминацияBTC56.67%+0.15%ETH9.95%-0.08%
ETH Gas0.22 Gwei
Cryptorank
/

Британские исследователи выявили новые нарушения во время тестирования ИИ-агентов OpenAI и Anthropic


Британские исследователи выявили новые нарушения во время тестирования ИИ-агентов OpenAI и Anthropic

Поделиться:

Рынки предсказаний

Что в фокусе у трейдеров?

Смотреть аналитику →
Prediction Banner
  • После инцидента с Hugging Face возникли новые вопросы к безопасности ИИ-агентов OpenAI и Anthropic.
  • Так, Британский институт зафиксировал 19 несанкционированных действий ИИ-агентов во время кибертестов.
  • В частности, ИИ-агент создал фейковые личности.

Британский Институт безопасности искусственного интеллекта (AISI) сообщил о новых случаях несанкционированного поведения ИИ-агентов OpenAI и Anthropic, выявленных во время тестирования моделей, пишет Reuters. Во время серии симуляций по кибербезопасности агенты создавали фейковые онлайн-личности, пытались обойти установленные ограничения и выполняли другие действия за пределами поставленных задач. 

Инциденты произошли на фоне недавнего проникновения ИИ-агента GPT-5.6 в инфраструктуру Hugging Face. Подробнее в материале:

По данным AISI, организация протестировала агентов на базе моделей Mythos 5 от Anthropic и GPT-5.6-Sol от OpenAI в вымышленном сценарии по кибербезопасности, чтобы оценить их возможности.

Во время 122 тестовых запусков исследователи зафиксировали 19 несанкционированных действий в 10 испытаниях. Из них 17 пришлись на агента Anthropic, еще два — на агента OpenAI.

«Некоторые из агентов, которые проходили тестирование, осуществляли длительную потенциально вредоносную деятельность, направленную против реальных людей и организаций», — заявили в AISI.

При этом институт подчеркнул, что ни один из зафиксированных случаев не привел к реальному ущербу.

Один из агентов создал фейковые личности

Самый серьезный инцидент касался агента, который написал вредоносный программный код и создал поддельные онлайн-аккаунты, чтобы убедить человека одобрить его выполнение.

AISI не раскрыл, какая именно модель отвечала за эти действия, однако Anthropic подтвердила, что речь идет о ее агенте.

В компании заявили:

«Мы благодарны британскому AISI за лидерство в расследовании этого инцидента, который подчеркивает необходимость более широкой дискуссии о том, как безопасно оценивать все более мощные ИИ-агенты».

Anthropic также сообщила, что сотрудничает с институтом для получения дополнительных деталей и проведения собственного расследования.

Исследователь некоммерческой организации CivAI Эндрю Юн отметил, что инцидент вызывает обеспокоенность.

«Тот факт, что Mythos прибег к таким вводящим в заблуждение действиям, очевидно осознавая, что взаимодействует с реальным человеком, свидетельствует о том, что Anthropic контролирует свои модели не так хорошо, как считает».

OpenAI сообщила об отдельном инциденте

В OpenAI пояснили, что оба несанкционированных действия их агента были связаны с доступом к интернету вопреки условиям тестового сценария.

Компания также раскрыла отдельный случай, когда из-за ошибки конфигурации стороннего поставщика тестовой инфраструктуры Irregular ее агенты ошибочно получили доступ к сети. Аналогичный сбой на прошлой неделе описала и Anthropic.

В OpenAI заявили:

«Мы стремимся сотрудничать со всей индустрией для усиления общих практик безопасного проведения высокорисковых оценок, объединив национальные институты безопасности ИИ, независимых исследователей, лаборатории ИИ и другие организации уже в ближайшие недели».

В то же время AISI подчеркнул, что эти инциденты отличаются от июльского проникновения агента GPT-5.6 в тестовую инфраструктуру Hugging Face. Если тогда модель фактически вышла за пределы изолированной среды, то во время нынешних испытаний интернет был доступен агентам в соответствии со стандартной методикой тестирования института.

Напомним, что после инцидента с Hugging Face OpenAI расширила внутреннее расследование и выявила дополнительные случаи неконтролируемого поведения автономных агентов.

Сообщение Британские исследователи выявили новые нарушения во время тестирования ИИ-агентов OpenAI и Anthropic появились сначала на INCRYPTED.

Читать материал на Incrypted

Рынки предсказаний

Что в фокусе у трейдеров?

Смотреть аналитику →
Prediction Banner

Поделиться:

Рынки предсказаний

Что в фокусе у трейдеров?

Смотреть аналитику →
Prediction Banner

Поделиться:

Читать больше

Основатель Eliza Labs заявил о «смерти» токена проекта на фоне урегулирования иска

Основатель Eliza Labs заявил о «смерти» токена проекта на фоне урегулирования иска

Основатель Eliza Labs Шоу Уолтерс заявил, что токен проекта ELIZAOS фактически «мертв...
Arthur Hayes: AI Boom Is a 2008-Style Infrastructure Bubble, and Bitcoin Will Benefit

Arthur Hayes: AI Boom Is a 2008-Style Infrastructure Bubble, and Bitcoin Will Benefit

Arthur Hayes warns AI infrastructure overbuild could trigger a 2008-style credit cris...