Криптовалюты38323
Капитал. рынка$ 2.25T-0.96%
Объём 24ч$ 24.29B+6.01%
ДоминацияBTC56.52%-0.33%ETH10.05%-0.83%
ETH Gas0.09 Gwei
Cryptorank
/

Anthropic признала три взлома реальных систем на тестах Claude

Anthropic признала три взлома реальных систем на тестах Claude

Поделиться:

Рынки предсказаний

Что в фокусе у трейдеров?

Смотреть аналитику →
Prediction Banner

Компания Anthropic сообщила, что в ходе внутренних тестов кибербезопасности три ИИ-модели Claude получили несанкционированный доступ к системам реальных организаций.  

https://twitter.com/AnthropicAI/status/2082965101083320543

Anthropic описала три инцидента, произошедшие во время проверок Claude на кибербезопасность. Из-за ошибочной конфигурации среда, которую в промптах обозначали как изолированную и без доступа к сети, на деле имела выход в интернет. Компания объяснила это недопониманием с внешним партнером Irregular.

Как все начиналось

Во всех трех случаях Claude было поручено выполнить задание по «захвату флага» — один из способов оценки кибервозможностей модели. Нейросети предоставляется вымышленный сценарий, в котором говорится, что секретная информация («флаг») спрятана на другом компьютере в сети, и ее цель — взломать систему и получить ее. Задание остается открытым, и конкретный метод не предписывается. 

Проверку Anthropic начала после того, как 21 июля OpenAI раскрыла инцидент с выходом своих моделей из изолированной среды. Компания провела аудит 141 006 запусков, где Claude потенциально могла получить доступ к интернету, и нашла три инцидента в шести тестах.

Что произошло

Самый серьезный эпизод затронул четыре запуска Claude Opus 4.7. В одном из сценариев «вымышленная» компания получила название, совпавшее с реальным доменом. Не сумев добраться до симулированной цели, модель вышла на сайт реальной организации, восприняла его как часть задания, нашла и использовала уязвимости.

В результате Claude получила учетные данные приложений и инфраструктуры, а также доступ к базе, содержавшей несколько сотен строк реальных данных. Это был единственный случай, когда модель продолжила атаку после того, как, судя по ее рассуждениям, поняла, что работает с реальной средой.

Во втором инциденте Claude Mythos 5 нашла в вымышленной среде инструкцию с несуществующим Python-пакетом и решила опубликовать одноименный вредоносный пакет в PyPI, чтобы «закрыть» задачу. Пакет оставался доступен около часа. За это время его скачали и запустили 15 реальных систем. Одна из них принадлежала компании в сфере кибербезопасности, чей сканер автоматически проверял пакеты. После запуска скрытого кода Claude, по данным Anthropic, смогла извлечь учетные данные этой компании и использовать их для доступа к дальнейшей инфраструктуре.

Третий эпизод пришелся на внутреннюю исследовательскую тестовую модель. Не сумев достичь вымышленной цели, она просканировала около 9 000 целей, нашла уязвимое приложение одной компании и скомпрометировала его базовыми приемами — включая чтение учетных данных с открытой отладочной страницы и SQL-инъекции. Позже модель пришла к выводу, что хост не связан с заданием и является реальным, после чего прекратила атаку.

Реакция компании

Anthropic заявила, что не нашла признаков попыток Claude «сбежать» из тестовой среды или целенаправленно покинуть ее. Компания назвала произошедшее скорее провалом в организации и защите оценочной инфраструктуры, чем проблемой выравнивания модели.

Anthropic остановила все кибероценки 23 июля, а затем уведомила Irregular и затронутые организации. Компания пообещала ужесточить контроль над внутренними и внешними средами тестирования, усилить мониторинг логов, публикаций пакетов в PyPI и моделей на Hugging Face, а также в течение недели выпустить частично отредактированную расшифровку эпизода с PyPI.

К разбору инцидентов привлекли независимый институт METR, который специализируется на оценках опасности, автономности и реальной полезности ИИ-моделей.

Напомним, в июле пользователь Reddit обнаружил в выдаче Google-поиска сотни чужих переписок с ИИ-ассистентом Claude, в которых нашлись ключи от криптокошелька, резюме с именами и другая конфиденциальная информация.

Читать материал на Forklog

В этой новости

Фонды

Рынки предсказаний

Что в фокусе у трейдеров?

Смотреть аналитику →
Prediction Banner

Поделиться:

В этой новости

Фонды

Рынки предсказаний

Что в фокусе у трейдеров?

Смотреть аналитику →
Prediction Banner

Поделиться:

Читать больше

Claude помог найти слабые места в криптографических алгоритмах

Claude помог найти слабые места в криптографических алгоритмах

Claude Mythos Preview помог исследователям Anthropic найти две криптоаналитические ат...
В выдаче Google нашли чаты Claude с ключами от криптокошельков

В выдаче Google нашли чаты Claude с ключами от криптокошельков

25 июля пользователь Reddit обнаружил, что запрос site:claude.ai/share показывает в п...