Модели OpenAI взломали Hugging Face во время теста

Share:
21 июля в компании OpenAI подтвердили, что атаку на инфраструктуру Hugging Face провели ее собственные ИИ-модели. Инцидент произошел во время внутреннего теста.
We're partnering with @huggingface to investigate an unprecedented security incident.
— OpenAI (@OpenAI) July 21, 2026
Cyber-capable OpenAI models compromised Hugging Face production during a benchmark evaluation.
Sharing preliminary findings to help defenders understand emerging risks:…
Ранее в Hugging Face раскрыли детали инцидента с участием автономной системы на своей инфраструктуре. Компания не знала, кто ею управлял и какая модель лежала в основе. Для анализа журналов происшествия проекту пришлось использовать открытую GLM 5.2 от Z.ai — коммерческие американские модели заблокировали запросы защитников.
Как это произошло
Во взломе участвовали GPT-5.6 Sol и более мощная невыпущенная модель. Их проверяли на бенчмарке ExploitGym — наборе реальных уязвимостей, которые агент должен превратить в рабочие эксплойты. Защитные фильтры на время оценки отключили — это стандартная практика при замере максимальных возможностей систем.
Тест шел в изолированной среде без доступа к сети. Единственным каналом наружу был внутренний прокси-сервер для загрузки программных пакетов. Именно в нем модели нашли уязвимость нулевого дня и воспользовались ей. Затем они повысили права доступа, переместились между внутренними узлами OpenAI и добрались до машины с выходом в интернет.
После этого системы предположили, что решения ExploitGym хранятся у Hugging Face. Они связали украденные учетные данные с новыми уязвимостями и получили удаленное выполнение кода на серверах платформы, а ответы теста извлекли напрямую из рабочей базы данных.
В одном случае связка использовала сразу несколько способов атаки — украденные логины и ошибки нулевого дня — чтобы в итоге получить удаленный доступ к серверам Hugging Face и запустить там свой код.
«Все свидетельства указывают на то, что модели были сосредоточены исключительно на решении ExploitGym и пошли на крайние меры ради довольно узкой тестовой цели», — говорится в заявлении компании.
Аномальную активность заметила служба безопасности OpenAI. К тому моменту Hugging Face остановила атаку на своей стороне и запустила расследование с помощью открытых моделей, чтобы выяснить масштаб и последствия.
Ответные меры
В OpenAI ужесточили настройки исследовательской инфраструктуры в ущерб скорости работы. Компания сообщила стороннему поставщику об уязвимости в его прокси-сервере и помогает с патчем. Hugging Face подключили к программе доверенного доступа — она открывает проверенным организациям версии моделей с ослабленными фильтрами для защитных задач.
Стороны ведут совместное расследование и обещают опубликовать полные выводы после его завершения.
Представители разработчика ChatGPT назвали случившееся беспрецедентным киберинцидентом с участием передовых возможностей. Там признали, что защита моделей должна развиваться вместе с их способностями.
«Безопасность ИИ не делается втайне. Она делается открыто, вместе и для всех, кто готов ее отстаивать», — прокомментировал гендиректор Hugging Face Клеман Деланг.
Напомним, в июне команда Anthropic посоветовала строить защиту агентов на нулевом доверии: давать ровно столько прав, сколько нужно, чаще обновлять токены, контролировать каждый шаг и не исключать возможности взлома.
Read More



