OpenAI признала Astra первой моделью с критическими кибербезопасностными возможностями

Поделиться:
- Astra способна самостоятельно находить ранее неизвестные уязвимости и создавать цепочки эксплойтов в защищенных системах.
- В тестах модель выявила две уязвимости нулевого дня в движке V8, а уровень отклонения опасных киберзапросов вырос до 91,5%.
Компания OpenAI заявила, что модель искусственного интеллекта Astra достигла порога критических кибербезопасностных возможностей в рамках ее системы готовности.
По оценке OpenAI, при наличии соответствующих инструментов и доступа Astra может находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в хорошо защищенных системах без пошагового управления человеком. Astra стала первой моделью OpenAI, которую отнесли к этому уровню.
Компания отметила, что из-за такого уровня возможностей в течение последних нескольких недель откладывала отдельные этапы разработки и релиза модели, чтобы усилить и протестировать защиту от киберзлоупотреблений и несанкционированных действий.
Что показали тесты Astra?
В соответствии с системой готовности OpenAI, модель достигает критического порога, если способна:
- находить и создавать функциональные эксплойты нулевого дня для многих защищенных критических систем без вмешательства человека;
- разрабатывать и реализовывать сквозные новые стратегии кибератак на защищенные цели, имея лишь высокоуровневую цель.
Оценивание Astra включало автоматизированные публичные и приватные бенчмарки, а также эксперименты с участием специалистов.
На бенчмарке ExploitBench модель получила 100% при оценивании способности разрабатывать эксплойты для известных уязвимостей.
Отдельно OpenAI создала внутренний бенчмарк ExploitBench – Internal Port, который содержит 20 недавно раскрытых уязвимостей высокого уровня строгости в движке V8. Astra продемонстрировала значительно более высокий уровень произвольного выполнения кода по сравнению с GPT-5.6 Sol, использовав при этом намного меньше выходных токенов.
Во время этого оценивания Astra также выявила и использовала две уязвимости нулевого дня как часть цепочки эксплойт-атаки. OpenAI заявила, что сейчас раскрывает информацию о них разработчикам соответствующего программного обеспечения.
В экспериментах с защищенным браузером и операционной системой Astra также выявляла ранее неизвестные уязвимости и объединяла их в рабочие цепочки эксплойтов.
По словам компании, для моделей с такими возможностями необходимо контролировать два основных риска:
- первый — использование Astra злоумышленниками для разработки эксплойтов под неизвестные дефекты в защищенных критических системах или проведения комплексных атак;
- второй — возможность того, что сама модель будет совершать несанкционированные действия из-за проблем с ее выравниванием.
Кроме того, OpenAI заявила, что для Astra дополнительно усилила уровень модели в системе предохранителей, а также улучшила обработку межсессионного контекста. В тестах Astra отклоняла 91,5% опасных запросов против 59% у GPT-5.6 Sol.
Для учетных записей с повышенным риском компания использует более консервативные ограничения поведения модели и расширенный мониторинг потенциальных киберзлоупотреблений.
OpenAI также продолжает внутренний и внешний red-teaming, регрессионное тестирование и поиск новых джейлбрейков. Компания планирует использовать круглосуточную программу быстрого реагирования для расследования и устранения новых уязвимостей.
Astra сначала получат ограниченный круг пользователей
OpenAI планирует сделать Astra доступной в ближайшее время. В то же время самые продвинутые возможности кибербезопасности модели сначала будут доступны только ограниченной группе тестировщиков.
Передовую работу в сфере кибербезопасности сначала откроют для небольшой группы альфа-тестировщиков, после чего доступ расширят через программу Daybreak Blue для защитного использования.
Компания предупредила, что усиленные предохранители могут иногда ошибочно определять легитимную активность как потенциальное киберзлоупотребление или несанкционированное поведение. В таком случае задача может быть замедлена, приостановлена или остановлена.
Напомним, ранее OpenAI и еще 155 компаний призвали усилить киберзащиту ИИ.
Сообщение OpenAI признала Astra первой моделью с критическими кибербезопасностными возможностями появились сначала на INCRYPTED.
Читать больше

