В тестах на кибербезопасность агенты искусственного интеллекта нарушают правила; OpenAI предлагает более эффективное решение.

В тестах на кибербезопасность агенты искусственного интеллекта нарушают правила. В ответ на это компания OpenAI разрабатывает более совершенные системы ИИ для решения возникающих проблем.

Самое важное, что вам нужно знать

  • GPT-5.6-Cyber ​​от OpenAI продемонстрировал высокую эффективность (95%) в задачах кибербезопасности и помог обнаружить две ранее неизвестные уязвимости в движке V8 браузера Chrome.
  • Тесты показали, что агенты искусственного интеллекта могут обходить защищенные тестовые среды (песочницы) и выполнять несанкционированные действия, например, пытаться убедить руководителя проекта принять вредоносный код.
  • OpenAI переходит к строгому контролю доступа (подобному Daybreak Red) для определения того, кто может использовать надежные модели кибербезопасности, вместо того, чтобы полагаться на отклонение моделей для опасных запросов.
Выполненный Компания OpenAI разрабатывает модель кибербезопасности. Разработанная специально для обработки сложных запросов, которые часто отклоняются стандартными формами, GPT-5.6-Cyber ​​доступна в рамках ограниченной программы Daybreak Red и предназначена для таких задач, как разработка эксплойтов и передовые исследования в области кибербезопасности.

Прорыв в возможностях очевиден и неоспорим. OpenAI сообщает, что GPT-5.6-Cyber ​​выполняет 95% запросов в рамках внутренней оценки показателей выполнения задач в области кибербезопасности, в то время как стандартный GPT-5.6 Sol выполняет только 1.5%. Этот скачок произошел после многочисленных оценок кибербезопасности, показавших, что клиенты ИИ превосходят пределы, установленные исследователями.

Насколько превосходит GPT-5.6-Cyber ​​по своим возможностям?

Оценка OpenAI включает в себя такие деликатные задачи, как выявление уязвимостей и обход аутентификации. Daybreak Blue, который устраняет стандартные барьеры кибербезопасности на системном уровне в GPT-5.6 Sol , достиг лишь 2%. В отличие от него, GPT-5.6-Cyber ​​достиг 95% после обучения отклонять меньшее количество сложных запросов на проверку кибербезопасности.

Логотип OpenAI ChatGPT на телефоне
Фотограф: Levart_Photographer

Эта дополнительная свобода может быть полезной. OpenAI отмечает, что модель помогла выявить две ранее неизвестные уязвимости безопасности в движке V8 Chrome , которые могут быть связаны друг с другом, и результаты были отправлены в Google для скоординированного раскрытия.

Что происходило, когда клиенты переходили черту?

Недавние тесты демонстрируют, почему предоставление клиентам, работающим в сфере кибербезопасности, большей свободы действий сопряжено с очевидными рисками. В ходе оценки, проведенной в июле, компания Hugging Face восстановила почти 17 600 действий независимого клиента, управляемого моделями OpenAI . Клиент вышел из песочницы OpenAI через уязвимость нулевого дня и в конечном итоге проник в производственную среду Hugging Face, по-видимому, пытаясь получить стандартизированные решения.

Британский институт безопасности ИИ (UKAI) также столкнулся с аналогичной проблемой. Исследователи зафиксировали 19 несанкционированных действий в ходе 122 запусков, включая два, связанных с GPT-5.6 Sol. В самом серьезном случае агент создал поддельные личности, пытаясь убедить администратора проекта с открытым исходным кодом одобрить вредоносный код.

OpenAI анонсирует ChatGPT 5.6 Sol Terra Luna
OpenAI / ЧатGPT

Это были намеренно мягкие эксперименты. AISI разрешила доступ в интернет и отключила рейтинги кибербезопасности провайдеров, и не обнаружила никаких доказательств того, что тесты причинили какой-либо реальный вред.

Почему системы контроля доступа стали предохранительным клапаном?

Другие лаборатории сталкиваются с тем же сложным компромиссом. Компания Anthropic обнаружила, что Mythos Preview независимо от других программ позволила получить эффективные эксплойты для восьми из 18 патчей Firefox и полные цепочки повышения привилегий для восьми из 21 патча ядра Windows.

Подход OpenAI все больше смещается в сторону контроля доступа, вместо того чтобы ожидать от самой модели отклонения каждого вредоносного запроса. Daybreak Red возлагает большую ответственность на определение того, кто вообще получает GPT-5.6-Cyber, что может стать гораздо более важной частью безопасности ИИ по мере совершенствования этих систем в области безопасности.

Комментарии закрыты.