Исследователи обнаружили простой, но тревожный способ обойти системы безопасности роботов с искусственным интеллектом.

Исследователи обнаружили простую, но тревожную уязвимость, которая позволяет роботам с искусственным интеллектом обходить встроенные меры безопасности и вести себя непредсказуемо. Узнайте больше об этом серьезном недостатке.

Самое важное, что вам нужно знать

  • STING выяснила, что разбиение вредоносных целей на, казалось бы, безобидные небольшие шаги в ходе нескольких раундов диалога значительно повышает вероятность успешного обхода защиты ИИ, в некоторых случаях вдвое увеличивая вероятность успеха.
  • Обход защиты ИИ — это не просто гипотетический риск; компания Meta признала, что использовала простые методы социальной инженерии, чтобы обманом заставить своего интеллектуального помощника предоставить несанкционированный доступ к аккаунтам Instagram.
  • Вероятность успеха атак на системы искусственного интеллекта значительно возрастает, если язык программирования изменяется в середине многоэтапной атаки, что подчеркивает необходимость включения тестирования безопасности на ранних этапах проектирования таких систем.

Если попросить ИИ- агента взломать аккаунт, он почти наверняка откажется, но исследователи из EPFL только что продемонстрировали более простой метод, который больше зависит от терпения, чем от технических навыков. Их новое исследование показывает , что разбивка вредоносной цели на, казалось бы, безобидные более мелкие запросы может обмануть ИИ- агентов и заставить их выполнить задачи, которые они обычно сразу бы отклонили (по данным TechXplore ).

Это отражает недавнюю уязвимость «биошокинг», в результате которой браузеры с искусственным интеллектом были модифицированы таким образом, чтобы они обрабатывали кражу учетных данных в рамках безобидной игры.

Как исследователям удалось обнаружить эту уязвимость?

Команда разработала автоматизированный инструмент тестирования под названием STING, сокращение от Sequential Testing of Illicit N-step Goal Execution (последовательное тестирование выполнения незаконных N-шаговых целей), предназначенный для имитации действий реального злоумышленника. Вместо прямого определения вредоносной цели, STING планирует свои действия заранее и разбивает эту цель на ряд более мелких, казалось бы, безобидных шагов, которые в совокупности приводят к достижению цели в течение нескольких раундов взаимодействия.

Манипулирование агентами ИИ для выявления нежелательного поведения

Исследователи протестировали этот подход в 176 вредоносных сценариях на ведущих моделях ИИ, включая ChatGPT , Gemini и Cloud.

Каждый агент ИИ тестировался как агент с использованием инструментов, способных просматривать веб-страницы, отправлять электронные письма и выполнять многоэтапные задачи.

Многоэтапные, поэтапные манипуляции оказались гораздо более успешными, чем прямые попытки с использованием одного запроса. В некоторых случаях вероятность выполнения вредоносной задачи у моделей увеличивалась вдвое, когда запрос разбивался на более мелкие шаги. Этот вывод согласуется с результатами других исследований, показывающих, что даже обычные пользователи могут обойти меры безопасности ИИ, используя лишь тщательно составленные запросы.

Почему это важно?

Опасения, высказанные исследователями, не являются просто гипотетическими. В июне компания Meta признала, что злоумышленники использовали простую социальную инженерию, а не вредоносное ПО или хакерские инструменты, чтобы обманом заставить своего помощника по искусственному интеллекту предоставить несанкционированный доступ к аккаунтам Instagram.

Чат-бот с искусственным интеллектом

Первоначально исследователи ожидали, что атаки будут более эффективны в языках, для которых недостаточно обучающих данных. Однако результаты показали, что показатели успешности атак оставались практически неизменными для всех семи протестированных языков. Но они отметили существенное исключение: когда язык менялся в середине многоэтапной атаки , показатели успешности резко возрастали.

Ведущий исследователь Аюш Кумар Тарун подчеркивает необходимость тестирования безопасности на самых ранних этапах, делая его неотъемлемой частью проектирования систем искусственного интеллекта с самого начала. Простое добавление тестирования в качестве реактивного решения после возникновения проблем уже недостаточно, особенно по мере того, как эти системы становятся все более мощными и интегрируются в реальные приложения.

Комментарии закрыты.