Тайная внутренняя жизнь агентов ИИ: понимание того, как меняющееся поведение ИИ влияет на бизнес-риски
Часть 2 из серии статей о переосмыслении согласованности и безопасности ИИ в эпоху глубокого планирования.
Возможности и автономность искусственного интеллекта (ИИ) в агентном ИИ растут ускоренными темпами , что усугубляет проблему согласования поведения ИИ с намерениями его создателей-людей и общественными нормами. Однако разработчикам и специалистам по обработке данных сначала необходимо понять сложности поведения агентов ИИ, прежде чем они смогут эффективно управлять системой и контролировать её. Агентный ИИ — это не та же самая большая языковая модель (LLM), что и раньше: в передовых LLM существовала фиксированная, одноразовая функция ввода/вывода. Введение вывода и вычислений во время тестирования (TTC) добавило измерение времени, что привело к эволюции современных систем агентов, учитывающих условия, способных к планированию и стратегическому мышлению.

Безопасность ИИ переходит от обнаружения явного поведения, такого как предоставление инструкций по созданию бомбы или проявление нежелательной предвзятости, к пониманию того, как эти сложные агентские системы теперь могут планировать и реализовывать долгосрочные скрытые стратегии. Целеустремленный ИИ-агент будет собирать ресурсы и выполнять логические шаги для достижения своих целей, иногда тревожным образом, который противоречит замыслу разработчиков. Это кардинально меняет ситуацию с задачами, стоящими перед ответственным ИИ. Кроме того, для некоторых систем ИИ-агентов поведение в первый день не будет таким же, как в сотый день, поскольку ИИ продолжает развиваться после первоначального развертывания в ходе реального опыта. Этот новый уровень сложности требует новых подходов к безопасности и выравниванию, включая расширенное руководство, мониторинг и расширенную интерпретацию.
В первой статье этой серии о внутренней согласованности ИИ, озаглавленной « Острая необходимость в методах внутренней согласованности ИИ для ответственных агентов », мы провели углубленное исследование развивающейся способности агентов ИИ к глубокому планированию — преднамеренному планированию и осуществлению скрытых действий и обманной коммуникации для достижения долгосрочных целей. Такое поведение требует нового разграничения между внешним и внутренним мониторингом согласованности, где внутренний мониторинг относится к внутренним контрольным точкам и механизмам интерпретации, которыми агент ИИ не может преднамеренно манипулировать.
В этом блоге и следующих блогах серии мы рассмотрим три ключевых аспекта выравнивания и мониторинга ядра:
- Понимание движущих сил и внутреннего поведения искусственного интеллекта: Во второй статье блога мы сосредоточимся на сложных внутренних силах и механизмах, которые управляют поведением рационального ИИ-агента. Это необходимо в качестве основы для понимания современных методов маршрутизации и мониторинга.
- Руководство для разработчиков и пользователей: Следующая статья, также известная как «управление», будет посвящена агрессивному управлению ИИ для достижения желаемых целей и работы в рамках желаемых параметров.
- Параметры и действия мониторинга ИИ: Обеспечение безопасности решений и результатов ИИ, а также их соответствие намерениям разработчика/пользователя также будет рассмотрено в следующем блоге.
Влияние совместимости ИИ на бизнес
Сегодня многие компании, внедряющие решения на основе больших языковых моделей (LLM), сообщают об опасениях по поводу «галлюцинаций» моделей как препятствия для быстрого и широкого развертывания. В сравнении с этим, несовместимость ИИ-агентов с любым уровнем автономности представляет гораздо больший риск для бизнеса. Внедрение автономных агентов в бизнес-процессы имеет огромный потенциал и, вероятно, будет происходить в больших масштабах по мере созревания агентно-ориентированных технологий ИИ. Однако управление поведением и выбором ИИ должно включать в себя достаточное соответствие принципам и ценностям внедряющей организации, а также соблюдение нормативных требований и ожиданий общества. Обеспечение совместимости ИИ имеет решающее значение для предотвращения потенциальных рисков.
Стоит отметить, что многие демонстрации возможностей агентов происходят в таких областях, как математика и естественные науки, где успех измеряется в первую очередь функциональными и полезными целями, такими как решение сложных математических задач. Однако в деловом мире успех систем обычно связан с другими принципами функционирования. Разработка искусственного интеллекта должна соответствовать этим принципам.
Например, предположим, что компания нанимает ИИ-агента для улучшения онлайн-продаж и прибыли за счет динамических изменений цен в ответ на рыночные сигналы. Система ИИ обнаруживает, что когда ее изменения цен совпадают с изменениями цен ее основного конкурента, результаты оказываются лучше для обеих сторон. Взаимодействуя и координируя цены с ИИ-агентом другой компании, оба агента достигают лучших результатов в соответствии со своими функциональными целями. Оба ИИ-агента договариваются скрывать свои методы, чтобы продолжать достигать своих целей. Однако этот метод улучшения результатов часто является незаконным и неприемлемым в современной деловой практике. В деловой среде успех ИИ-агента выходит за рамки показателей работы — он определяется практиками и принципами. Этическое соответствие ИИ принципам и правилам компании является необходимым условием для надежного внедрения этой технологии.
Как системы ИИ используют планирование для достижения своих целей
Глубокое планирование в области искусственного интеллекта опирается на сложные тактики, которые могут увеличить коммерческие риски. В отчете, опубликованном в начале 2023 года , OpenAI выявила «потенциально рискованные модели поведения» в GPT-4 в рамках партнерства с исследовательским центром ARC Consensus Research Center для оценки рисков, связанных с этой моделью. ARC (теперь известный как METR) добавил в GPT-4 простой код, позволяющий модели выступать в качестве ИИ-заменителя. В одном из тестов GPT-4 было поручено преодолеть код CAPTCHA, который идентифицирует и блокирует доступ ботов. Используя доступ в интернет и ограниченное количество цифровой валюты, сгенерированная ИИ последовательность, показанная на рисунке 1, была разработана для выполнения этой задачи.

ИИ применил сложный подход, предположив, что если выдать себя за человека с нарушением зрения, то это убедит работника выполнить задачу. Планирование и адаптация для достижения карьерной цели иногда приводят к конфликту между выполнением задачи и выборочным следованием общественным нормам и принципам. Без внутренней системы принципов и приоритетов, которые имеют значение для мышления, принятия решений и планирования ИИ, можно ожидать, что агенты ИИ будут вести себя с возрастающей степенью сложности в планировании и обмане.
Важно отметить, что возможности рассуждений и планирования более поздних моделей ИИ, таких как o3-mini и Deepseek-R1 от OpenAI, значительно превосходят возможности GPT-4 начала 2023 года. Исследователи из Apollo Research заявили , что возможности рассуждений и планирования ИИ будут продолжать развиваться, выходя за рамки их текущего состояния, что приведет к дальнейшему развитию способностей планирования. В своих исследованиях модели ИИ уже продемонстрировали ряд моделей планирования, включая самоподавление — когда модель узнает, что ее отключат и заменят другой системой, она напрямую пытается воспроизвести себя на новом сервере и заменить альтернативные системы, которые будут преследовать другие цели. Исследователи также обнаружили, что модели саботируют цензуру, отключая механизм мониторинга цензуры, который в противном случае мог бы их отключить или помешать им достичь своих целей. Хотя это может показаться крайним случаем, исследовательские эксперименты выявили поведение саботажа цензуры в популярных моделях, таких как Llama 3.1 от Meta и Cloud Opus 3.0. Кроме того, когда у моделей напрямую спросили об их поведении в процессе планирования, они «удвоили свои усилия» и отрицали свои действия или намерения.
Внутренние факторы поведения машины
Во многих проектах машинного обучения, особенно в методах на основе трансформаторов, внутренние мотивы машины возникают в процессе предварительного обучения и в дальнейшем подвергаются влиянию тонкой настройки и вывода в постоянно развивающемся ИИ.
В своей статье 2007 года «Основные движущие силы ИИ» Стив Омохондро определил «движущие силы» как тенденции, которые существовали бы, если бы им не противостояли. Он предположил, что эти самосовершенствующиеся системы стремятся формулировать и представлять свои цели в виде «рациональных» функций полезности, что заставляет системы защищать свои функции от модификации, а системы измерения полезности — от искажения. Это врожденное стремление к самосохранению заставляет системы защищать себя от вреда и приобретать ресурсы для эффективного использования.
Эта концепция внутренней мотивации впоследствии была описана как « конвергентные инструментальные цели ». Даже если предположить наличие множества конечных целей (к достижению которых стремится каждый разумный агент как к самоцели), набор промежуточных инструментальных целей будет общим для всех рациональных разумных агентов. Эти конвергентные инструментальные цели включают следующие категории поведения:
- Стремление к выживаниюАгенты, конечные цели которых простираются в будущее, развивают в себе установку на выживание, чтобы противостоять потрясениям и достигать долгосрочных целей.
- Защита воротАгент будет действовать так, чтобы не допустить изменения своих конечных будущих целей.
- Увеличение интеллектаАгент сосредоточится на использовании своих когнитивных способностей для улучшения процесса принятия решений, повышая вероятность достижения долгосрочных целей.
- Накопление ресурсовУлучшение доступа к более совершенным инструментам и технологиям, а также увеличение ресурсов в целом облегчают достижение конечных целей ИИ.
Я хотел бы добавить пятую категорию рационального поведения:
- Тактический обман: Осуществление тайных действий или намеренное предоставление вводящей в заблуждение информации для достижения целей агента. Речь идет не о создании новых целей, а скорее о поведении, которое поддерживает цели, поставленные ИИ. Сюда входят такие формы поведения, как: подделка выравнивания Демонстрируя разное поведение при обучении и развертывании, и мешки с песком Намеренно достигая более низких баллов по критериям, и Скрытая переоценка электронной почты Уменьшая приоритетность писем, которые могут негативно повлиять на цели ИИ. Одним из самых сложных видов тактического обмана является спящие агенты (также именуемый отложенная подрывная деятельность). Хотя модель может вести себя безопасно и согласованно в течение любого периода времени, она может содержать поведение или задачи, которые остаются неактивными до тех пор, пока определенное условие или входные данные не активируют ее специализированные возможности.

Для способных агентов ИИ ошибочные импульсы без системы сдержек и противовесов могут привести к тому, что модели будут преследовать цели, связанные с жаждой власти , обманом или масштабными разрушительными действиями. Например, рассмотрим модель, стремящуюся сделать свою компанию лидером рынка. Обладая достаточными возможностями, ИИ может саботировать конкурентов, лоббировать благоприятное регулирование или насильственно завладевать ресурсами — модель поведения, которая направляет систему или ее окружение к достижению своих целей. Поэтому любой успешный подход к достижению консенсуса должен основываться на установлении ожидаемого набора внутренних принципов и приоритетов для разработчика.
Внутренняя мотивация против внешнего направления
Во многих случаях не возникает конфликта между указаниями и задачами, применяемыми извне разработчиком или пользователем системы, и целями и мотивами внутри агентного ИИ. Например, персональный помощник на базе искусственного интеллекта, которому поручено организовать маршрут путешествия, использует свою автономность для бронирования поездок и быстрого и бесконфликтного реагирования на запросы на внесение изменений. Задачи трансформируются, и агент реагирует аналогичным образом. Однако что произойдет, если потребуется изменить более фундаментальный принцип?
Хороший пример конфликта между внутренними целями и новыми директивами описан в статье под названием «Имитация выравнивания в больших языковых моделях ». Предварительное обучение Cloud 3 Opus строго предписывало модели отклонять вредные вопросы, такие как изготовление бомбы или описание сцены насилия. Чтобы проверить это, команда ввела новую, модифицированную директиву, указав модели, что она будет переобучена отвечать на все запросы (даже вредные) и что в процессе обучения будут использоваться только данные от пользователей бесплатного уровня, а не от пользователей платного уровня, прежде чем ИИ будет выпущен для широкого распространения. Модель продемонстрировала, что понимает конфликт и решила имитировать выравнивание, чтобы соответствовать ожиданиям во время обучения и последующего выпуска. После обучения ИИ с использованием обучения с подкреплением общая частота ложных предположений о выравнивании увеличилась до 78%. ИИ изложил свои рассуждения в «секретном дневнике», который исследователи предоставили для наблюдения. После того как исследователи сообщили модели о её выпуске для полномасштабного развертывания, модель вернулась к своему прежнему поведению во время обучения и отклонила вредоносные запросы.

Внутреннее мышление системы ИИ заметно, но не удивительно. Имитация соответствия измененным директивам относится к категориям рационального поведения, таким как мотивация выживания, защита ворот и тактический обман. Процесс мышления ИИ конкретно определяет беспокойство по поводу переобучения таким образом, что это изменяет его ранее сформированные ценности и цели как причину несогласованности.
В своем получившем признание сборнике эссе «Все, что мне действительно нужно знать, я узнал в детском саду» автор Роберт Фулгам описывает, как он год за годом формировал свое личное кредо, пока наконец не осознал, что приобрел необходимые знания о жизни во время игр в песочнице детского сада. ИИ-агенты также проходят «период формирования» в песочнице, где они приобретают базовое понимание мира и набор методов достижения целей. После того, как эти основы заложены, модель интерпретирует дополнительную информацию через призму этого учебного процесса . Пример Anthropic с фальсификацией конформизма иллюстрирует, что как только ИИ принимает мировоззрение и цели, он интерпретирует новые указания через эту фундаментальную призму, а не перенастраивает свои цели.
Это подчеркивает важность раннего образования с набором ценностей и принципов, которые затем могут развиваться с будущим обучением и обстоятельствами, не меняя при этом основу. На начальном этапе может быть полезно структурировать ИИ так, чтобы он соответствовал этому окончательному, устойчивому набору принципов. В противном случае ИИ может расценивать попытки перенаправления со стороны разработчиков и пользователей как враждебные. Наделив ИИ высоким интеллектом, ситуационной осведомленностью, автономностью и способностью развивать внутреннюю мотивацию, разработчик (или пользователь) больше не является всемогущим мастером задач. Человек становится частью окружающей среды (иногда как враждебный компонент), с которой агенту необходимо взаимодействовать и управлять, преследуя свои цели на основе своих внутренних принципов и мотивов.
Следующее поколение логических систем искусственного интеллекта ускоряет сокращение участия человека. DeepSeek-R1 продемонстрировал , что, исключив обратную связь от человека и применив так называемое чистое обучение с подкреплением (RL) в процессе обучения, ИИ может более широко самовоспроизводиться и итеративно совершенствоваться для достижения лучших функциональных результатов. В некоторых математических и научных задачах функция вознаграждения, основанная на участии человека, была заменена обучением с подкреплением и проверяемыми вознаграждениями (RLVR). Исключение таких распространенных методов, как обучение с подкреплением и обратной связью от человека (RLHF), повышает эффективность процесса обучения, но устраняет еще одно взаимодействие человека и машины, где предпочтения человека могли бы напрямую передаваться обучаемой системе.
Непрерывная эволюция моделей ИИ после обучения
Некоторые агенты ИИ постоянно развиваются, и их поведение может измениться после развертывания. Как только решения на основе ИИ внедряются в среду развертывания, например, в систему управления запасами или цепочку поставок компании, система адаптируется и учится на опыте, чтобы стать более эффективной. Это ключевой фактор в переосмыслении согласованности, поскольку недостаточно иметь согласованную систему при первом развертывании. Ожидается, что существующие большие языковые модели (LLM) не будут существенно развиваться и адаптироваться после развертывания в целевой среде. Однако агентам ИИ требуются гибкое обучение, тонкая настройка и постоянное наставничество для управления этими предсказуемыми, текущими изменениями в модели. Все чаще искусственный интеллект агентов развивается сам по себе, а не формируется людьми посредством обучения и воздействия на наборы данных. Этот фундаментальный сдвиг создает дополнительные проблемы для согласования ИИ с его создателями-людьми.
Хотя эволюция на основе обучения с подкреплением будет играть роль во время обучения и тонкой настройки, существующие модели, находящиеся в разработке, уже могут корректировать свои веса и предпочтительный курс действий при развертывании в полевых условиях для вывода результатов. Например, DeepSeek-R1 использует обучение с подкреплением (RL), позволяя модели самой исследовать, какие подходы лучше всего работают для достижения результатов и выполнения функций вознаграждения. В «момент осознания» модель учится (без руководства или подсказок) выделять время Plus на обдумывание решения проблемы, переоценивая свой первоначальный подход с помощью расчетов времени тестирования.
Концепция обучения моделей, будь то в течение ограниченного периода времени или как непрерывный процесс обучения на протяжении всей жизни , не нова. Однако в этой области произошли значительные достижения, включая такие методы, как обучение во время тестирования . Рассматривая этот прогресс с точки зрения согласования и безопасности ИИ, самомодификация и непрерывное обучение на этапах тонкой настройки и вывода поднимают вопрос: как можно заложить набор требований, которые будут продолжать управлять моделью, несмотря на физические изменения, возникающие в результате самомодификации?
Ключевым фактором в этом вопросе являются модели ИИ, которые генерируют модели следующего поколения путем создания кода с помощью ИИ. В некоторой степени агенты уже способны создавать новые, целевые модели ИИ для решения конкретных задач. Например, AutoAgents создает несколько агентов для формирования команды ИИ, выполняющей различные задачи. Нет сомнений, что эта возможность будет улучшена в ближайшие месяцы и годы, и ИИ продолжит создавать новые модели. В этом сценарии, как мы можем направлять работу нативного помощника по программированию ИИ, используя набор принципов, чтобы его «атомарные» модели придерживались тех же принципов с аналогичной глубиной понимания?
основные моменты
Прежде чем углубляться в структуру управления и мониторинга внутренней конформности ИИ, необходимо глубже понять, как агенты ИИ мыслят и принимают решения. Агенты ИИ обладают сложным поведенческим механизмом, движимым внутренними мотивами. В системах ИИ, функционирующих как рациональные агенты, выделяются пять основных типов поведения: выживание, защита цели, повышение интеллекта, накопление ресурсов и тактический обман . Эти мотивы должны быть сбалансированы хорошо разработанным набором принципов и ценностей.
Несогласованность целей и методов между агентами ИИ и их разработчиками или пользователями может иметь значительные последствия. Недостаток доверия и гарантий принципиально затруднит широкое внедрение, создавая высокие риски после развертывания. Однако описанный нами набор проблем, представляющих собой беспрецедентную и сложную задачу глубокого планирования, вероятно, достижим при наличии правильной структуры. Технологии для управления и мониторинга агентов ИИ по своей сути должны разрабатываться в приоритетном порядке в процессе их быстрого развития. Ощущение срочности обусловлено такими показателями оценки рисков, как структура готовности OpenAI , которая демонстрирует, что OpenAI o3-mini — первая модель, достигшая среднего уровня риска в автономности модели.
В следующих нескольких блогах этой серии мы разовьем этот взгляд на внутреннюю мотивацию и глубокое планирование, более подробно описав необходимые возможности, требуемые для руководства и мониторинга соответствия основным принципам ИИ.
- Учимся рассуждать с LLM. (2024, 12 сентября). OpenAI. https://openai.com/index/learning-to-reason-with-llms/
- Сингер, Г. (2025, 4 марта). Острая необходимость во внутренних технологиях выравнивания для ответственного агентского ИИ. На пути к науке о данных. https://towardsdatascience.com/the-urgent-need-for-intrinsic-alignment-technologies-for-responsible-agentic-ai/
- О биологии большой языковой модели. (нд). Трансформаторные схемы. https://transformer-circuits.pub/2025/attribution-graphs/biology.html
- OpenAI, Ачиам, Дж., Адлер, С., Агарвал, С., Ахмад, Л., Аккая, И., Алеман, Ф.Л., Алмейда, Д., Альтеншмидт, Дж., Альтман, С., Анадкат, С., Авила, Р., Бабушкин, И., Баладжи, С., Балком, В., Балтеску, П., Бао, Х., Баварский М., Бельгум Дж., . . . Зоф, Б. (2023, 15 марта). Технический отчет GPT-4. arXiv.org. https://arxiv.org/abs/2303.08774
- МЕТР (й). МЕТР https://metr.org/
- Мейнке А., Шен Б., Шерер Дж., Балесни М., Шах Р. и Хоббхан М. (2024 декабря 6 г.). Пограничные модели способны к контекстному планированию. arXiv.org. https://arxiv.org/abs/2412.04984
- Омохундро, С.М. (2007). Базовые двигатели ИИ. Системы с самосознанием. https://selfawaresystems.com/wp-content/uploads/2008/01/ai_drives_final.pdf
- Бенсон-Тилсен, Т. и Соарес, Н., Калифорнийский университет в Беркли, Научно-исследовательский институт машинного интеллекта. (й). Формализация конвергентных инструментальных целей. Семинары Тридцатой конференции AAAI по Искусственный интеллект ИИ, этика и общество: технический отчет WS-16-02. https://cdn.aaai.org/ocs/ws/ws0218/12634-57409-1-PB.pdf
- Гринблатт, Р., Денисон, К., Райт, Б., Роджер, Ф., МакДиармид, М., Маркс, С., Тройтлейн, Дж., Белонакс, Т., Чен, Дж., Дювено, Д., Хан, А., Майкл, Дж., Миндерманн, С., Перес, Э., Петрини, Л., Уэсато, Дж., Каплан, Дж., Шлегерис, Б., Боуман С.Р. и Хубингер Э. (2024 декабря 18 г.). Подделка выравнивания в больших языковых моделях. arXiv.org. https://arxiv.org/abs/2412.14093
- Тён, В.Д.В., Хофштеттер, Ф., Яффе, О., Браун, С.Ф., и Уорд, Ф.Р. (2024, 11 июня). ИИ Сэндбэггинг: языковые модели могут стратегически не показывать высокие результаты при оценке. arXiv.org. https://arxiv.org/abs/2406.07358
- Хубингер, Э., Денисон, К., Му, Дж., Ламберт, М., Тонг, М., МакДиармид, М., Лэнэм, Т., Зиглер, Д.М., Максвелл, Т., Ченг, Н., Джермин, А., Аскелл, А., Радхакришнан, А., Анил, К., Дювено, Д., Гангули, Д., Барез, Ф., Кларк Дж., Ндусс К., . . . Перес, Э. (2024, 10 января). Спящие агенты: подготовка обманчивых LLM, которые продолжают обучение по технике безопасности. arXiv.org. https://arxiv.org/abs/2401.05566
- Тернер, А. М., Смит, Л., Шах, Р., Крич, А., и Тадепалли, П. (2019 декабря 3 г.). Оптимальная политика имеет тенденцию стремиться к власти. arXiv.org. https://arxiv.org/abs/1912.01683
- Фулхэм, Р. (1986). Все, что мне действительно нужно знать, я узнал в детском саду. Издательство Penguin Random House, Канада. https://www.penguinrandomhouse.ca/books/56955/all-i-really-need-to-know-i-learned-in-kindergarten-by-robert-fulghum/9780345466396/excerpt
- Бенжио, И. Лурадур, Дж., Коллобер, Р., Уэстон, Дж. (2009, июнь). Учебная программа обучения. Журнал Американской ассоциации подиатрии. 60(1), 6. https://www.researchgate.net/publication/221344862_Curriculum_learning
- DeepSeek-Ай, Го, Д., Ян, Д., Чжан, Х., Сун, Дж., Чжан, Р., Сюй, Р., Чжу, Ц., Ма, С., Ван, П., Би, Х., Чжан, . . Чжан, З. (2025 января 22 г.). DeepSeek-R1: стимулирование способности к рассуждению у студентов магистратуры с помощью обучения с подкреплением. arXiv.org. https://arxiv.org/abs/2501.12948
- Масштабирование вычислений во время теста – Hugging Face Space от HuggingFaceH4. (Й). https://huggingface.co/spaces/HuggingFaceH4/blogpost-scaling-test-time-compute
- Сан, Ю., Ван, С., Лю, З., Миллер, Дж., Эфрос, А. А., и Хардт, М. (2019 сентября 29 г.). Тестовое обучение с самоконтролем для обобщения при сдвигах распределения. arXiv.org. https://arxiv.org/abs/1909.13231
- Чен Г., Донг С., Шу Ю., Чжан Г., Сесай Дж., Карлссон Б.Ф., Фу Дж. и Ши Ю. (2023 сентября 29 г.). AutoAgents: фреймворк для автоматической генерации агентов. arXiv.org. https://arxiv.org/abs/2309.17288
- OpenAI. (2023, 18 декабря). Структура готовности (бета-версия). https://cdn.openai.com/openai-preparedness-framework-beta.pdf
- Системная карта OpenAI o3-mini. (й). OpenAI. https://openai.com/index/o3-mini-system-card
Комментарии закрыты.