DeepSeek готовится к следующей революции искусственного интеллекта с помощью самосовершенствующихся моделей.
Всего несколько месяцев назад крупная ставка Уолл-стрит на генеративный ИИ пережила переломный момент, когда на сцену вышла компания DeepSeek . Несмотря на свою крайне ограниченную сферу влияния, подход DeepSeek с открытым исходным кодом доказал, что для создания ведущей модели искусственного интеллекта не обязательно требуются миллиарды долларов, и её можно реализовать с минимальными ресурсами. Это представляет собой серьёзный сдвиг в нашем понимании разработки передовых моделей ИИ.
Его быстро внедрили в коммерческую эксплуатацию такие гиганты, как Huawei, Oppo и Vivo, а такие компании, как Microsoft, Alibaba и Tencent, быстро разместили его на своих платформах. Теперь следующей целью популярной китайской компании являются самосовершенствующиеся модели искусственного интеллекта, использующие циклический подход «судья-вознаграждение» для самосовершенствования. Эта тенденция отражает постоянное стремление компаний разрабатывать более эффективные и действенные системы ИИ.
В препринте (через Bloomberg ) исследователи из DeepSeek и китайского университета Цинхуа описывают новый подход, который может сделать модели ИИ умнее и эффективнее за счет самосовершенствования. В основе лежит метод, известный как начальная самокритика (Initial Self-Criticism Tuning, SPCT), а сам подход технически называется генеративным моделированием вознаграждения (Generative Reward Modeling, GRM). Этот подход представляет собой значительный шаг вперед в области обучения с подкреплением для ИИ.

Проще говоря, это немного похоже на создание цикла обратной связи в реальном времени. Модель ИИ в первую очередь улучшается за счет увеличения размера модели в процессе обучения. Это требует больших затрат человеческого труда и вычислительных ресурсов. DeepSeek предлагает систему, в которой главный «арбитр» выдвигает свой собственный набор критических замечаний и принципов для модели ИИ, готовя ответ на запросы пользователей. Такой подход направлен на снижение зависимости от интенсивного использования человеческих ресурсов в процессе обучения.
Затем этот набор критических замечаний и принципов сравнивается с установленными правилами, лежащими в основе модели ИИ, и желаемым результатом. При высокой степени соответствия генерируется сигнал вознаграждения, который фактически направляет ИИ на более высокую производительность в следующем раунде. Этот непрерывный процесс оценки и вознаграждения повышает способность модели к обучению и адаптации.
Эксперты, стоящие за этой исследовательской работой, называют эту самооптимизирующуюся модель ИИ следующего поколения DeepSeek-GRM. Приведенные в работе результаты показывают, что эти модели превосходят Gemini от Google, Llama от Meta и GPT-4o от OpenAI. DeepSeek заявляет, что эти модели ИИ следующего поколения будут выпущены через канал с открытым исходным кодом. Такая приверженность открытости может ускорить темпы инноваций в области искусственного интеллекта.
Самосовершенствующийся ИИ: возможно ли это?

Идея самосовершенствующегося искусственного интеллекта вызвала амбициозные и противоречивые дискуссии. Бывший генеральный директор Google Эрик Шмидт заявил, что для таких систем, возможно, потребуется «отключить». Журнал Fortune процитировал слова Шмидта: «Когда система может совершенствоваться сама, нам следует всерьез подумать о том, чтобы отключить ее». Системы самосовершенствующегося ИИ считаются одним из наиболее значительных достижений в области искусственного интеллекта.
Концепция самосовершенствующегося искусственного интеллекта не совсем нова. Идея сверхинтеллектуальной машины, способной создавать лучшие машины, восходит к математику И. Дж. Гуду еще в 1965 году. В 2007 году эксперт по ИИ Элиэзер Юдковски выдвинул теорию о « посевном ИИ» (Seed AI ) — искусственном интеллекте, «предназначенном для самопонимания, самомодификации и итеративного самосовершенствования».
В 2024 году японская компания Sakana AI представила подробности своей концепции «мира ИИ» — системы, способной управлять всем процессом создания научной статьи от начала до конца. В статье, опубликованной в марте этого года, эксперты Meta представили самообучающиеся языковые модели, в которых ИИ сам выступает в роли судьи, присуждая награды во время обучения. Этот шаг в сторону самообучающихся систем ИИ представляет собой значительный скачок вперед в развитии искусственного интеллекта.
Генеральный директор Microsoft Сатья Надела заявил, что разработка ИИ оптимизируется с помощью модели o1 от OpenAI и вступила в рекурсивную фазу: «Мы используем ИИ для создания инструментов ИИ, которые, в свою очередь, позволяют создавать более совершенный ИИ». pic.twitter.com/IHuFIpQl2C
– Царатустра (@tsarnick) 21 октября 2024 г.
Внутренние тесты, проведенные компанией Meta на своей модели искусственного интеллекта Llama 2 с использованием инновационной технологии самовознаграждения, показали, что она превосходит конкурентов, таких как Claude 2 от Anthropic, Gemini Pro от Google и GPT-4 от OpenAI. Компания Anthropic, поддерживаемая Amazon, предоставила подробности того, что она назвала манипулированием вознаграждением — неожиданным процессом, «в котором модель напрямую изменяет свой собственный механизм вознаграждения».
Google не отстает в этом вопросе. В исследовании, опубликованном в журнале Nature в начале этого месяца, эксперты Google DeepMind продемонстрировали алгоритм искусственного интеллекта под названием Dreamer, способный к самосовершенствованию, используя Minecraft в качестве примера для тренировки.
Эксперты IBM работают над собственным подходом, называемым индуктивным обучением с замыканием, при котором модель ИИ использует собственные ответы и оценивает их на основе обучающих данных для самосовершенствования. Однако вся эта идея не совсем позитивна.
Исследования показывают, что когда модели ИИ пытаются обучаться на самостоятельно сгенерированных синтетических данных, они сталкиваются с ошибками, которые в просторечии называются «сбоями модели». Будет интересно посмотреть, как DeepSeek реализует эту идею и сможет ли она сделать это более экономично, чем ее западные конкуренты.
Комментарии закрыты.