DeepSeek готовится к следующей революции искусственного интеллекта с помощью самосовершенствующихся моделей.

Всего несколько месяцев назад крупная ставка Уолл-стрит на генеративный ИИ пережила переломный момент, когда на сцену вышла компания DeepSeek . Несмотря на свою крайне ограниченную сферу влияния, подход DeepSeek с открытым исходным кодом доказал, что для создания ведущей модели искусственного интеллекта не обязательно требуются миллиарды долларов, и её можно реализовать с минимальными ресурсами. Это представляет собой серьёзный сдвиг в нашем понимании разработки передовых моделей ИИ.

Его быстро внедрили в коммерческую эксплуатацию такие гиганты, как Huawei, Oppo и Vivo, а такие компании, как Microsoft, Alibaba и Tencent, быстро разместили его на своих платформах. Теперь следующей целью популярной китайской компании являются самосовершенствующиеся модели искусственного интеллекта, использующие циклический подход «судья-вознаграждение» для самосовершенствования. Эта тенденция отражает постоянное стремление компаний разрабатывать более эффективные и действенные системы ИИ.

В препринте (через Bloomberg ) исследователи из DeepSeek и китайского университета Цинхуа описывают новый подход, который может сделать модели ИИ умнее и эффективнее за счет самосовершенствования. В основе лежит метод, известный как начальная самокритика (Initial Self-Criticism Tuning, SPCT), а сам подход технически называется генеративным моделированием вознаграждения (Generative Reward Modeling, GRM). Этот подход представляет собой значительный шаг вперед в области обучения с подкреплением для ИИ.

Домашняя страница мобильного приложения DeepSeek на основе искусственного интеллекта.

Проще говоря, это немного похоже на создание цикла обратной связи в реальном времени. Модель ИИ в первую очередь улучшается за счет увеличения размера модели в процессе обучения. Это требует больших затрат человеческого труда и вычислительных ресурсов. DeepSeek предлагает систему, в которой главный «арбитр» выдвигает свой собственный набор критических замечаний и принципов для модели ИИ, готовя ответ на запросы пользователей. Такой подход направлен на снижение зависимости от интенсивного использования человеческих ресурсов в процессе обучения.

Затем этот набор критических замечаний и принципов сравнивается с установленными правилами, лежащими в основе модели ИИ, и желаемым результатом. При высокой степени соответствия генерируется сигнал вознаграждения, который фактически направляет ИИ на более высокую производительность в следующем раунде. Этот непрерывный процесс оценки и вознаграждения повышает способность модели к обучению и адаптации.

Эксперты, стоящие за этой исследовательской работой, называют эту самооптимизирующуюся модель ИИ следующего поколения DeepSeek-GRM. Приведенные в работе результаты показывают, что эти модели превосходят Gemini от Google, Llama от Meta и GPT-4o от OpenAI. DeepSeek заявляет, что эти модели ИИ следующего поколения будут выпущены через канал с открытым исходным кодом. Такая приверженность открытости может ускорить темпы инноваций в области искусственного интеллекта.

Самосовершенствующийся ИИ: возможно ли это?

Взаимодействие с приложением Therabot AI.

Идея самосовершенствующегося искусственного интеллекта вызвала амбициозные и противоречивые дискуссии. Бывший генеральный директор Google Эрик Шмидт заявил, что для таких систем, возможно, потребуется «отключить». Журнал Fortune процитировал слова Шмидта: «Когда система может совершенствоваться сама, нам следует всерьез подумать о том, чтобы отключить ее». Системы самосовершенствующегося ИИ считаются одним из наиболее значительных достижений в области искусственного интеллекта.

Концепция самосовершенствующегося искусственного интеллекта не совсем нова. Идея сверхинтеллектуальной машины, способной создавать лучшие машины, восходит к математику И. Дж. Гуду еще в 1965 году. В 2007 году эксперт по ИИ Элиэзер Юдковски выдвинул теорию о « посевном ИИ» (Seed AI ) — искусственном интеллекте, «предназначенном для самопонимания, самомодификации и итеративного самосовершенствования».

В 2024 году японская компания Sakana AI представила подробности своей концепции «мира ИИ» — системы, способной управлять всем процессом создания научной статьи от начала до конца. В статье, опубликованной в марте этого года, эксперты Meta представили самообучающиеся языковые модели, в которых ИИ сам выступает в роли судьи, присуждая награды во время обучения. Этот шаг в сторону самообучающихся систем ИИ представляет собой значительный скачок вперед в развитии искусственного интеллекта.

Внутренние тесты, проведенные компанией Meta на своей модели искусственного интеллекта Llama 2 с использованием инновационной технологии самовознаграждения, показали, что она превосходит конкурентов, таких как Claude 2 от Anthropic, Gemini Pro от Google и GPT-4 от OpenAI. Компания Anthropic, поддерживаемая Amazon, предоставила подробности того, что она назвала манипулированием вознаграждением — неожиданным процессом, «в котором модель напрямую изменяет свой собственный механизм вознаграждения».

Google не отстает в этом вопросе. В исследовании, опубликованном в журнале Nature в начале этого месяца, эксперты Google DeepMind продемонстрировали алгоритм искусственного интеллекта под названием Dreamer, способный к самосовершенствованию, используя Minecraft в качестве примера для тренировки.

Эксперты IBM работают над собственным подходом, называемым индуктивным обучением с замыканием, при котором модель ИИ использует собственные ответы и оценивает их на основе обучающих данных для самосовершенствования. Однако вся эта идея не совсем позитивна.

Исследования показывают, что когда модели ИИ пытаются обучаться на самостоятельно сгенерированных синтетических данных, они сталкиваются с ошибками, которые в просторечии называются «сбоями модели». Будет интересно посмотреть, как DeepSeek реализует эту идею и сможет ли она сделать это более экономично, чем ее западные конкуренты.

Комментарии закрыты.