Google запускает Gemini 2.0 Pro и Flash-Lite, соединяя Flash Thinking с YouTube, Картами и Поиском

Серия больших языковых моделей Gemini от Google началась неудачно около года назад с нескольких досадных ошибок в генерации изображений, но с тех пор она постоянно совершенствовалась, и компания, похоже, намерена сделать свою вторую разработку — Gemini 2.0 — самой масштабной и лучшей на сегодняшний день для потребителей и предприятий.

Сегодня компания объявила о публичном выпуске Gemini 2.0 Flash, представила Gemini 2.0 Flash-Lite и запустила бета-версию Gemini 2.0 Pro.

Эти модели, разработанные для поддержки разработчиков и предприятий, теперь доступны в Google AI Studio и Vertex AI, при этом Flash-Lite доступен в виде общедоступной предварительной версии, а Pro — для раннего тестирования.

«Все эти модели будут оснащены мультимедийным вводом с текстовым выводом на момент выпуска, а функция Plus Media станет доступна для публичного использования в ближайшие месяцы», — написал Корай Кавукчуоглу, технический директор Google DeepMind, в сообщении в блоге компании, объявляющем об этом шаге, — демонстрируя преимущество, которым обладает Google, даже несмотря на то, что конкуренты, такие как DeepSeek и OpenAI, продолжают выпускать сильные продукты.

Google использует свои мультимедийные возможности

Ни модель DeepSeek-R1, ни новая модель o3-mini от OpenAI не могут принимать мультимедийные входные данные, то есть изображения, файлы для загрузки или вложения.

Хотя модель R1 может принимать их на своем веб-сайте и в мобильном чат-приложении, она использует оптическое распознавание символов (OCR), технологию, которой более 60 лет, для извлечения только текста из этих загрузок, и не понимает и не анализирует какие-либо другие их функции.

Однако обе они представляют собой новый класс моделей «мышления», которые намеренно уделяют больше времени обдумыванию ответов и размышлению над «цепочками мыслей» и обоснованностью своих ответов. Это контрастирует с типичными большими языковыми моделями, такими как серия Gemini 2.0 pro, поэтому сравнивать Gemini 2.0 с DeepSeek-R1 и OpenAI o3 — это все равно, что сравнивать яблоки с апельсинами.

Но сегодня Google также сообщила новости, связанные с интеллектуальным мышлением: генеральный директор Google Сундар Пичаи через платформу X анонсировал обновление мобильного приложения Google Gemini для iOS и Android, основанное на конкурентной модели мышления Gemini 2.0 Flash Thinking. Эта модель может быть интегрирована с Google Maps, YouTube и Google Search, что позволит реализовать совершенно новый набор поисковых запросов и взаимодействий на основе ИИ, недоступных для новых конкурентов, не имеющих этих сервисов, таких как DeepSeek и OpenAI.

Я быстро опробовал его в приложении Google Gemini iOS на своем iPhone, пока писал эту статью, и, судя по моим первоначальным запросам, приложение оказалось впечатляющим: оно нашло сходство между 10 самыми просматриваемыми видеороликами YouTube за последний месяц и предоставило мне список ближайших врачебных кабинетов и их часы работы/закрытия — и все это за считанные секунды.

Публичный релиз Gemini 2.0 Flash

Прототип Gemini 2.0 Flash, первоначально выпущенный в качестве бета-версии в декабре , теперь готов к серийному производству.

Разработанный для высокоэффективных приложений искусственного интеллекта, он обеспечивает ответы с малой задержкой и поддерживает масштабные мультимодальные рассуждения.

Одним из его ключевых преимуществ перед конкурентами является его контекстное окно, или количество токенов, которые пользователь может добавить в качестве поощрения и получить обратно за одно двустороннее взаимодействие с чат-ботом или API на базе LLM.

В то время как многие ведущие модели, такие как новый o3-mini от OpenAI, дебютировавший на прошлой неделе, поддерживают 200000 400 токенов или меньше, что эквивалентно роману объемом 500–2.0 страниц, Gemini XNUMX Flash поддерживает XNUMX миллион токенов, что означает, что он может обрабатывать огромные объемы информации, что делает его особенно полезным для часто выполняемых масштабных задач.

Gemini 2.0 Flash-Lite: недорогие решения на основе искусственного интеллекта

Gemini 2.0 Flash-Lite — это совершенно новая большая языковая модель, призванная предоставлять экономически эффективные решения на основе ИИ без ущерба качеству.

Google DeepMind сообщает, что Flash-Lite превосходит своего полноразмерного (более параметризованного) предшественника Gemini 1.5 Flash по внешним бенчмаркам, таким как MMLU Pro (77.6% против 67.3%) и Bird SQL (57.4% против 45.6%), сохраняя при этом ту же цену и скорость.

Он также поддерживает ввод мультимедиа и имеет контекстное окно на 1 миллион токенов, аналогично полной модели Flash.

В настоящее время Flash-Lite доступен в виде общедоступной предварительной версии через Google AI Studio и Vertex AI, а ее общедоступность ожидается в ближайшие недели.

Как показано в таблице ниже, цена Gemini 2.0 Flash-Lite составляет 0.075 долл. США за миллион токенов (вход) и 0.30 долл. США за миллион токенов (выход). Flash-Lite — очень доступный вариант для разработчиков, превосходящий Gemini 1.5 Flash в большинстве тестов при сохранении той же структуры затрат.

 

Логан Килпатрик подчеркнул экономическую эффективность и ценность моделей Gemini 2.0 Flash, заявив о платформе X : «Gemini 2.0 Flash — это лучшее соотношение цены и качества среди всех моделей LLM, пора начинать!»

Фактически, по сравнению с другими ведущими традиционными моделями LLM, доступными через API провайдера, такими как OpenAI 4o-mini (0.15/0.6 доллара США за миллион токенов ввода-вывода), Anthropic Cloud (0.8/4 доллара США за миллион токенов ввода-вывода) и даже традиционной моделью LLM V3 от DeepSeek (0.14/0.28 доллара США), Gemini 2.0 Flash представляется наиболее выгодным вариантом.

Gemini 2.0 Pro Beta поставляется с 2 миллионами токенов контекстного окна

Модель Gemini 2.0 Pro (бета) теперь доступна для тестирования пользователям, которым требуются более продвинутые возможности ИИ.

Google DeepMind описывает эту модель как самую мощную для производительности программирования и способности обрабатывать сложные запросы. Он оснащен контекстным окном на 2 миллиона символов и расширенными возможностями рассуждений, а также возможностью интеграции внешних инструментов, таких как Google Search и выполнение кода.

Сэм Уитвин, соучредитель и генеральный директор Red Dragon AI и внешний эксперт по разработке машинного обучения в Google, часто сотрудничающий с VentureBeat, рассказал о модели Pro в обзоре на YouTube . «Новая модель Gemini 2.0 Pro имеет контекстное окно с возможностью хранения двух миллионов фрагментов кода, поддерживает виджеты, выполнение кода, вызовы функций и интеграцию с поиском Google — все, что было в Pro 1.5, но улучшено».

Он также указал на итеративный подход Google к разработке ИИ: «Одним из ключевых отличий стратегии Google является то, что компания выпускает бета-версии моделей до того, как они станут общедоступными (GA), что позволяет проводить быструю итерацию на основе отзывов».

Тесты производительности еще раз демонстрируют возможности семейства моделей Gemini 2.0. Например, Gemini 2.0 Pro превосходит Flash и Flash-Lite в таких задачах, как рассуждение, многоязычное понимание и обработка длинного контекста.

Безопасность ИИ и будущие разработки

Наряду с этими обновлениями Google DeepMind внедряет новые меры безопасности для своих моделей Gemini 2.0. Компания использует методы обучения с подкреплением для повышения точности ответов, применяя искусственный интеллект для критики и улучшения результатов. Кроме того, для выявления уязвимостей используется автоматизированное тестирование безопасности, включая угрозы косвенного внедрения утверждений.

Заглядывая вперед, Google DeepMind планирует расширить возможности семейства моделей Gemini 2.0, и ожидается, что в ближайшие месяцы станут общедоступными дополнительные методы, выходящие за рамки текста.

Благодаря этим обновлениям Google усиливает свои усилия по разработке искусственного интеллекта, представляя набор моделей, разработанных для обеспечения эффективности, доступности и передового решения проблем, реагируя на рост DeepSeek собственным набором моделей, варьирующимся от мощных до очень мощных и от очень доступных до немного менее дорогих (но все еще доступных).

Будет ли этого достаточно, чтобы помочь Google выйти на рынок корпоративного ИИ, на котором ранее доминировал OpenAI, а теперь доминирует DeepSeek? Мы продолжим следить за ситуацией и дадим вам знать!

Если вы хотите произвести впечатление на своего начальника, VB Daily вам поможет. Мы расскажем вам изнутри, что делают компании с генеративным ИИ — от организационных преобразований до практического внедрения, — чтобы вы могли поделиться идеями и максимально повысить рентабельность инвестиций.

 

Комментарии закрыты.