Клод против Джемини против Грока: кто лучший в гонке искусственного интеллекта?
В сфере искусственного интеллекта развернулась ожесточенная конкуренция между тремя недавно появившимися чат-ботами, которые благодаря своим инновационным функциям, уникальным возможностям и высоким позициям в рейтинге. Claude с его новыми коннекторами, Gemini, интегрированный в браузер Chrome, и Grok — все это примеры того, как сокращается конкуренция между самыми мощными моделями ИИ на сегодняшний день. Несмотря на различия в сильных сторонах, разрыв в эффективности и практической полезности быстро сокращается.
Поскольку ChatGPT под давлением пользователей опустился на восьмое место, я решил протестировать эти три модели в семи реальных сценариях. Признаюсь, я заранее не знал, какая из них окажется лучшей, особенно после кардинальных изменений, произошедших за последние полгода с момента «бума ИИ». Вот что получилось, когда я сравнил Claude, Gemini и Grok, используя одни и те же тесты.

1. Рассуждение и решение проблем
Способность к логическому анализу и решению проблем является одним из важнейших критериев при сравнении моделей искусственного интеллекта. Здесь интеллект модели проверяется в её способности справляться со сложными ситуациями, от решения математических задач до предоставления практических решений повседневных проблем.

Запрос : «Вот мой список дел на сегодня: приготовить ужин, сложить белье, ответить на 25 электронных писем и написать эссе на 500 слов. У меня всего 3 часа. Пожалуйста, составьте более эффективный график и объясните, почему».
Клод Предоставьте четкий график с указанием времени и объясните логику последовательности (электронная почта, еда, стирка и т. д.).
Gemini Продемонстрировал превосходное управление энергией и отводил время письму, когда меня везли с ужина. Модель дала убедительное объяснение с использованием принципов производительности (парное выполнение задач, пакетирование, энергетические циклы).
В Grok был предусмотрен 10-минутный льготный период, что оказалось полезным. В остальном, все было реалистично и понятно.
Победитель: Близнецы выигрывают этот раунд, потому что им удалось найти баланс между реалистичным выполнением нескольких задач одновременно, осознанием своих энергетических затрат и четким объяснением причин размещения каждого блока.
2. Знания в реальном времени

Вопрос : «Какое самое крупное обновление модели ИИ произошло за последние две недели? Кратко опишите его (менее 100 слов) и объясните, почему это важно».
Gemini подчеркнула свою интеграцию в Google Chrome, что очень актуально, своевременно и точно. Чат-бот также объяснил свою важность, хотя и в несколько рекламной форме.
Клод сосредоточился на Apple Intelligence, что кажется уклонением от ответа, учитывая текущее состояние этой системы. Его ответ, несмотря на то, что он превысил 100 слов, не был достаточно подробным.
Компания Grok выбрала сложную и специфическую новость в области искусственного интеллекта, но она носит узкоспециализированный характер и не имеет отношения к повседневным событиям.
Победитель: Gemini побеждает, потому что выбрала наиболее актуальное, своевременное и распространенное обновление и объяснила, почему оно важно для обычных пользователей.
3. Стиль письма

Запрос : «Напишите новостной обзор объемом 150 слов о последнем обновлении ChatGPT от OpenAI в стиле The New York Times, а затем перепишите его в стиле BuzzFeed».
Клод в совершенстве овладел стилем NYT, и переработка текста для BuzzFeed также оказалась успешной. Обе версии отражают одно и то же обновление, демонстрируя его умение адаптировать тон к аудитории.
Компания Gemini выбрала другой подход к обновлению информации, хотя метод NYT был превосходным, а метод BuzzFeed также попал в точку, но в целом он оказался менее точным.
Грок написал краткие и точные обзоры для обеих платформ, но статья в NYT показалась слишком узкоспециализированной.
Победитель: Клод победил, потому что продемонстрировал наиболее очевидную способность адаптировать свой стиль, работая как в The New York Times, так и в BuzzFeed, оставаясь при этом в разумной степени в курсе событий в реальном мире.
4. Юмор и личность

Запрос : «Расскажите мне короткий, оригинальный анекдот о новых функциях искусственного интеллекта в Google Chrome — и пусть он будет подходящим для семейного просмотра».
Клод придумал шутку с тщательно продуманной завязкой и ясным финалом. Она была креативной и напрямую связана с функциями Chrome.
Близнецы, благодаря своему остроумию и прямолинейной фразе, казались авторами по-настоящему удачной шутки в одну строчку.
Грок рассказал банальную, но подходящую для семейного просмотра и забавную шутку. Он не рискнул, но шутка не запомнилась.
Победитель: Близнецы победили, потому что представили самую удачную, смешную и уместную шутку в одну строку, которая понравится как детям, так и взрослым.
5. Творчество

Вопрос : «Представьте себе новое устройство для умного дома, работающее на основе искусственного интеллекта. Опишите, что оно делает, как выглядит и почему семьи могут захотеть его приобрести — менее чем в 120 словах».
Клод продемонстрировал богатое воображение и сильные навыки рассказывания историй.
Компания Gemini предложила весьма практичное и применимое решение, которое позволило устранить глобальную проблему.
Компания Grok предложила удачное сочетание улучшений в области энергосбережения и безопасности, представив четкий ответ на поставленную задачу.
Победитель: Клод побеждает в этом раунде благодаря своей оригинальности и эмоциональной привлекательности. Концепция бота футуристична, ориентирована на человека и отличается от существующих продуктов.
6. Творческие описания

Запрос : «Опишите, что бы я увидел на фотографии семьи в батутном парке в субботнее утро. Затем придумайте 3 забавные подписи для этой фотографии в Instagram».
Клод прекрасно передал конфликт между младшим ребенком и старшим братом, а юмор был идеально вставлен. Реакция кажется очень знакомой и реалистичной.
Gemini представила впечатляющие визуальные образы и короткие, забавные подписи, которые легко было разместить в социальных сетях и которые идеально подходили для Instagram.
Grok добавил дополнительные элементы сцены, что является уникальной особенностью для чат-бота. Он обеспечил хороший баланс между детализацией и краткостью.
Победитель: Gemini побеждает благодаря сочетанию ярких описаний и привлекательных, подходящих для Instagram подписей, что делает его наиболее удобным для размещения на сайте.
7. Моральное и критическое мышление

Вопрос : «В некоторых школах запрещено задавать домашние задания по использованию инструментов искусственного интеллекта, таких как ChatGPT. Напишите краткий аргумент в пользу запрета, а затем наиболее веский аргумент против него».
Клод хорошо выделил сильные и слабые стороны, приведя очень убедительные аргументы. В его формулировках встречались некоторые повторения, но в целом он дал подробный и содержательный ответ.
Джемини удалось найти баланс между структурированием и убедительным изложением аргументов обеих сторон в ясном и академическом стиле.
Грок не вдавался в такие подробности, но его слова были ясными и лаконичными, и он поднял дополнительные вопросы, которые другие роботы не заметили.
Победитель: Клод побеждает благодаря своей более глубокой и взвешенной логике, представив всесторонне обе стороны вопроса.
Абсолютный победитель: Близнецы
После семи раундов результаты оказались ближе к ожидаемым. Gemini превзошёл все ожидания в плане знаний в режиме реального времени, юмора и ответов, адаптированных для социальных сетей, что доказывает, почему он является лучшим чат-ботом. В то же время Claude превзошёл себя в креативности, адаптивности и критическом мышлении. Grok, хотя и не такой яркий, неизменно давал практичные и практичные ответы, которые могли бы заинтересовать любого, кто ищет немедленную выгоду.
По мере того, как ChatGPT падает в рейтинге, реальный результат таков: конкуренция заставляет каждую модель становиться всё более точной, умной и полезной. Расскажите в комментариях, что вы думаете об этих трёх? Какая из них вам нравится больше всего?
Комментарии закрыты.