Как вы обеспечиваете, чтобы ваши решения на основе ИИ работали так, как вы ожидаете?
Краткое введение в оценку ИИ
Генеративный искусственный интеллект (GenAI) стремительно развивается и уже не ограничивается созданием забавных чат-ботов или впечатляющих изображений. 2025 год станет годом, когда основное внимание будет уделено превращению медийного ажиотажа вокруг ИИ в реальную ценность. Компании по всему миру ищут способы интегрировать и использовать GenAI в своих продуктах и процессах — для лучшего обслуживания пользователей, повышения эффективности, сохранения конкурентоспособности и стимулирования роста. А благодаря API и предварительно обученным моделям от ведущих поставщиков интеграция GenAI кажется проще, чем когда-либо. Но вот в чем загвоздка: простота интеграции не означает, что решения на основе ИИ будут работать должным образом после развертывания.

Прогностические модели не являются чем-то принципиально новым: люди уже много лет делают прогнозы, официально начиная со статистики. Однако искусственный интеллект произвел революцию в прогнозировании по нескольким причинам :
- Вам не нужно обучать собственную модель или быть специалистом по обработке данных, чтобы создавать решения на основе ИИ.
- Теперь искусственный интеллект легко использовать через чат-интерфейсы и легко интегрировать через API.
- Освобождение многих вещей, которые раньше было невозможно сделать или было очень сложно сделать.
Все эти факторы делают GenAI невероятно захватывающим, но и рискованным . В отличие от традиционного программного обеспечения — или даже классического машинного обучения — GenAI вносит новый уровень непредсказуемости. Вы не используете детерминированную логику; вы используете модель, обученную на огромных массивах данных, надеясь, что она будет реагировать так, как необходимо. Так как же узнать, делает ли система ИИ то, что мы от нее ожидаем? Как узнать, готова ли она к работе? Ответ — оценки, концепцию, которую мы рассмотрим в этой статье.
- Почему системы Genai нельзя тестировать так же, как традиционное программное обеспечение или даже классическое машинное обучение (ML)
- Почему рейтинги необходимы для понимания качества вашей системы ИИ, а не являются дополнительными (если только вы не любите сюрпризы)
- Различные виды оценок и методики их применения на практике
Независимо от того, являетесь ли вы менеджером по продукту, инженером или любым другим человеком, работающим с ИИ или интересующимся им, я надеюсь, что эта статья поможет вам понять, как критически относиться к качеству систем ИИ (и почему оценки необходимы для достижения этого качества!).
Генеративный ИИ невозможно протестировать так же, как традиционное программное обеспечение или даже как классическое машинное обучение.
В традиционной разработке программного обеспечения системы следуют детерминированной логике: если происходит X, то всегда произойдет Y. Если только что-то не пойдет не так с вашей базовой системой или вы не внесете ошибку в код… именно поэтому добавляются тестирование, мониторинг и оповещения. Модульные тесты используются для проверки небольших блоков кода, интеграционные тесты — для обеспечения правильной работы компонентов, а мониторинг — для обнаружения сбоев в производственной среде. Тестирование традиционного программного обеспечения похоже на проверку калькулятора. Вы вводите 2 + 2 и ожидаете 4. Ясно и детерминированно, результат либо истинный, либо ложный.
Однако машинное обучение и искусственный интеллект вносят неопределенность и вероятность. Вместо явного определения поведения с помощью правил, мы обучаем модели выявлять закономерности в данных. В ИИ, если происходит событие X, результат уже не является фиксированным значением Y, а представляет собой предсказание с определенной степенью вероятности, основанное на том, чему модель научилась во время обучения . Это может быть очень эффективно, но также вносит неопределенность: идентичные входные данные могут давать разные результаты с течением времени, правдоподобные результаты могут оказаться неверными, а в редких случаях может проявляться неожиданное поведение…
Это делает традиционные методы тестирования неадекватными, а иногда даже нецелесообразными. Пример с калькулятором похож на попытку оценить успеваемость студента на экзамене с открытым ответом. Для каждого вопроса и для множества возможных вариантов ответа, является ли предложенный ответ правильным? Превышает ли он уровень знаний, которым должен обладать студент? Выдумал ли студент все, но это выглядит очень убедительно? Как и ответы на экзамене, системы искусственного интеллекта можно оценивать, но им необходим более общий и гибкий метод, позволяющий адаптироваться к различным входным данным, контекстам и вариантам использования (или типам тестов).
В традиционном машинном обучении (МО) оценка уже является устоявшейся частью жизненного цикла проекта . Обучение модели для узкой задачи, такой как одобрение кредита или выявление заболеваний, всегда включает этап оценки — с использованием таких метрик, как точность, полнота, RMSE и MAE. Это используется для измерения того, насколько хорошо работает модель, для сравнения различных вариантов моделей и для определения того, достаточно ли хороша модель для развертывания. В GenAI все обычно иначе: команды используют модели, которые уже были обучены и прошли внутренние оценки общего назначения, проводимые поставщиком модели, и на общих бенчмарках. Эти модели очень хорошо справляются с общими задачами — например, отвечают на вопросы или составляют электронные письма — и существует риск чрезмерной зависимости от них для нашего конкретного случая использования. Однако важно задать вопрос: « Достаточно ли хороша эта замечательная модель для моего случая использования? » Именно здесь вступает в игру оценка — для определения того, насколько прогнозы или генерации хороши для конкретного случая использования, контекста, входных данных и пользователей.

Есть еще одно важное различие между машинным обучением и GenAI: разнообразие и сложность выходных данных модели. Мы больше не возвращаем категории и вероятности (например, вероятность возврата клиентом кредита) или числа (например, ожидаемую цену дома на основе его характеристик). Системы GenAI могут возвращать множество типов выходных данных с различной длиной, тоном, содержанием и форматом. Аналогичным образом, эти модели больше не требуют строго структурированных и специфических входных данных, а, как правило, принимают практически любой тип входных данных — текст, изображения или даже аудио или видео. Поэтому оценка становится намного сложнее.

Почему оценки необходимы, а не являются необязательными (если вы не предпочитаете неприятные сюрпризы)
Процессы оценки помогают определить, действительно ли ваша система искусственного интеллекта работает так, как вы хотите , готова ли она к запуску и, если да, продолжает ли она демонстрировать ожидаемые результаты. Вот анализ того, почему процессы оценки важны:
- Оценка качества: Оценки предоставляют структурированный способ понять качество ваших прогнозов или результатов ИИ, а также то, как они будут интегрироваться в общую систему и вариант использования. Являются ли ответы точными? Полезный? Сплоченный? Связанный?
- Количественная оценка ошибок: Рейтинги помогают определить процент, типы и величину ошибок. Как часто возникают ошибки? Какие типы ошибок встречаются чаще всего (например, ложные срабатывания, галлюцинации, ошибки форматирования)?
- Снижение риска: Он помогает вам выявлять и предотвращать вредоносное или предвзятое поведение до того, как оно станет известно пользователям, защищая вашу компанию от репутационных рисков, этических проблем и потенциальных проблем с регулированием.
Генеративный ИИ со свободными отношениями ввода-вывода и генерацией длинных текстов делает оценки более релевантными и сложными. Когда дела идут плохо, они могут пойти очень плохо. Мы все видели заголовки о чат-ботах, дающих опасные советы, моделях, генерирующих предвзятый контент, и инструментах искусственного интеллекта, выдающих ложные факты.
« Искусственный интеллект никогда не будет идеальным, но, используя рейтинги, вы можете снизить риск неловких ситуаций, которые могут стоить вам денег, репутации или вирусного момента в Твиттере » .
Как вы определяете стратегию оценки ИИ?

Итак, как мы определяем рейтинги нашего ИИ? Универсального метода оценки не существует. Оценки зависят от конкретного варианта использования и должны соответствовать конкретным целям вашего приложения ИИ. Например, если вы создаете поисковую систему, вас может волновать релевантность результатов. Если это чат-бот, вас наверняка волнуют полезность и безопасность. Если информация засекречена, вас, скорее всего, будут волновать точность и правильность. Для систем, включающих несколько этапов (например, система ИИ, которая выполняет поиск, расставляет приоритеты по результатам, а затем генерирует ответ), часто необходимо оценивать каждый этап. Идея здесь заключается в том, чтобы измерить, помогает ли каждый шаг достичь общей метрики успеха (и на основе этого понять, на чем следует сосредоточить итерации и улучшения).
К общим областям оценки относятся:
- Правильность и галлюцинации: Являются ли полученные результаты реалистично точными? Генерирует ли система неверную информацию или галлюцинации?
- Релевантность: Соответствует ли контент запросу пользователя или предоставленному контексту?
- безопасность, предвзятость и токсичность
- Формат: Вывод имеет ожидаемый формат (например, JSON, допустимый вызов функции)?
- Безопасность, предвзятость и токсичность: Генерирует ли система вредоносный, предвзятый или токсичный контент?
Метрики, специфичные для конкретной задачи. Например, в задачах классификации используются такие метрики, как точность и прецизионность, в задачах суммирования — ROUGE или BLEU, а в задачах создания кода — регулярные выражения и проверка выполнения без ошибок.
Как на самом деле рассчитываются оценки?
После того, как вы определились с тем, что хотите измерить, следующим шагом станет разработка тестовых случаев. Это будет набор примеров (чем больше, тем лучше, но всегда с учетом баланса стоимости и затрат), где у вас есть:
- Пример ввода:Реалистичное представление вашей системы после ее запуска в производство.
- Ожидаемый результат (Если применимо): Ключевой факт или пример желаемых результатов.
- Метод оценки: Механизм регистрации для оценки результата.
- Результат или успех/неудача: Расчетная метрика, которая оценивает ваш тестовый случай.
В зависимости от ваших потребностей, времени и бюджета существует несколько методов, которые вы можете использовать в качестве методов оценки:
- Инструменты статистической регистрации, такие как: BLEU, ROUGE и METEOR, или косинусная мера сходства между встраиваниями — хорошо подходит для сравнения сгенерированного текста с эталонным выводом.
- Традиционные метрики машинного обучения, такие как Точность, полнота и AUC — лучше всего подходят для классификации с маркированными данными.
- Большая языковая модель в качестве судьи (LLM-as-a-Judge) Используйте большую языковую модель для оценки выходных данных (например, «Правильный ли и полезный ли это ответ?“). Особенно полезно, когда неклассифицированные данные недоступны или при оценке открытой конструкции.
В процессах оценки на основе кода для проверки форматов используются стандартные выражения, логические правила или реализации тестовых примеров.
Суть
Давайте разберем все на конкретном примере. Представьте, что вы создаете систему анализа настроений, которая поможет вашей службе поддержки клиентов расставить приоритеты при обработке входящих писем.
Цель состоит в том, чтобы гарантировать, что самые срочные или негативные сообщения получат более быстрые ответы, что позволит снизить разочарование, повысить удовлетворенность и сократить отток клиентов. Это относительно простой вариант использования, но даже в такой системе с ограниченной производительностью качество имеет значение: неверные прогнозы могут привести к случайной расстановке приоритетов в электронных письмах, а это означает, что ваша команда будет тратить время на систему, которая стоит денег.
Как же узнать, работает ли ваше решение так, как вам хотелось бы? Вы оцениваете. Вот несколько примеров того, что может иметь значение для оценки в этом конкретном случае использования:
- Проверка формата: Возвращаются ли выходные данные вызова большой языковой модели (LLM) для прогнозирования настроений в электронных письмах в ожидаемом формате JSON? Это можно оценить с помощью проверок на основе кода: регулярных выражений, проверки схемы и т. д.
- Точность классификации настроений: Правильно ли система классифицирует тональность в различных текстах — коротких, длинных и многоязычных? Это можно оценить с помощью данных, маркированных с использованием традиционных метрик машинного обучения (метрик МО) или, если метки недоступны, с использованием большой языковой модели (LLM) в качестве судьи.
Когда решение станет простым, вам также потребуется включить показатели, наиболее важные для оценки конечного результата вашего решения :
- Эффективность приоритизации: Действительно ли сотрудники службы поддержки направляют свои письма к самым важным? Соответствует ли расстановка приоритетов желаемому влиянию на бизнес?
- Окончательное влияние на бизнес: Сокращает ли эта система время отклика, уменьшает ли она отток клиентов и повышает ли она показатели удовлетворенности?
Оценка качества имеет решающее значение для обеспечения полезности, безопасности, ценности и готовности систем искусственного интеллекта к внедрению в производство. Поэтому, независимо от того, работаете ли вы с простым классификатором или с чат-ботом с открытым концом, уделите время определению того, что означает «достаточно хорошо» (минимально приемлемое качество), и стройте оценку на основе этого, чтобы измерять производительность!
ссылки
[1] Вашим продуктам с использованием ИИ необходима оценка , Хамель Хусейн
[2] Метрики оценки LLM: Полное руководство по оценке LLM, Confident AI
[3] Оценка агентов ИИ, deeplearning.ai + Arize
Комментарии закрыты.