Распространённые подходы к оценке

Когда вы создаёте агентов ИИ, нужны надёжные способы тестирования и измерения их эффективности. Стратегии оценки помогают генерировать тестовые данные, оценивать ответы агентов и принимать обоснованные решения о качестве вашего агента.

В этой статье описываются распространённые подходы к оценке и когда следует использовать каждый из них. Для оптимизации стоимости, производительности и качества комбинируйте несколько подходов и платформ, а не полагайтесь на один метод оценки.

Генерация пар запрос-ответ для градировки

В этом разделе описываются три распространённых подхода к генерации пар запрос-ответ для моделирования реальных взаимодействий: эхо, историческое воспроизведение и синтезированные персоны. Каждый подход имеет свои преимущества и ограничения, что делает его подходящим для тестирования в различных ситуациях.

Эхо

Чат агента воспроизводит статический список многоэтапных запросов, соответствующих сценарию, дословно.

Плюсы: низкая цена. Обеспечивает справедливые сравнения, когда вы меняете только один аспект агента, например, инкрементальные обновления модели или изменения одного инструмента.

Минусы: Поскольку оценка использует статичный список подсказок, она не может адаптироваться к разным ответам, которые агенты дают во время разговора. Поздние подсказки могут быть неактуальны для текущего контекста разговора.

Идеально для: сценариев с одним ходом и детерминированных проверок. Используйте этот метод, чтобы проверить, правильно ли отображаются ссылки, правильно ли срабатывает вызов инструмента, а также для простых разговоров, где контекст не вызывает расхождений.

Примеры сценариев, которые хорошо работают:

  • Шаг 1: Загрузить документ (двоичная проверка по принципу «пройдено/не пройдено»)
  • Ход 1: Сгенерировать изображение для этого контента (проверка сходства)
  • Ход 2: Теперь сгенерируйте подпись. (проверка сходства)

Воспроизведение истории

Оценивайте каждый ход в контексте предыдущих запросов и ответов на каждый запрос.

Преимущества: частично решает проблему расхождения в многоэтапных беседах, определяя, где и насколько каждый этап отклоняется от идеального сценария.

Недостатки: по-прежнему не поддерживает динамические многоэтапные беседы, такие как обучение, и не учитывает динамические изменения RAG (генерация ответа, дополненная результатами поиска), например веб-поиск.

Идеально для: сравнительных методов или изменений моделей, чтобы понять расхождения с исходным поведением на каждом этапе.

Синтезированные персонажи (на основе сценария)

Человек или агентный субъект в реальном времени генерирует беседу на основе сценария и пользователя.

Плюсы: вы можете динамично оценивать сложные сценарии (например, выступать в роли репетитора).

Минусы: Точность оценки ответов требует нюансов, и нужно учитывать стоимость языковой модели или человеческого тестера.

Оценка ответов

После того как вы зафиксировали пары запрос-ответ, оцените общее качество и производительность агентной системы. Распространённые подходы к оценке включают оценщиков на основе кода, языковых моделей в роли судей и человеческих оценщиков.

Оценщики на основе кода

Примеры: регулярное выражение, бинарная оценка "пройден/не пройден", модульное тестирование, расчетное векторное сходство, телеметрические метрики (производительность, емкость, стоимость).

Плюсы: существуют зрелые решения и фреймворки. Например, конвейеры тестирования regex, lint и UX. Вы можете легко проверить детерминированность проверок.

Минусы: Сложно точно оценить нюансы или качественные аспекты агента, такие как тон и точность.

Языковая модель как судья

Плюсы: позволяет масштабно тестирование на основе сценариев. Достаточно гибкий, чтобы кодировать широкий спектр пользовательских предпочтений.

Минусы: Чрезмерная зависимость только от оценки базовой модели языка или ограниченного набора моделей и данных о основании может привести к энтропии в процессе оценки.

Человеческие оценщики

Плюсы: обеспечивает лучшую качественную оценку.

Минусы: медленно и дорого. Это требует от специалистов уделять время вне своей основной работы.

Перевод результатов оценки в решения

Агенты меняют существующие подходы к оценке реализуемости и окупаемости инвестиций (ROI), поскольку подходы к проектированию решений смещаются в сторону многоагентных моделей, концепции Agent 365 или цифрового работника. Обратите внимание на следующие факторы:

  • Недетерминированный характер языковых моделей требует перехода от статических критериев успеха сдачи или неуспеха и измерений на основе модульных тестов к процентным оценкам.

  • ROI для агента включает воздействие, выходящее за рамки отдельного решения или потока одного процесса, поскольку модульные инструменты (MCP) или многоагентные экосистемы Agent2Agent (A2A) выходят за рамки одного случая использования.

В следующих разделах описываются лучшие практики по преобразованию результатов оценки в обоснованные решения по архитектуре и стратегии развертывания вашего агента.

Установление метрик оценки

Установите базовую оценку успеха существующей системы, даже если она ручная. Например, маршрутизация заявок у существующих поставщиков поддержки не имеет 100% успеха даже при использовании людей или автоматизации процессов.

Метрики оценки должны быть специфичны для бизнес-результата. Например, при оценке решения для маршрутизации билетов оценивайте как время до разрешения (TTR), так и точность маршрутизации, чтобы приоритизировать компромиссы между архитектурами. Одно решение может обеспечить более высокую точность при более длинном TTR, что может быть менее желательным, чем более быстрый, но немного менее точный агентный раствор.

Перед созданием любого решения выполните оценку концепции модели языка, API или типа агента. Эта оценка помогает понять, увеличивает ли предлагаемое решение базовый процент успеха на статистически значимый процент, или же оно обеспечивает эквивалентный процент успеха с надежной экономией времени или средств.

Отход от потоков серийной разработки

Устаревшие подходы к построению агентов используют последовательную или серийную модель мышления. Эта модель часто приводит к тупикам. Идея "эволюции" агентов от декларативных к пользовательским и далее к полнокодовым агентам поддерживает эту концептуальную модель. По своей сути это пошаговый и последовательный процесс.

Такой подход создает ощущение тупика или регресса при "обновлении" агента, несмотря на то что используются разные оркестраторы и языковые модели. Оценка критериев успеха таким образом не учитывает многомерный характер агентных решений.

При интерпретации результатов оценки избегайте стремления сводить их к усредненной или упрощенной метрике, например в виде лепестковой диаграммы. Выбирайте агентов, исходя из их способности склоняться в пользу одного-двух конкретных качеств, необходимых для успеха.

В следующем примере, хотя радарный график показывает, что Solution A является лучшим выбором, поскольку охватывает большую площадь поверхности, для HR-решения Solution B даёт более соответствующие результаты. Решение B — лучший выбор, когда объём запросов и приоритет бизнеса (продажи) не являются главными факторами успеха.

Диаграмма радарной диаграммы, сравнивающей Решение A и Решение B по стоимости, объёму запросов, полноте, приоритету бизнеса и качеству.

Используйте визуализации с высокой сложностью, такие как столбцовые диаграммы или системы принятия решений, чтобы подчеркнуть наиболее важные для успеха аспекты конкретного случая использования. Эти инструменты уточняют, когда следует отдавать приоритет релевантности поиска над воспоминанием, или времени ответа, вместо размера контекста, производительности над затратами и подобным факторам.

Note

Гибридные подходы к оценке, при которых эксперты-оценщики проверяют и дополнительно уточняют рассуждения языковых моделей, выступающих в роли судей, позволяют совместить преимущества обоих подходов и снизить ограничения каждого из них.

Создание тестового плана

Критерии оценки и результаты различаются в зависимости от платформы и решения. Для получения рекомендаций по созданию тестового плана обратитесь к следующим ресурсам: