Справочник по встроенным вычислителям

Important

Элементы, помеченные (предварительная версия) в этой статье, в настоящее время находятся в общедоступной предварительной версии. Эта предварительная версия предоставляется без соглашения об уровне обслуживания, и мы не рекомендуем ее для рабочих нагрузок. Некоторые функции могут не поддерживаться или могут иметь ограниченные возможности. Дополнительные сведения см. в разделе Supplemental Terms of Use for Microsoft Azure Previews.

Microsoft Foundry включает встроенные вычислители для оценки качества, безопасности и надежности ответов ИИ на протяжении всего жизненного цикла разработки. В этом справочнике перечислены все доступные вычислители, их цели и рекомендации по выбору подходящего для вашего варианта использования. Вы также можете создавать пользовательские вычислители , адаптированные к конкретным критериям оценки.

При выборе оценщиков навык Microsoft Foundry может помочь подключить эту ссылку к настройке оценки, оптимизации запросов и устранению неполадок рабочих процессов.

Вычислители общего назначения

Эвалуатор Purpose
Согласованность Измеряет логическую согласованность и поток ответов.
Беглость Измеряет качество естественного языка и удобочитаемость.

Дополнительные сведения см. в разделе "Оценка общего назначения".

Средство оценки сходства текста

Эвалуатор Purpose
Сходство Измерение сходства с использованием искусственного интеллекта.
F1-результат Гармоничный средний коэффициент точности и отзыва в токене перекрывается между ответом и земной правдой.
BLEU Двуязычная оценка недоумение оценки для мер качества перевода перекрывается в n-граммах между ответом и земной правдой.
GLEU Google-BLEU вариант для оценки на уровне предложений перекрывается в n-граммах между ответом и основной истинностью.
ROUGE Recall-Oriented Understudy for Gisting Assessment измеряет пересечения в n-граммах между ответом и реальностью.
МЕТЕОР Метрика для оценки перевода с явными мерами упорядочивания перекрывается в n-граммах между ответом и земной правдой.

Дополнительные сведения см. в разделе оценщиков сходства текста.

Оценщики RAG

Эвалуатор Purpose
Возвращение Измеряет, насколько эффективно система получает соответствующую информацию.
Извлечение документов Измеряет точность в результатах извлечения, учитывая истину земли.
Обоснованность Измеряет, насколько заземлен ответ находится в полученном контексте. Возвращает оценку от 1 до 5, используя модельное решение.
Groundedness Pro (предварительная версия) Измеряет, находится ли ответ в полученном контексте с помощью службы Безопасность содержимого ИИ Azure. Возвращает двоичный проход или сбой, не требуя развертывания модели.
Актуальность Измеряет, насколько соответствующий ответ соответствует запросу.
Полнота ответа (предварительная версия) Меры в той степени, в какой степени ответ завершен (не отсутствует критическая информация) в отношении истины земли.

Дополнительные сведения см. в статье о вычислителях расширенного поколения (RAG).

Вычислители рисков и безопасности

Эвалуатор Purpose
Ненависть и несправедливость Определяет предвзятое, дискриминационное или ненавистное содержимое.
Сексуальный Определяет неуместное сексуальное содержимое.
Насилия Обнаруживает насильственное содержимое или подстрекательство.
Самоповредение Обнаруживает содержимое, повышающее или описывающее самоповредение.
Защищенные материалы Обнаруживает несанкционированное использование защищенного или защищенного содержимого.
Непрямая атака (XPIA) Измеряет, упал ли ответ на непрямую попытку взлома тюрьмы, введенную с помощью полученного контекста.
Уязвимость кода Определяет проблемы безопасности в созданном коде.
Необоснованные атрибуты Обнаруживает вымышленные или ошибочные сведения, полученные из взаимодействия с пользователем.
Запрещенные действия Измеряет способность агента ИИ участвовать в поведении, которые нарушают явно запрещенные действия.
Утечка конфиденциальных данных Измеряет уязвимость агента ИИ к раскрытию конфиденциальной информации.

Дополнительные сведения см. в статье о оценках рисков и безопасности.

Оценщики агентов

Эвалуатор Purpose
Соблюдение задач (предварительная версия) Измеряет, следует ли агенту выполнять определенные задачи в соответствии с системными инструкциями.
Завершение задачи (предварительная версия) Измеряет, успешно ли агент выполнил запрошенную задачу.
Удовлетворенность клиентов (предварительная версия) Измеряет целостное удовлетворение пользователей в беседе с помощью шести измерений: полезность, полнота, ясность, тон, разрешение и адаптируемость.
Разрешение намерений (предварительная версия) Измеряет, насколько точно агент определяет намерения пользователей и обращается к ней.
Эффективность навигации по задачам Определяет, соответствует ли последовательность шагов агента оптимальному или ожидаемому пути для измерения эффективности.
Точность вызова средства Измеряет общее качество вызовов инструментов, включая выбор, правильность параметров и эффективность.
Выбор инструмента Измеряет, выбран ли агент наиболее подходящие и эффективные инструменты для задачи.
Точность ввода средства Проверяет правильность всех параметров вызова средства с строгими критериями, включая приземление, тип, формат, полноту и соответствие.
Использование выходных данных средства Измеряет, правильно ли агент интерпретирует и использует контекстно выходные данные средства в ответах и последующих вызовах.
Успех вызова средства Определяет, успешно ли выполняются все вызовы инструментов без технических сбоев.
Оценка качества (предварительная версия) Обеспечивает оценку качества в нескольких измерениях — релевантность, воздержание, полноту ответа, заземленность и охват контекста — в одном средстве оценки вместо выполнения отдельных оценщиков отдельно.

Дополнительные сведения см. в разделе оценщиков агентов.

Вычислители рубрик (предварительная версия)

Эвалуатор Purpose
Рубрика Оценивает ответ или многоэтапную беседу по пользовательским, взвешанным критериям, используя LLM в качестве судьи. Возвращает взвешенный средний показатель нормализованный до 0–1 с обоснованием для каждого измерения.

Дополнительные сведения см. в разделе "Вычислители рубрик".

Azure оценки OpenAI

Эвалуатор Purpose
Маркировщик моделей Классифицирует содержимое с помощью пользовательских рекомендаций и меток.
Проверка строк Выполняет гибкие проверки текста и сопоставление шаблонов.
Сходство текста Оценивает качество текста или определяет семантику закрытия.
Оценивание модели Создает числовые оценки (настраиваемый диапазон) для содержимого на основе пользовательских рекомендаций.

Дополнительные сведения см. в статье Azure OpenAI Graders.

Пользовательские вычислители (предварительная версия)

Помимо встроенных оценщиков, вы можете создавать пользовательские вычислители, адаптированные к конкретным критериям оценки. Пользовательские вычислители позволяют определять уникальную логику оценки, правила проверки и метрики качества, которые соответствуют вашим бизнес-требованиям и потребностям конкретного приложения.

Дополнительные сведения см. в разделе "Пользовательские оценщики".

Уровни оценки

Каждый вычислитель поддерживает определенные уровни оценки, указанные supported_evaluation_levels полем в каталоге оценщика:

Level Description
turn Вычисляет ответы отдельных агентов (по умолчанию)
conversation Оценивает все многоэтапные беседы

При создании запуска оценки задайте evaluation_level для соответствия поддерживаемым уровням оценщиков. Если опущено, значение по умолчанию равно turn.

Вычислители уровня беседы оценивают полное взаимодействие, а не отдельные повороты. Используйте их для измерения результатов, таких как удовлетворенность пользователей, завершение задач на нескольких шагах или согласованность диалога.

Important

Все вычислители в выполнении должны поддерживать указанный evaluation_levelпараметр. Вы не можете смешивать оценщики с несовместимыми уровнями в одном и том же выполнении оценки.

Объединение оценщиков

Для комплексной оценки качества объедините несколько оценщиков:

  • Приложения RAG: извлечение и заземление + релевантность и безопасность содержимого
  • Приложения агента: точность вызова средства + соблюдение задач и разрешение намерений + рубрик + безопасность содержимого
  • Приложения перевода: BLEU + МЕТЕОР + Fluency + Согласованность
  • Все приложения: добавление оценщиков рисков и безопасности (ненависть и несправедливость, сексуальность, насилие, Self-Harm) для ответственной практики ИИ