Уточнение рубрик в Copilot Agent Kit

Уточнение рубрик в Copilot Agent Kit помогает вам создавать, тестировать и итеративно улучшать повторно используемые стандарты оценки (рубрики) для ответов, сгенерированных ИИ. Эта функция помогает гарантировать, что оценка ответов вашего агента искусственным интеллектом соответствует человеческому мнению и организационным стандартам качества.

Оценка агентов и ИИ-судьи

ИИ-судья — это большая языковая модель (LLM), которая оценивает качество ответов вашего агента, применяя определяемый вами критерий оценивания. ИИ-судья имитирует действия эксперта-оценщика при оценке качества ответов, но делает это автоматически и в большом масштабе.

Точность оценки полностью зависит от того, насколько хорошо критерий оценивания отражает ваши стандарты качества. Без систематизированного подхода к уточнению критериев оценки организациям сложно:

  • Определять четкие, специфичные для каждой области стандарты оценки
  • Сопоставлять оценку ИИ с человеческими ожиданиями
  • Определять, где инструкции критериев оценивания не отражают предусмотренные критерии качества
  • Укреплять доверие к результатам оценки ИИ для критически важных корпоративных вариантов использования

Уточнение критериев оценивания помогает решить эти проблемы благодаря итеративному рабочему процессу, который позволяет привести оценки ИИ в соответствие с оценками человека.

Benefits

  • Повторно используемые стандарты оценки: определите критерии оценивания один раз и повторно используйте их в нескольких агентах и тестовых запусках.
  • Согласование с оценками человека: систематически минимизируйте несоответствие между ИИ и экспертами-оценщиками.
  • Обеспечение качества: создание долговечных корпоративных активов, которые воплощают стандарты качества организации.
  • Уверенность в оценке ИИ: формирование доверия к автоматизированной оценке благодаря прозрачному, итеративному уточнению.

Критерии оценивания как стандарты оценки

Критерий оценивания — это структурированный набор инструкций по оценке на естественном языке, которые ИИ-судья использует для оценки качества ответа агента. Критерий оценивания включает в себя:

  • Описание того, каким должен быть хороший ответ
  • Определения оценок по 5-балльной шкале (например, 5 — образцовый, 1 — требует доработки)
  • Необязательные хорошие и плохие примеры, иллюстрирующие стандарты качества

Оценка ИИ и оценка человеком

  • Оценка ИИ: ИИ-судья (LLM) использует критерии оценивания для оценки ответов. Он выставляет оценку (1–5) и предоставляет обоснование своей оценки.
  • Оценка человеком: эксперт-оценщик (создатель) оценивает те же ответы. Он дает свою оценку (1-5) и ее обоснование.
  • Сравнение: сравнивая эти две оценки, вы определяете, где требует уточнить критерии оценивания.

Согласованность и несогласованность

  • Согласованность: когда оценка ИИ соответствует оценке человеком, критерий оценивания работает должным образом.
  • Несогласованность: когда оценка ИИ отличается от оценки человеком, критерий оценивания требует доработки.

Процесс итеративного уточнения

Уточнение критериев оценивания — это итеративный процесс. Выполните следующие действия:

  1. Определите начальный критерий оценивания с критериями оценки.
  2. Проведите тесты с использованием критерия оценивания для создания оценок ИИ.
  3. Проверьте ответы агентов и предоставьте оценку человеком.
  4. Сравните оценку ИИ и оценку человеком, чтобы выявить несогласованность.
  5. Отметьте удачные и неудачные примеры, чтобы направлять процесс уточнения критерия оценивания.
  6. Уточните критерий оценивания с помощью анализа ИИ, выявляющего закономерности несогласованности.
  7. Повторите тесты с обновленным критерием оценивания.
  8. Повторяйте, пока согласованность не станет приемлемой.

Основная цель

Цель уточнения критерия оценивания — не стремиться к тому, чтобы все ответы были оценены на 5 (Образцовый). Цель — минимизировать разницу между оценкой ИИ и экспертов-оценщиков.

Оптимизация ответов — фактически улучшение качества ответов агента — происходит непосредственно в Copilot Studio. Уточнение критериев оценивания направлено исключительно на то, чтобы критерии оценивания точно отражали человеческую оценку, благодаря чему можно доверять результатам автоматизированной оценки.

Режимы использования рубрик

Рубрики в Copilot Agent Kit служат двум различным целям:

  • Режим тестирования (уровень тестового случая)

    • Цель: регулярная автоматизация тестов с использованием пользовательских критериев оценки.
    • Конфигурация: назначайте критерий оценивания на уровне каждого тестового случая.
    • Вариант использования: постоянное обеспечение качества для тестовых случаев с генеративными ответами.
    • Пройдено/не пройдено: оценка больше или равна проходному баллу (по умолчанию: 5).
  • Режим уточнения (уровень тестового запуска)

    • Цель: поэтапно уточнять и совершенствовать сам критерий оценивания.
    • Конфигурация: назначить критерий оценивания на уровне тестового запуска.
    • Вариант использования: отдельный рабочий процесс для уточнения критериев оценивания.
      • Пройдено/не пройдено: проходная оценка используется только для информации. Цель — согласованность, а не получение проходных оценок.
    • Ключевое отличие: ИИ предоставляет подробное обоснование (более дорогое) для анализа.

Кому следует использовать уточнение критериев оценивания?

Функция уточнения критериев оценивания идеально подходит для следующих сущностей:

  • Команды по обеспечению качества: устанавливают единые стандарты оценки для всех агентов.
  • Создатели: создают надежные автоматизированные тесты, используя генеративные ответы.
  • Корпоративные организации: определяют отраслевые и организационные стандарты качества.
  • Для всех, кому важно доверять результатам оценки ИИ: команды, которым нужна уверенность в автоматизированной оценке для критически важных задач.

Что входит в этот выпуск?

  • Полное управление критериями оценивания (создание, просмотр, редактирование, дублирование, удаление).
  • Назначение критериев оценивания на уровне тестового запуска (для уточнения) и тестового случая (для тестирования).
  • Выбор проходного балла с четким разграничением между режимами тестирования и уточнения.
  • Два режима уточнения: стандартный (оценки ИИ скрыты для предотвращения предвзятости) и полный (оценки ИИ видимы).
  • Подробное представление для оценки длинных ответов.
  • Возможность отмечать тестовые случаи как хорошие или плохие примеры.
  • Уточнение критериев оценки с использованием ИИ на основе анализа согласованности оценок.
  • Параметры "Сохранить" и "Сохранить как" для сохранения версий критериев оценивания.
  • Поддержка рабочего процесса итеративного уточнения.

Что запланировано в будущих выпусках

  • Автоматическая генерация тестовых наборов из расшифровок разговоров.
  • Улучшенная диагностика и аналитика.
  • Управление критериями оценивания (утверждение, жизненный цикл, публикация).
  • Улучшенный выделенный интерфейс уточнения критериев оценивания.

Get started

Чтобы начать уточнение критериев оценивания:

  1. Создайте критерий оценивания, определяющую ваши стандарты качества.
  2. Подготовьте тестовые случаи с типами тестов "Генеративный ответ".
  3. Настройте тестовый запуск для уточнения критериев оценивания.
  4. Следуйте рабочему процессу уточнения критериев оценивания, чтобы привести ИИ в соответствие с оценкой человеком.

Следующий шаг