Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Уточнение рубрик в Copilot Agent Kit помогает вам создавать, тестировать и итеративно улучшать повторно используемые стандарты оценки (рубрики) для ответов, сгенерированных ИИ. Эта функция помогает гарантировать, что оценка ответов вашего агента искусственным интеллектом соответствует человеческому мнению и организационным стандартам качества.
Оценка агентов и ИИ-судьи
ИИ-судья — это большая языковая модель (LLM), которая оценивает качество ответов вашего агента, применяя определяемый вами критерий оценивания. ИИ-судья имитирует действия эксперта-оценщика при оценке качества ответов, но делает это автоматически и в большом масштабе.
Точность оценки полностью зависит от того, насколько хорошо критерий оценивания отражает ваши стандарты качества. Без систематизированного подхода к уточнению критериев оценки организациям сложно:
- Определять четкие, специфичные для каждой области стандарты оценки
- Сопоставлять оценку ИИ с человеческими ожиданиями
- Определять, где инструкции критериев оценивания не отражают предусмотренные критерии качества
- Укреплять доверие к результатам оценки ИИ для критически важных корпоративных вариантов использования
Уточнение критериев оценивания помогает решить эти проблемы благодаря итеративному рабочему процессу, который позволяет привести оценки ИИ в соответствие с оценками человека.
Benefits
- Повторно используемые стандарты оценки: определите критерии оценивания один раз и повторно используйте их в нескольких агентах и тестовых запусках.
- Согласование с оценками человека: систематически минимизируйте несоответствие между ИИ и экспертами-оценщиками.
- Обеспечение качества: создание долговечных корпоративных активов, которые воплощают стандарты качества организации.
- Уверенность в оценке ИИ: формирование доверия к автоматизированной оценке благодаря прозрачному, итеративному уточнению.
Критерии оценивания как стандарты оценки
Критерий оценивания — это структурированный набор инструкций по оценке на естественном языке, которые ИИ-судья использует для оценки качества ответа агента. Критерий оценивания включает в себя:
- Описание того, каким должен быть хороший ответ
- Определения оценок по 5-балльной шкале (например, 5 — образцовый, 1 — требует доработки)
- Необязательные хорошие и плохие примеры, иллюстрирующие стандарты качества
Оценка ИИ и оценка человеком
- Оценка ИИ: ИИ-судья (LLM) использует критерии оценивания для оценки ответов. Он выставляет оценку (1–5) и предоставляет обоснование своей оценки.
- Оценка человеком: эксперт-оценщик (создатель) оценивает те же ответы. Он дает свою оценку (1-5) и ее обоснование.
- Сравнение: сравнивая эти две оценки, вы определяете, где требует уточнить критерии оценивания.
Согласованность и несогласованность
- Согласованность: когда оценка ИИ соответствует оценке человеком, критерий оценивания работает должным образом.
- Несогласованность: когда оценка ИИ отличается от оценки человеком, критерий оценивания требует доработки.
Процесс итеративного уточнения
Уточнение критериев оценивания — это итеративный процесс. Выполните следующие действия:
- Определите начальный критерий оценивания с критериями оценки.
- Проведите тесты с использованием критерия оценивания для создания оценок ИИ.
- Проверьте ответы агентов и предоставьте оценку человеком.
- Сравните оценку ИИ и оценку человеком, чтобы выявить несогласованность.
- Отметьте удачные и неудачные примеры, чтобы направлять процесс уточнения критерия оценивания.
- Уточните критерий оценивания с помощью анализа ИИ, выявляющего закономерности несогласованности.
- Повторите тесты с обновленным критерием оценивания.
- Повторяйте, пока согласованность не станет приемлемой.
Основная цель
Цель уточнения критерия оценивания — не стремиться к тому, чтобы все ответы были оценены на 5 (Образцовый). Цель — минимизировать разницу между оценкой ИИ и экспертов-оценщиков.
Оптимизация ответов — фактически улучшение качества ответов агента — происходит непосредственно в Copilot Studio. Уточнение критериев оценивания направлено исключительно на то, чтобы критерии оценивания точно отражали человеческую оценку, благодаря чему можно доверять результатам автоматизированной оценки.
Режимы использования рубрик
Рубрики в Copilot Agent Kit служат двум различным целям:
Режим тестирования (уровень тестового случая)
- Цель: регулярная автоматизация тестов с использованием пользовательских критериев оценки.
- Конфигурация: назначайте критерий оценивания на уровне каждого тестового случая.
- Вариант использования: постоянное обеспечение качества для тестовых случаев с генеративными ответами.
- Пройдено/не пройдено: оценка больше или равна проходному баллу (по умолчанию: 5).
Режим уточнения (уровень тестового запуска)
- Цель: поэтапно уточнять и совершенствовать сам критерий оценивания.
- Конфигурация: назначить критерий оценивания на уровне тестового запуска.
-
Вариант использования: отдельный рабочий процесс для уточнения критериев оценивания.
- Пройдено/не пройдено: проходная оценка используется только для информации. Цель — согласованность, а не получение проходных оценок.
- Ключевое отличие: ИИ предоставляет подробное обоснование (более дорогое) для анализа.
Кому следует использовать уточнение критериев оценивания?
Функция уточнения критериев оценивания идеально подходит для следующих сущностей:
- Команды по обеспечению качества: устанавливают единые стандарты оценки для всех агентов.
- Создатели: создают надежные автоматизированные тесты, используя генеративные ответы.
- Корпоративные организации: определяют отраслевые и организационные стандарты качества.
- Для всех, кому важно доверять результатам оценки ИИ: команды, которым нужна уверенность в автоматизированной оценке для критически важных задач.
Что входит в этот выпуск?
- Полное управление критериями оценивания (создание, просмотр, редактирование, дублирование, удаление).
- Назначение критериев оценивания на уровне тестового запуска (для уточнения) и тестового случая (для тестирования).
- Выбор проходного балла с четким разграничением между режимами тестирования и уточнения.
- Два режима уточнения: стандартный (оценки ИИ скрыты для предотвращения предвзятости) и полный (оценки ИИ видимы).
- Подробное представление для оценки длинных ответов.
- Возможность отмечать тестовые случаи как хорошие или плохие примеры.
- Уточнение критериев оценки с использованием ИИ на основе анализа согласованности оценок.
- Параметры "Сохранить" и "Сохранить как" для сохранения версий критериев оценивания.
- Поддержка рабочего процесса итеративного уточнения.
Что запланировано в будущих выпусках
- Автоматическая генерация тестовых наборов из расшифровок разговоров.
- Улучшенная диагностика и аналитика.
- Управление критериями оценивания (утверждение, жизненный цикл, публикация).
- Улучшенный выделенный интерфейс уточнения критериев оценивания.
Get started
Чтобы начать уточнение критериев оценивания:
- Создайте критерий оценивания, определяющую ваши стандарты качества.
- Подготовьте тестовые случаи с типами тестов "Генеративный ответ".
- Настройте тестовый запуск для уточнения критериев оценивания.
- Следуйте рабочему процессу уточнения критериев оценивания, чтобы привести ИИ в соответствие с оценкой человеком.