Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Вы можете использовать рубрики в двух различных режимах автоматизации тестов Copilot Agent Kit. Понимание различий между этими режимами необходимо для эффективного использования функции уточнения рубрик.
Режимы использования рубрик
Использование рубрики в Copilot Agent Kit работает в двух режимах:
| Аспект | Режим тестирования (уровень тестового случая) | Режим уточнения (уровень тестового запуска) |
|---|---|---|
| Purpose | Обычная автоматизация тестов с настраиваемой оценкой | Итеративное уточнение рубрики |
| Уровень применения | Индивидуальный тестовый случай | Весь тестовый запуск |
| Сценарий использования | Постоянное обеспечение качества | При уточнении качества рубрики |
| Рассуждение ИИ | Только балл (экономичный вариант) | Оценка + подробное обоснование (дороже) |
| Проходная оценка | Определяет прохождение или неуспех | Только информационный индикатор |
| Цель | Выявление ответов низкого качества | Минимизация несоответствия между ИИ и человеком |
Режим тестирования: рубрика уровня тестового случая
Режим тестирования разработан для регулярного использования усовершенствованной рубрики с целью автоматизации оценки тестовых случаев генеративного ответа.
Использование режима тестирования
Используйте критерии уровня тестового случая в Copilot Agent Kit когда:
- Вам требуется точная и надежная пользовательская рубрика, готовая для регулярного применения.
- Вы хотите автоматизировать проверку качества генеративных ответов в существующих тестовых наборах.
- Нужны индивидуальные критерии оценки, выходящие за рамки стандартной валидации в наборе Copilot Agent Kold.
Назначение рубрики на уровне тестового случая
Чтобы назначить рубрику на уровне тестового случая:
- Откройте или создайте тестовый случай, где Тип теста установлен в значение Генеративные ответы.
- Выберите рубрику из раскрывающегося списка Рубрика. Когда вы выбираете рубрику, поле Ожидаемый ответ/инструкции по валидации скрывается, так как рубрика заменяет стандартную логику валидации.
- Установите значение в поле Проходная оценка.
- Нажмите Сохранить.
Как работает рубрика на уровне тестового случая
Когда вы назначаете рубрику на уровне тестового случая, она делает следующее:
- Заменяет стандартную валидацию: оценщик ИИ на основе рубрик заменяет стандартную логику проверки генеративных ответов.
- Оценивает ответ: ИИ-судья оценивает ответ агента с использованием критериев рубрики.
- Присваивает оценку: на основе рубрики формируется оценка от 1 до 5.
-
Определяет, пройдена валидация или не пройдена:
- Пройдено: оценка равна или превышает проходной балл.
- Не пройдено: оценка ниже проходного балла.
- Нет подробного обоснования: чтобы снизить стоимость, указывается только оценка, а не обоснование.
Задание проходной оценки
Проходная оценка устанавливает минимальный приемлемый уровень качества:
| Проходная оценка | Description | Сценарий использования |
|---|---|---|
| 5 (по умолчанию) | Проходят только образцовые ответы | Вам требуются самые высокие стандарты качества |
| 4 | Проходят ответы хорошего качества и выше | Вы допускаете высококачественные ответы с допустимыми незначительными улучшениями |
| 3 | Проходят ответы приемлемого качества и выше | Вам требуются ответы, соответствующие минимальным функциональным требованиям |
| 2 | Проходят ответы низкого качества или выше | Вы устанавливаете очень низкую планку (редко рекомендуется) |
| 1 | Проходят все ответы, кроме самых плохих | Почти никогда не подходит для контроля качества |
В большинстве случаев контроля качества используйте проходные оценки 5 или 4 для поддержания высоких стандартов.
Назначение режима тестирования
Режим тестирования позволяет:
- Выявлять ответы низкого качества, требующие внимания.
- Автоматизировать регрессионное тестирование с едиными критериями оценки.
- Масштабировать контроль качества на множество тестовых случаев.
- Применять отраслевые стандарты, которые не может охватить универсальная валидация.
Режим уточнения: рубрики на уровне тестового запуска
Режим уточнения поддерживает итеративный процесс создания и улучшения рубрики путем сравнения оценки ИИ с человеческой оценкой.
Использование режима уточнения
Используйте рубрики для тестирования уровней в Copilot Agent Kit, когда вы:
- Создаете или уточняете рубрику.
- Хотите привести оценку ИИ в соответствие с человеческой оценкой.
- Хотите сравнить оценки ИИ и человека.
- Проводите итерации для улучшения качества рубрики.
Назначение рубрики на уровне тестового запуска
Чтобы назначить рубрику на уровне тестового запуска:
- Откройте или создайте тестовый запуск.
- Выберите рубрику из раскрывающегося списка Рубрика.
- Установите значение в поле Проходная оценка. По умолчанию используется значение 5 - (Образцовые). Это значение носит информационный характер только в режиме уточнения, поскольку цель — обеспечение согласованности, а не получение проходных оценок.
- Выберите Сохранить, затем выполните тестовый запуск.
Как работает рубрика на уровне тестового запуска
Когда вы назначаете рубрику на уровне тестового запуска, она:
- Применяется ко всем тестам с генеративными ответами: выбранная шкала оценивания переопределяет любые критерии, установленные на уровне отдельных тестов.
- Пропускает тесты, не связанные с генеративными ответами: тестовые случаи, не являющиеся генеративными ответами, полностью пропускаются.
-
Выполняет оценку ИИ с рассуждением: ИИ-судья предоставляет:
- Балл (1-5): оценку качества
- Обоснование: подробное объяснение оценки
- Обеспечивает рабочий процесс уточнения: результаты включают поля оценки человеком и индикаторы согласованности.
- Дороже: генерация подробных обоснований увеличивает затраты на обработку ИИ.
Интерпретация проходной оценки
В режиме уточнения проходная оценка носит исключительно информационный характер и не является целью.
- Назначение: проходной балл помогает определить, какие ответы не соответствуют вашему целевому порогу.
- Не цель: задача режима уточнения — минимизировать расхождения между оценками ИИ и человека, а не добиться того, чтобы все ответы проходили порог.
- Пример: если вы установили проходную оценку равной 5, а ИИ поставил 3, эта оценка показывает, что ответ не соответствует вашему стандарту. Однако важно то, оценит ли ответ человек тоже как 3 (согласование) или иначе (рассогласование).
Разница между режимами тестирования и уточнения
| Рубрика выбрана на уровне тестового случая | Рубрика выбрана на уровне тестового запуска | Рубрика не выбрана |
|---|---|---|
|
|
|
Поведенческие заметки
Вот основные особенности поведения, которые важно учитывать при использовании рубрик в разных режимах:
Иерархия рубрик и их переопределение
- Рубрика на уровне тестового запуска имеет приоритет над рубриками на уровне тестового случая: если вы выбираете рубрику на уровне тестового запуска, она применяется ко всем тестовым случаям с генеративными ответами, игнорируя все рубрики, назначенные отдельным тестовым случаям.
- Рубрики на уровне тестового случая независимы: если вы не выбираете рубрику на уровне тестового запуска, каждый тестовый случай использует свою собственную рубрику (при наличии) или стандартную валидацию (если рубрика не назначена).
Тесты без генеративных ответов
Когда вы выбираете рубрику на уровне тестового запуска:
- Тесты без генеративных ответов пропускаются: рубрики применяются только к тестовым случаям с генеративным ответом.
- Обоснование: рубрики предназначены для оценки генеративных ответов, а не других типов тестов, таких как действия, темы или поток разговора.
Когда рубрика выбирается на уровне тестового случая:
- Тесты без генеративных ответов выполняются как обычно: только конкретный тестовый случай типа "генеративный ответ" использует эту рубрику.
Инструкции по валидации и рубрики
- Взаимоисключение: вы не можете использовать оценивание по рубрике и инструкции по валидации одновременно.
- При выборе рубрики: поле Инструкции по валидации скрыто (на уровне тестового случая) или игнорируется (на уровне тестового запуска).
- Обоснование: рубрика полностью заменяет логику валидации.
Рекомендации по затратам
| Mode | Тип оценивания ИИ | Cost | Когда использовать |
|---|---|---|---|
| Режим тестирования (тестовый случай) | Только оценка | Ниже |
|
| Режим уточнения (тестовый запуск) | Оценка + обоснование | Выше |
|
Рабочий процесс: от уточнения до тестирования
Типичный рабочий процесс предполагает движение от уточнения к тестированию.
Фаза 1. Уточнение рубрики (уровень тестового запуска)
- Создайте начальную рубрику.
- Назначьте рубрику на уровне тестового запуска.
- Выполните тестовый запуск с оценкой ИИ и обоснованием.
- Выставьте оценки вручную.
- Сравните согласованность.
- Уточните рубрику, основываясь на рассогласованности.
- Повторяйте, пока согласованность не станет приемлемой.
Фаза 2. Регулярное тестирование (уровень тестового случая)
- Убедитесь, что рубрика уточнена и надежна.
- Назначьте рубрику на уровне тестового случая.
- Используйте рубрику при постоянной автоматизации тестирования.
- Оценка с помощью ИИ без обоснования (экономично).
- Тестовые случаи проходят или не проходят в зависимости от проходной оценки.
- Вернитесь к уточнению, если появятся проблемы с качеством.
Выбор правильного режима
Выбирайте между режимом тестирования (уровень тестового случая) и режимом уточнения (уровень тестового запуска) исходя из ваших текущих целей и того, на каком этапе жизненного цикла рубрики вы находитесь.
Использование режима тестирования (уровень тестового случая)
Используйте режим тестирования (уровень тестового случая), если:
- Ваша рубрика стабильна и демонстрирует высокий уровень согласованности.
- Вы проводите рутинную проверку качества.
- Вам нужна экономичная автоматизированная оценка.
- Ваша основная задача — получение результатов "пройдено" или "не пройдено".
Использование режима уточнения (уровень тестового запуска)
Используйте режим уточнения (уровень тестового запуска), если:
- Вы создаете новую рубрику.
- Вы улучшаете существующую рубрику.
- Вам нужно сравнить суждение ИИ и человека.
- Вам нужно понять рассуждение ИИ.
- Вашей основной целью является анализ согласованности.
Лучшие практики
Используйте следующие лучшие практики для эффективного применения рубрик как в режиме тестирования, так и в режиме уточнения:
- Начинайте с режима уточнения рубрики: всегда уточняйте рубрику, используя назначение на уровне тестового запуска, прежде чем развернуть ее на уровне тестового случая для регулярного тестирования.
- Используйте представительные тестовые случаи: для уточнения выбирайте тестовые случаи, отражающие разнообразие ответов, с которыми вы можете столкнуться на практике.
-
Устанавливайте реалистичные проходные баллы: не устанавливайте проходной балл равным 5, если только вам действительно не требуется образцовое качество для каждого ответа. Рассмотрите
- Оценка 5: имеет смысл резервировать для критически важных коммуникаций (отчеты по IR, резюме для руководства).
- Оценка 4: подходит для большинства деловых коммуникаций.
- Оценка 3: минимальное функциональное качество для внутренних инструментов.
- Контролируйте согласованность в динамике: даже уточненные рубрики могут "дрейфовать". Периодически переключайтесь в режим уточнения, чтобы проверить соответствие текущим ожиданиям.
-
Задокументируйте цель рубрики: добавьте в описании рубрики о следующем примечания:
- Предполагаемый сценарий использования
- Целевая проходная оценка
- Особые примечания, если они есть
- Тестируйте на уровне тестового запуска перед внесением изменений: перед назначением новой рубрики большому количеству тестовых случаев сначала выполните тестовый запуск с ней, чтобы убедиться, что она работает как ожидается.
Подробнее см. в разделе Лучшие практики и советы по совершенствованию рубрик.