Об оценке агентов

Note

Функции, описанные в этой статье, питаются стандартным жгутом, который использует опции выставления счетов, описанные в разделе «Лицензирование для агентов, работающих на стандартном жгуте». Узнайте, как получить доступ к стандартным функциям в стандартных агентах и потоках агентов доступа.

По мере того как агенты ИИ начинают играть ключевые роли в бизнес-процессах, необходимость в надежном и повторяемом тестировании становится важной. Оценка агента позволяет создавать тесты, которые имитируют реальные сценарии для вашего агента. Эти тесты охватывают больше вопросов и диалогов быстрее, чем ручное индивидуальное тестирование. Затем вы можете измерить точность, релевантность и качество ответов вашего агента в ходе взаимодействия, исходя из информации, к которой агент имеет доступ. Используя результаты тестового набора, вы можете оптимизировать поведение вашего агента и проверить, что он соответствует требованиям вашего бизнеса и требованиям к качеству.

Зачем использовать автоматизированное тестирование?

Оценка агента обеспечивает автоматизированное, структурированное тестирование. Это помогает выявлять проблемы на ранних этапах, снижает риск ошибочных ответов и поддерживает качество по мере развития агента. Этот процесс обеспечивает автоматизированную, повторяемую форму контроля качества при тестировании агента. Он гарантирует, что агент соответствует стандартам точности и надежности вашего бизнеса и обеспечивает прозрачность того, как он работает. У него другие сильные стороны, чем у тестирования через тестовый чат.

Вы запускаете оценки и просматриваете результаты с помощью интерфейса Copilot Studio, через интерфейсы REST API Power Platform или добавляя действия в инструменты, потоки или Power Automate.

Оценка агента измеряет корректность и эффективность, а не этику ИИ или проблемы с безопасностью. Агент может пройти все оценочные тесты, но все равно, например, дать неподходящий ответ на вопрос. Клиентам по-прежнему следует использовать проверки для ответственного использования ИИ и фильтры безопасности контента; оценки не заменяют эти проверки и фильтры.

Ограничения облака сообщества для государственных организаций

Оценка агентов в облаке сообщества для государственных организаций (GCC) имеет следующие ограничения:

  • Создатели не могут добавить пользовательский профиль в свои тестовые наборы. Однако создатели все еще могут проводить оценки без профиля пользователя.

  • Создатели не могут использовать метод проверки сходства для оценок. Все остальные методы тестирования доступны.

Как работает оценка агентов

Copilot Studio использует тестовый случай для каждой оценки агента. Тестовый случай — это одно взаимодействие, которое моделирует, как пользователь будет взаимодействовать с вашим агентом. Взаимодействие может состоять из одного вопроса или целого разговора.

Тестовый случай также может включать ответ, который вы ожидаете от агента. Рассмотрим пример.

  • Вопрос: Каковы ваши часы работы?

  • Ожидаемый ответ: Мы открыты с 09:00 до 17:00 с понедельника по пятницу.

Используя оценку агента, вы можете создать, импортировать или вручную создать группу тестовых случаев. Эта группа тестовых случаев называется тестовым набором. Тестовый набор позволяет:

  • Выполняйте несколько тестовых случаев, охватывающих широкий спектр возможностей, одновременно, вместо того чтобы задавать агенту по одному вопросу за раз.

  • Анализируйте работу вашего агента с помощью легко воспринимаемого суммарного результата и детально изучайте отдельные тестовые случаи.

  • Тестируйте изменения в своих агентах, используя тот же тестовый набор, чтобы иметь объективный стандарт для измерения и сравнения изменений в производительности.

  • Быстро создавайте новые тестовые наборы или модифицируйте существующие, чтобы учитывать изменяющиеся возможности или требования к агентам.

Каждый тестовый набор может оценивать ваш агент с помощью нескольких методов тестирования одновременно.

Вы также можете выбрать профиль пользователя, который будет играть роль стимулируемого пользователя. Агент может быть настроен реагировать на разных пользователей по-разному или предоставлять доступ к ресурсам по-разному.

Когда вы выбираете тестовый набор и запускаете оценку агента, Copilot Studio отправляет вопросы из тестовых случаев, записывает ответы агента, сравнивает эти ответы с ожидаемыми или стандартом качества и назначает балл каждому тестовому случаю. Вы также можете просматривать подробные сведения, расшифровку и карту действий для каждого тестового случая, а также ресурсы, которые ваш агент использовал для создания ответа.

Создание комплексной стратегии оценки

Прежде чем проводить оценку, определите, что означает успех для вашего агента и какие сценарии наиболее важны для ваших бизнес-результатов. Четкая стратегия помогает выбрать правильные методы тестирования, расставить приоритеты для наиболее важных тестовых случаев и интерпретировать результаты в нужном контексте.

Интегрируйте оценки в автоматизированные процессы

Оценка агентов поддерживает автоматизацию, чтобы создатели могли проводить ее без ручного вмешательства. Используя REST API или соединители Power Platform, вы можете программно запускать процессы оценки и интегрировать тестирование в автоматизированные рабочие процессы, такие как конвейеры непрерывной интеграции и непрерывного развертывания (CI/CD). Этот подход позволяет масштабно запускать тестовые наборы и проверять поведение агента по мере внесения изменений, не требуя ручного запуска в Copilot Studio.

Сравнение тестового чата и оценки агента

Каждый метод тестирования позволяет получить различные сведения о качествах и поведении вашего агента:

Тестовый чат:

  • Обрабатывает и отвечает на один вопрос за раз. Трудно многократно повторять одни и те же тесты.

  • Позволяет протестировать полноценный сеанс с несколькими сообщениями.

  • Позволяет взаимодействовать с агентом в роли пользователя через интерфейс чата.

Оценка агента:

  • Можно создавать и запускать несколько тестовых случаев одновременно, используя тестовый набор. Вы можете повторять тесты, используя один и тот же тестовый набор.

  • Можно протестировать один вопрос и один ответ на каждый тестовый случай или одну беседу на тестовый случай. Однако у вас меньше контроля над разговорами, чем при использовании тестового чата.

  • Выбирайте разные профили пользователей, чтобы имитировать различных пользователей без необходимости выполнять взаимодействия вручную.

Когда вы тестируете агент, используйте и тестовый чат, и оценку агента для получения полной картины вашего агента.

Поддержка языков при оценке агентов

Агенты Copilot Studio поддерживают различные языки. Если вы настроите агент на поддержку нескольких языков, вы сможете выбрать язык для оценки.

Для многоязычного агента следующие компоненты оценки имеют особенности поведения:

Создание запросов

Язык по умолчанию — это язык, который вы используете при вводе данных оценки. Выберите язык, на котором будет проводиться оценка. Когда вы запускаете дополнительные оценки, результаты выводятся на том же языке, что и входные данные.

Выполнение оценщика

При оценке многоязычного агента метод сравнения смысла сравнивает ожидаемый ответ с ответом агента. Если возникает проблема, связанная с несколькими языками, система обнаруживает несоответствие, оценщик сравнения смысла отклоняет ответ, и ответ помечается как неудачный из-за несоответствия языков.

Результаты объяснения

В многоэтапных беседах с многоязычным агентом агент предоставляет объяснения на том же языке, который он использует в своих ответах.

Limitations

В настоящее время оценка агентов не поддерживает агенты данных Fabric.