Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Используйте облачные оценки для тестирования создаваемых приложений ИИ в масштабе без управления локальными вычислительными ресурсами. В этой статье настраивается общий клиент SDK и вы можете выбрать рабочий процесс для предварительной оценки или оценки рабочей среды.
Необходимые условия
Развертывание Azure OpenAI с моделью GPT, поддерживающей завершение чата, например,
gpt-5-mini.Роль пользователя Foundry в проекте Foundry.
Important
Роли RBAC в Foundry были недавно переименованы. Foundry User, Foundry Owner, Foundry Account Owner и Foundry Project Manager ранее назывались пользователь Azure AI, владелец Azure AI, владелец учетной записи Azure AI и руководитель проекта Azure AI. Пока новое название внедряется, вы всё ещё можете видеть прежние названия в некоторых местах. Идентификаторы ролей и основные разрешения при переименовании не меняются.
Кроме того, ваша учетная запись хранения для оценки данных.
Некоторые функции оценки имеют региональные ограничения. Перед началом работы просмотрите поддерживаемые регионы .
Настройка клиента SDK
Установите пакет SDK для вашего языка. Задайте следующие переменные общей среды:
-
AZURE_AI_PROJECT_ENDPOINT: конечная точка проекта Foundry, напримерhttps://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: развертывание модели, используемое оценщиками с ИИ-поддержкой. -
DATASET_NAMEиDATASET_VERSION: необязательные значения для повторно используемых наборов данных.
Выполните аутентификацию с помощью DefaultAzureCredential, создайте клиент проекта и получите клиент OpenAI, используемый API оценивания.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Чтобы использовать модель, подключенную через административные подключения, в качестве целевой модели, модели-судьи или симулятора беседы, см. Использование моделей, подключенных через административные подключения, в облачных оценках.
Общие сведения о рабочем процессе оценки
Оценка облака состоит из трех этапов:
- Определите структуру данных и оценщики, которые её оценивают.
- Создайте оценку с помощью
openai_client.evals.create(). - Запустите выполнение с помощью
openai_client.evals.runs.create(), опрашивайте статус, пока оно не завершится, и получите результаты с оценками.
Результаты оценки облака хранятся в проекте Foundry. Их можно получить через пакет SDK, просмотреть их на портале или перенаправить их в Application Insights при подключении.
Выбор оценщиков
Оценщики привязываются к полям в ваших данных через сопоставление столбцов. Рабочие процессы набора данных предоставляют доступ к полям элементов, а рабочие процессы, генерируемые целевым объектом, также предоставляют доступ к выходным данным модели или агента через схему образца.
Перед настройкой критериев тестирования просмотрите встроенные вычислители и пользовательские вычислители .
Выберите начальную точку
| Единица оценки | Начальная точка | Рабочий процесс |
|---|---|---|
| Отдельный поворот | У вас есть данные теста JSONL или CSV с запросом и ответом. | Оценка наборов данных ответа на запросы |
| Отдельный поворот | У вас есть запросы и требуется, чтобы модель или агент создавали ответы. | Оценка ответов модели и агента |
| Отдельный поворот | Вы сохранили ответы или трассировки отдельных взаимодействий с развернутой моделью или агентом. | Оценка развернутой модели и взаимодействия агента |
| Отдельный поворот | Необходимо создать искусственные запросы. | Создание искусственных запросов |
| Завершение беседы | У вас есть набор данных полных бесед. | Оценка наборов данных беседы |
| Завершение беседы | У вас есть трассировки, которые фиксируют полные диалоги с развернутой моделью или агентом. | Оцените развернутую модель и разговоры агентов |
| Завершение беседы | Необходимо создать и оценить имитированные беседы агента. | Имитация бесед агентов |
| Любая единица оценки | Вам нужно опрашивать, интерпретировать, отменять запуск или устранять неполадки при его выполнении. | Получение результатов оценки |
Для проверки безопасности на устойчивость к атакам используйте тестирование ИИ методом «красной команды». Сведения о создании автономного набора данных см. в статье "Создание искусственного набора данных оценки".