Общие сведения об оценке облака с помощью пакета SDK для Microsoft Foundry

Используйте облачные оценки для тестирования создаваемых приложений ИИ в масштабе без управления локальными вычислительными ресурсами. В этой статье настраивается общий клиент SDK и вы можете выбрать рабочий процесс для предварительной оценки или оценки рабочей среды.

Необходимые условия

  • Проект Foundry.

  • Развертывание Azure OpenAI с моделью GPT, поддерживающей завершение чата, например, gpt-5-mini.

  • Роль пользователя Foundry в проекте Foundry.

    Important

    Роли RBAC в Foundry были недавно переименованы. Foundry User, Foundry Owner, Foundry Account Owner и Foundry Project Manager ранее назывались пользователь Azure AI, владелец Azure AI, владелец учетной записи Azure AI и руководитель проекта Azure AI. Пока новое название внедряется, вы всё ещё можете видеть прежние названия в некоторых местах. Идентификаторы ролей и основные разрешения при переименовании не меняются.

  • Кроме того, ваша учетная запись хранения для оценки данных.

Некоторые функции оценки имеют региональные ограничения. Перед началом работы просмотрите поддерживаемые регионы .

Настройка клиента SDK

Установите пакет SDK для вашего языка. Задайте следующие переменные общей среды:

  • AZURE_AI_PROJECT_ENDPOINT: конечная точка проекта Foundry, например https://<account_name>.services.ai.azure.com/api/projects/<project_name>.
  • AZURE_AI_MODEL_DEPLOYMENT_NAME: развертывание модели, используемое оценщиками с ИИ-поддержкой.
  • DATASET_NAME и DATASET_VERSION: необязательные значения для повторно используемых наборов данных.

Выполните аутентификацию с помощью DefaultAzureCredential, создайте клиент проекта и получите клиент OpenAI, используемый API оценивания.

pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
    CreateEvalJSONLRunDataSourceParam,
    SourceFileContent,
    SourceFileContentContent,
    SourceFileID,
)

endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
    "AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")

project_client = AIProjectClient(
    endpoint=endpoint,
    credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()

Чтобы использовать модель, подключенную через административные подключения, в качестве целевой модели, модели-судьи или симулятора беседы, см. Использование моделей, подключенных через административные подключения, в облачных оценках.

Общие сведения о рабочем процессе оценки

Оценка облака состоит из трех этапов:

  1. Определите структуру данных и оценщики, которые её оценивают.
  2. Создайте оценку с помощью openai_client.evals.create().
  3. Запустите выполнение с помощью openai_client.evals.runs.create(), опрашивайте статус, пока оно не завершится, и получите результаты с оценками.

Результаты оценки облака хранятся в проекте Foundry. Их можно получить через пакет SDK, просмотреть их на портале или перенаправить их в Application Insights при подключении.

Выбор оценщиков

Оценщики привязываются к полям в ваших данных через сопоставление столбцов. Рабочие процессы набора данных предоставляют доступ к полям элементов, а рабочие процессы, генерируемые целевым объектом, также предоставляют доступ к выходным данным модели или агента через схему образца.

Перед настройкой критериев тестирования просмотрите встроенные вычислители и пользовательские вычислители .

Выберите начальную точку

Единица оценки Начальная точка Рабочий процесс
Отдельный поворот У вас есть данные теста JSONL или CSV с запросом и ответом. Оценка наборов данных ответа на запросы
Отдельный поворот У вас есть запросы и требуется, чтобы модель или агент создавали ответы. Оценка ответов модели и агента
Отдельный поворот Вы сохранили ответы или трассировки отдельных взаимодействий с развернутой моделью или агентом. Оценка развернутой модели и взаимодействия агента
Отдельный поворот Необходимо создать искусственные запросы. Создание искусственных запросов
Завершение беседы У вас есть набор данных полных бесед. Оценка наборов данных беседы
Завершение беседы У вас есть трассировки, которые фиксируют полные диалоги с развернутой моделью или агентом. Оцените развернутую модель и разговоры агентов
Завершение беседы Необходимо создать и оценить имитированные беседы агента. Имитация бесед агентов
Любая единица оценки Вам нужно опрашивать, интерпретировать, отменять запуск или устранять неполадки при его выполнении. Получение результатов оценки

Для проверки безопасности на устойчивость к атакам используйте тестирование ИИ методом «красной команды». Сведения о создании автономного набора данных см. в статье "Создание искусственного набора данных оценки".