Развертывание потока в онлайн-конечной точке для вывода в режиме реального времени с помощью CLI

Предупреждение

Prompt flow в Microsoft Foundry и Машинное обучение Azure будет выведен из эксплуатации 20 апреля 2027 года. Prompt flow больше не рекомендуется для новой разработки. Перенесите существующие приложения и развертывания Prompt flow в Microsoft Agent Framework не позднее 20 апреля 2027 г.

Контейнерные образы Prompt flow больше не обновляются, включая обновления безопасности и обновления пакетов. Это относится к образам среды выполнения Prompt flow, включая promptflow-runtime, promptflow-runtime-stable и promptflow-python.

После 20 апреля 2027 года Prompt flow, включая веб-интерфейс разработки в Microsoft Foundry и Машинное обучение Azure, расширения для VS Code и связанные образы контейнеров Prompt flow, больше не будут поддерживаться и будут недоступны.

Если ваше приложение зависит от развертываний Prompt flow или образов среды выполнения, запланируйте перенос этих рабочих нагрузок на поддерживаемые альтернативы, такие как Microsoft Agent Framework, до даты прекращения поддержки. Рекомендации по миграции см. в руководстве по миграции Prompt flow и примерах кода для миграции.

В этой статье вы узнаете, как развернуть поток в управляемой сетевой конечной точке или веб-конечной точке Kubernetes для использования в режиме реального времени с помощью интерфейса командной строки Машинное обучение Azure версии 2.

Прежде чем начать, убедитесь, что вы правильно протестируете поток и убедитесь, что он готов к развертыванию в рабочей среде. Дополнительные сведения о тестировании потока см. в статье "Тестирование потока". После тестирования потока вы узнаете, как создать управляемую онлайн-конечную точку и развертывание, а также как использовать эту конечную точку для выполнения логического вывода в режиме реального времени.

  • В этой статье описывается использование интерфейса командной строки.
  • Пакет SDK Python не рассматривается в этой статье. Вместо этого см. пример записной книжки GitHub. Чтобы использовать пакет SDK Python, необходимо использовать пакет SDK Python версии 2 для Машинное обучение Azure. Дополнительные сведения см. в статье Установка пакета SDK Python версии 2 для Машинное обучение Azure.

Важно

Элементы, помеченные (предварительная версия) в этой статье, в настоящее время находятся в общедоступной предварительной версии. Предварительная версия предоставляется без соглашения об уровне обслуживания и не рекомендуется для рабочих нагрузок. Некоторые функции могут не поддерживаться или могут иметь ограниченные возможности. Дополнительные сведения см. в разделе Supplemental Terms of Use for Microsoft Azure Previews.

Необходимые условия

  • CLI Azure и расширение Машинное обучение Azure для CLI Azure. Дополнительные сведения см. в разделе "Установка,настройка" и использование интерфейса командной строки (версия 2).
  • Рабочая область Машинное обучение Azure. Если у вас его нет, выполните действия, описанные в статье Краткое руководство: создание ресурсов рабочей области для его создания.
  • Ролевое управление доступом Azure (Azure RBAC) используется для предоставления доступа к операциям в Машинное обучение Azure. Чтобы выполнить действия, описанные в этой статье, учетная запись пользователя должна иметь роль владельца или сотрудника для рабочей области Машинное обучение Azure или настраиваемую роль, разрешающую "Microsoft.MachineLearningServices/workspaces/onlineEndpoints/". Если вы используете Студию для создания интерактивных конечных точек и управления ими, а также развертываниями, вам потребуется дополнительное разрешение "Microsoft.Resources/deployments/write" от владельца группы ресурсов. Дополнительные сведения см. в разделе Манаж доступа к рабочей области Машинное обучение Azure.

Примечание

Управляемая конечная точка в Сети поддерживает только управляемую виртуальную сеть. Если ваша рабочая область находится в пользовательской виртуальной сети, вы можете развернуть на онлайн-эндпоинте Kubernetes или развернуть на других платформах, таких как Docker.

Выделение квот виртуальной машины для развертывания

Для управляемых сетевых конечных точек Машинное обучение Azure резервирует 20% вычислительных ресурсов для выполнения обновлений. Таким образом, если вы запрашиваете заданное количество экземпляров в развертывании, у вас должна быть квота для ceil(1.2 * number of instances requested for deployment) * number of cores for the VM SKU, чтобы избежать ошибки. Например, если вы запрашиваете 10 экземпляров виртуальной машины Standard_DS3_v2 (которая поставляется с четырьмя ядрами) в развертывании, у вас должна быть квота на 48 ядер (12 экземпляров четырех ядер). Чтобы просмотреть использование и запросить увеличение квоты, см. Просмотр использования и квот на портале Azure.

Подготовьте поток к развертыванию

Каждый поток содержит папку, содержащую коды, запросы, определение и другие артефакты потока. При разработке потока с помощью пользовательского интерфейса можно скачать папку потока на странице сведений о потоке. Если вы разрабатываете поток с помощью интерфейса командной строки или пакета SDK, у вас уже есть папка потока.

В этой статье используется пример потока "basic-chat" для развертывания в управляемую сетевую конечную точку Машинное обучение Azure.

Важно

Если вы используете additional_includes в потоке, сначала используйте pf flow build --source <path-to-flow> --output <output-path> --format docker для получения разрешенной версии папки потока.

Настройка рабочей области по умолчанию

Используйте следующие команды, чтобы задать рабочую область по умолчанию и группу ресурсов для интерфейса командной строки.

az account set --subscription <subscription ID>
az configure --defaults workspace=<Azure Machine Learning workspace name> group=<resource group>

Регистрация потока в качестве модели (необязательно)

При оперативном развертывании можно либо использовать зарегистрированную модель, либо указать путь к модели (откуда следует загрузить файлы модели) непосредственно в определении развертывания. Зарегистрируйте модель и укажите имя и версию модели в определении развертывания. Используйте форму model:<model_name>:<version>.

В следующем примере показано определение модели для потока чата.

Примечание

Если ваш поток не является потоком чата, вам не нужно добавлять эти теги properties.

$schema: https://azuremlschemas.azureedge.net/latest/model.schema.json
name: basic-chat-model
path: ../../../../examples/flows/chat/basic-chat
description: register basic chat flow folder as a custom model
properties:
  # In Azure Machine Learning studio, the endpoint Test tab uses this property to identify a prompt flow
  azureml.promptflow.source_flow_id: basic-chat
  
  # Following are properties only for chat flow 
  # endpoint detail UI Test tab needs this property to know it's a chat flow
  azureml.promptflow.mode: chat
  # endpoint detail UI Test tab needs this property to know which is the input column for chat flow
  azureml.promptflow.chat_input: question
  # endpoint detail UI Test tab needs this property to know which is the output column for chat flow
  azureml.promptflow.chat_output: answer

Используйте az ml model create --file model.yaml, чтобы зарегистрировать модель в рабочей области.

Определение конечной точки

Чтобы определить конечную точку, укажите следующие значения:

  • Endpoint name: название конечной точки. Он должен быть уникальным в регионе Azure. Дополнительные сведения о правилах именования см. в разделе "Ограничения конечной точки".
  • Режим проверки подлинности: метод проверки подлинности для конечной точки. Выберите аутентификацию на основе ключей или аутентификацию Машинное обучение Azure на основе токенов. Срок действия ключа не истекает, но срок действия маркера истекает. Дополнительные сведения о проверке подлинности см. в статье "Аутентификация в сети".
  • При необходимости добавьте описание и теги в конечную точку.
  • Если вы хотите развернуть в кластере Kubernetes (AKS или кластер с поддержкой Arc), присоединенном к рабочей области, можно развернуть поток как конечную точку Kubernetes в сети.

В следующем примере показано определение эндпоинта, в котором по умолчанию используется системно назначаемая идентичность.

$schema: https://azuremlschemas.azureedge.net/latest/managedOnlineEndpoint.schema.json
name: basic-chat-endpoint
auth_mode: key
properties:
# this property only works for system-assigned identity.
# if the deploy user has access to connection secrets, 
# the endpoint system-assigned identity will be auto-assigned connection secrets reader role as well
  enforce_access_to_default_secret_stores: enabled
Ключ Описание
$schema (Необязательно) Схема YAML. Чтобы просмотреть все доступные параметры в ФАЙЛЕ YAML, можно просмотреть схему в предыдущем фрагменте кода в браузере.
name Имя конечной точки.
auth_mode Используется key для проверки подлинности на основе ключей. Используйте aml_token для аутентификации по токенам в Машинное обучение Azure. Чтобы получить последний маркер, используйте az ml online-endpoint get-credentials команду.
property: enforce_access_to_default_secret_stores (предварительная версия) — По умолчанию конечная точка использует назначаемое системой удостоверение. Это свойство работает только для удостоверения, назначаемого системой.
— Если у вас есть разрешение на чтение секретов подключения, системно назначаемому удостоверению конечной точки автоматически назначается роль Машинное обучение Azure Workspace Connection Secrets Reader для рабочей области, чтобы конечная точка могла правильно получать доступ к подключениям при выполнении инференса.
— По умолчанию значение этого свойства — disabled.

Если вы создаете конечную точку Kubernetes online, необходимо указать следующие атрибуты:

Ключ Описание
compute Цель вычислений Kubernetes для развертывания конечной точки.

Дополнительные конфигурации конечной точки см. в схеме управляемых сетевых конечных точек.

Важно

Если в вашем потоке используются подключения проверки подлинности на базе Microsoft Entra ID, независимо от того, используется ли назначаемое системой удостоверение или назначаемое пользователем, необходимо всегда предоставлять управляемому удостоверению соответствующие роли соответствующих ресурсов, чтобы оно могло совершать вызовы API к этому ресурсу. Например, если подключение Azure OpenAI использует проверку подлинности на основе Microsoft Entra ID, необходимо предоставить управляемое удостоверение конечной точки роль Cognitive Services OpenAI User или Cognitive Services OpenAI Contributor для соответствующих ресурсов Azure OpenAI.

Использование назначаемого пользователем удостоверения

По умолчанию при создании сетевой конечной точки система автоматически создает управляемое удостоверение, назначаемое системой. Вы также можете указать существующее управляемое удостоверение, назначаемое пользователем для конечной точки.

Чтобы использовать идентификатор, назначаемый пользователем, укажите следующие атрибуты в файле endpoint.yaml:

identity:
  type: user_assigned
  user_assigned_identities:
    - resource_id: user_identity_ARM_id_place_holder

Кроме того, укажите Client ID удостоверения, назначенной пользователем, в разделе environment_variables файла deployment.yaml, как показано в следующем примере. Вы можете найти Client ID в разделе Overview управляемой идентификации на портале Azure.

environment_variables:
  AZURE_CLIENT_ID: <client_id_of_your_user_assigned_identity>

Важно

Перед созданием конечной точки необходимо предоставить следующие разрешения удостоверению, назначенному пользователем, чтобы оно могло получить доступ к ресурсам Azure для выполнения инференса. Дополнительные сведения см. в статье Как предоставить разрешения идентификатору конечной точки.

Область применения Роль Почему это необходимо
Рабочая область Машинное обучение Azure Роль чтения секретов подключения в рабочей области Машинное обучение AzureИЛИ настраиваемую роль с правами организации Microsoft "MachineLearningServices/workspaces/connections/listsecrets/action" Получите подключения к рабочей среде
Реестр контейнеров рабочей области Извлечение данных через ACR Извлечение образа контейнера
Хранилище рабочей области по умолчанию Читатель данных хранилища BLOB Загрузка модели из хранилища
(Необязательно) Рабочая область Машинное обучение Azure Модуль записи метрик рабочей области После развертывания конечной точки, если вы хотите отслеживать связанные с ней метрики, такие как использование CPU/GPU/диска/памяти, необходимо предоставить этой сущности данное разрешение.

Определение развертывания

Развертывание — это набор ресурсов, необходимых для размещения модели, которая выполняет фактическое инференсирование.

В следующем примере показано определение развертывания. Этот model раздел относится к зарегистрированной модели потока. Можно также указать путь модели потока в строке.

$schema: https://azuremlschemas.azureedge.net/latest/managedOnlineDeployment.schema.json
name: blue
endpoint_name: basic-chat-endpoint
model: azureml:basic-chat-model:1
  # You can also specify model files path inline
  # path: examples/flows/chat/basic-chat
environment: 
  image: mcr.microsoft.com/azureml/promptflow/promptflow-runtime:latest
  # inference config is used to build a serving container for online deployments
  inference_config:
    liveness_route:
      path: /health
      port: 8080
    readiness_route:
      path: /health
      port: 8080
    scoring_route:
      path: /score
      port: 8080
instance_type: Standard_E16s_v3
instance_count: 1
environment_variables:
  # for pulling connections from workspace
  PRT_CONFIG_OVERRIDE: deployment.subscription_id=<subscription_id>,deployment.resource_group=<resource_group>,deployment.workspace_name=<workspace_name>,deployment.endpoint_name=<endpoint_name>,deployment.deployment_name=<deployment_name>

  # (Optional) When there are multiple fields in the response, using this env variable will filter the fields to expose in the response.
  # For example, if there are 2 flow outputs: "answer", "context", and I only want to have "answer" in the endpoint response, I can set this env variable to '["answer"]'.
  # If you don't set this environment, by default all flow outputs will be included in the endpoint response.
  # PROMPTFLOW_RESPONSE_INCLUDED_FIELDS: '["category", "evidence"]'
Атрибут Описание
Имя Имя развертывания.
Имя конечной точки Имя конечной точки для создания развертывания.
Модель Модель, используемая для развертывания. Это значение может быть ссылкой на существующую версию модели в рабочей области или встроенную спецификацию модели.
Среда Среда для размещения модели и кода. Он содержит следующее:
- image
- inference_config: используется для создания контейнера обслуживания для сетевых развертываний, включая liveness routereadiness_routeи scoring_route .
Тип экземпляра Размер виртуальной машины, используемый для развертывания. Список поддерживаемых размеров см. в списке SKU управляемых сетевых конечных точек.
Число экземпляров Количество экземпляров для использования в процессе развертывания. Основывайте значение на ожидаемой рабочей нагрузке. Для обеспечения высокой доступности задайте значение по крайней мере 3. Служба резервирует дополнительные 20% для выполнения обновлений. Дополнительные сведения см. в разделе об ограничениях для сетевых конечных точек.
Переменные среды Задайте следующие переменные среды для конечных точек доступа, развернутых на основе потока:
— (обязательно) PRT_CONFIG_OVERRIDE— для извлечения подключений из рабочей области
— (необязательно) PROMPTFLOW_RESPONSE_INCLUDED_FIELDS:— при наличии нескольких полей в ответе с помощью этой переменной env поля фильтруются для предоставления в ответе.
Например, если у потока есть два выходных данных: "ответ" и "context", и если вы хотите, чтобы в ответе конечной точки был только "ответ", вы можете задать для переменной окружения значение '["ответ"]'.

Важно

Если в папке потока есть файл requirements.txt, содержащий зависимости, необходимые для выполнения потока, выполните действия, описанные в разделе развертывание с настраиваемой средой, чтобы создать настраиваемую среду вместе с этими зависимостями.

При создании сетевого развертывания Kubernetes укажите следующие атрибуты:

Атрибут Описание
Тип Тип развертывания. Задайте для параметра значение kubernetes.
Тип экземпляра Тип экземпляра, созданный в кластере Kubernetes для развертывания. Определяет запрашиваемые и предельные вычислительные ресурсы развертывания. Дополнительные сведения см. в разделе "Создание и управление типом экземпляра".

Развертывание веб-конечной точки в Azure

Чтобы создать конечную точку в облаке, выполните следующий код:

az ml online-endpoint create --file endpoint.yml

Чтобы создать развертывание с именем blue под конечной точкой, выполните следующий код:

az ml online-deployment create --file blue-deployment.yml --all-traffic

Примечание

Это развертывание может занять более 15 минут.

Совет

Если вы предпочитаете не блокировать консоль CLI, добавьте флаг --no-wait в команду. Однако этот флаг останавливает интерактивное отображение состояния развертывания.

Важно

Флаг --all-traffic в предыдущей команде az ml online-deployment create направляет 100 % трафика конечной точки в только что созданное развертывание blue. Хотя такое распределение полезно для разработки и тестирования, в рабочей среде вы можете предпочесть направить трафик на новое развертывание с помощью явной команды. Например, az ml online-endpoint update -n $ENDPOINT_NAME --traffic "blue=100".

Проверка состояния конечной точки и развертывания

Чтобы проверить состояние конечной точки, выполните следующий код:

az ml online-endpoint show -n basic-chat-endpoint

Чтобы проверить состояние развертывания, выполните следующий код:

az ml online-deployment get-logs --name blue --endpoint basic-chat-endpoint

Вызов конечной точки для оценки данных с помощью модели

sample-request.json Создайте файл:

{
  "question": "What is Azure Machine Learning?",
  "chat_history":  []
}
az ml online-endpoint invoke --name basic-chat-endpoint --request-file sample-request.json

Можно также вызвать конечную точку с помощью HTTP-клиента, например curl:

ENDPOINT_KEY=<your-endpoint-key>
ENDPOINT_URI=<your-endpoint-uri>

curl --request POST "$ENDPOINT_URI" --header "Authorization: Bearer $ENDPOINT_KEY" --header 'Content-Type: application/json' --data '{"question": "What is Azure Machine Learning?", "chat_history":  []}'

Получите ключ конечной точки и URI конечной точки в рабочей области Машинное обучение Azure в разделе Конечные точки>Использование>Основные сведения о потреблении.

Дополнительные конфигурации

Развертывание с различными подключениями от разработки потока

Во время развертывания может потребоваться переопределить подключения потока.

Например, если файл flow.dag.yaml использует соединение с именем my_connection, его можно переопределить, добавив переменные среды для yaml развертывания следующим образом:

Вариант 1: Переопределение имени подключения

environment_variables:
  my_connection: <override_connection_name>

Если вы хотите переопределить определенное поле подключения, можно переопределить, добавив переменные среды с шаблоном <connection_name>_<field_name> именования. Например, если поток использует соединение my_connection с ключом конфигурации, под названием chat_deployment_name, бэкенд сервиса пытается извлечь chat_deployment_name из переменной среды "MY_CONNECTION_CHAT_DEPLOYMENT_NAME" по умолчанию. Если переменная среды не задана, она использует исходное значение из определения потока.

Вариант 2: переопределение путем ссылки на актив

environment_variables:
  my_connection: ${{azureml://connections/<override_connection_name>}}

Примечание

Вы можете ссылаться только на подключение в той же рабочей области.

Развертывание с помощью пользовательской среды

В этом разделе показано, как использовать контекст сборки Docker для указания среды для развертывания, если у вас есть знания о Docker и средах Машинное обучение Azure.

Образы среды выполнения Prompt flow заморожены и больше не получают обновлений безопасности или обновлений пакетов. Тег latest в следующем примере не указывает, что изображение получает обновления. Используйте этот пример только для поддержания существующего развертывания во время планирования миграции.

  1. В локальной среде создайте папку с именем image_build_with_requirements , содержащую следующие файлы:
|--image_build_with_requirements
  |  |--requirements.txt
  |  |--Dockerfile
  ```
  - The `requirements.txt` file, inherited from the flow folder, tracks the dependencies of the flow. 

  - The `Dockerfile` with content similar to the following example: 

      ```dockerfile
      FROM mcr.microsoft.com/azureml/promptflow/promptflow-runtime:latest
      COPY ./requirements.txt .
      RUN pip install -r requirements.txt
      ```

1. Replace the environment section in the deployment definition YAML file with the following content:

  ```yaml
  environment: 
    build:
      path: image_build_with_requirements
      dockerfile_path: Dockerfile
    # deploy prompt flow is BYOC, so we need to specify the inference config
    inference_config:
      liveness_route:
        path: /health
        port: 8080
      readiness_route:
        path: /health
        port: 8080
      scoring_route:
        path: /score
        port: 8080
  ```

### Use FastAPI serving engine (preview)

By default, prompt flow serving uses the Flask serving engine. Starting from prompt flow SDK version 1.10.0, FastAPI-based serving engine is supported. You can use the `fastapi` serving engine by specifying an environment variable `PROMPTFLOW_SERVING_ENGINE`.

```yaml
environment_variables:
PROMPTFLOW_SERVING_ENGINE: fastapi

Настройка параллелизма для развертывания

При развертывании потока в сети настройте две переменные среды для параллелизма: PROMPTFLOW_WORKER_NUM и PROMPTFLOW_WORKER_THREADS. Также необходимо задать max_concurrent_requests_per_instance параметр.

В следующем примере показано, как настроить эти параметры в deployment.yaml файле.

request_settings:
  max_concurrent_requests_per_instance: 10
environment_variables:
  PROMPTFLOW_WORKER_NUM: 4
  PROMPTFLOW_WORKER_THREADS: 1
  • PROMPTFLOW_WORKER_NUM. Этот параметр задает количество рабочих (процессов), которые начинаются в одном контейнере. Значение по умолчанию равно числу ядер ЦП, а максимальное значение — в два раза больше ядер ЦП.

  • PROMPTFLOW_WORKER_THREADS: Этот параметр задаёт количество потоков, запускаемых в одном рабочем процессе. Значение по умолчанию — 1.

    Примечание

    Если для PROMPTFLOW_WORKER_THREADS задано значение больше 1, убедитесь, что код потока выполнения потокобезопасен.

  • max_concurrent_requests_per_instance. Максимальное количество одновременных запросов на экземпляр, разрешенных для развертывания. Значение по умолчанию — 10.

    Рекомендуемое значение max_concurrent_requests_per_instance зависит от времени запроса:

    • Если время запроса больше 200 мс, установите значение max_concurrent_requests_per_instancePROMPTFLOW_WORKER_NUM * PROMPTFLOW_WORKER_THREADS.
    • Если время запроса меньше или равно 200 мс, установите значение max_concurrent_requests_per_instance(1.5-2) * PROMPTFLOW_WORKER_NUM * PROMPTFLOW_WORKER_THREADS. Этот параметр может повысить общую пропускную способность, позволяя некоторым запросам ожидать в очереди на стороне сервера.
    • Если вы отправляете запросы между регионами, можно изменить пороговое значение с 200 мс на 1.

При настройке этих параметров отслеживайте следующие метрики, чтобы обеспечить оптимальную производительность и стабильность:

  • Использование ЦП и памяти экземпляра для этого развертывания
  • Ответы, отличные от 200 (4xx, 5xx)
    • Если вы получаете ответ 429, этот код состояния обычно указывает на то, что необходимо повторно настроить параметры параллелизма после предыдущего руководства или масштабировать развертывание.
  • Состояние управления нагрузкой Azure OpenAI

Мониторинг конечных точек

Сбор общих метрик

Вы можете просмотреть общие метрики развертывания в онлайн-среде (количество запросов, задержка запросов, сетевые байты, использование процессора/GPU/диска/памяти и многое другое).

Сбор данных трассировки и системных метрик во время инференса

Вы можете собирать данные трассировки и метрики, относящиеся к развертыванию Prompt Flow (потребление токенов, задержка потока и многое другое), во время инференса в Application Insights, связанную с рабочей областью, добавив свойство app_insights_enabled: true в файл YAML развертывания. Дополнительные сведения см. в разделе трассировка и метрики развертывания Prompt flow.

Вы можете указать метрики и трассировку, относящиеся к prompt flow, для другого ресурса Application Insights, а не для того, который связан с рабочей областью. Вы можете указать переменную среды в файле yaml развертывания, как показано ниже. Строку подключения для Application Insights можно найти на странице обзора портала Azure.

environment_variables:
  APPLICATIONINSIGHTS_CONNECTION_STRING: <connection_string>

Примечание

Если задан только app_insights_enabled: true, но с вашей рабочей областью не связан Application Insights, развертывание не завершится ошибкой, однако данные собираться не будут. Если одновременно указать и app_insights_enabled: true, и предыдущую переменную среды, данные трассировки и метрики будут отправляться в Application Insights, связанный с рабочей областью. Чтобы указать другую среду Application Insights, сохраните только переменную среды.

Распространенные ошибки

Проблема тайм-аута при обращении к конечной точке во время обработки исходящего запроса

Эта ошибка обычно возникает из-за времени ожидания. По умолчанию request_timeout_ms значение равно 5000 миллисекундам. Его можно настроить до 5 минут, что составляет 300 000 миллисекунда. В следующем примере показано, как указать время ожидания запроса в файле YAML развертывания. Дополнительные сведения о схеме развертывания см. в схеме управляемого сетевого развертывания.

request_settings:
  request_timeout_ms: 300000

Важно

Время ожидания 300 000 мс работает только для управляемых онлайн-развертываний из потока Prompt Flow. Максимальное время ожидания для управляемой сетевой конечной точки потока без запроса составляет 180 секунд.

Чтобы указать, что это развертывание выполнено из prompt flow, добавьте свойства для вашей модели следующим образом (либо встроенную спецификацию модели в YAML-файле развертывания, либо отдельный YAML-файл спецификации модели).

properties:
  # indicate a deployment from prompt flow
  azureml.promptflow.source_flow_id: <value>

Дальнейшие действия