Миграция с предварительной версии Azure для понимания контента в общедоступную версию

Важно

Предварительная версия API 2024-12-01-preview и 2025-05-01-preview будет прекращена к 15 июля 2026 года. Если вы по-прежнему используете API предварительной версии, обновите код, чтобы выбрать последнюю версию 2025-11-01 (GA)API.

Версии 2024-12-01-preview API и 2025-05-01-preview доступны в общедоступной предварительной версии. Эти предварительные версии предоставляются без соглашения об уровне обслуживания и не рекомендуются для производственных рабочих нагрузок. Дополнительные сведения см. в разделе Supplemental Terms of Use for Microsoft Azure Previews и Microsoft Products and Services Data Protection Addendum (DPA).

API распознавания содержимого Azure достигло общедоступной версии. В ней представлено несколько новых возможностей и обновлений функций, выпущенных в более ранних версиях API предварительной версии. Страница "Что нового" предоставляет обзор всех изменений в версии GA API "Понимание содержимого".

В этой статье рассматриваются изменения, необходимые для переноса анализаторов и приложений, созданных с помощью одной из версий API предварительной версии (2024-12-01 preview и 2025-05-01 preview).

Для поддерживаемых версий и операций REST API используйте справочник по REST API для распознавания содержимого. В селекторе версий в Learn отображаются опубликованные в настоящее время справочные версии.

Необходимые условия

Настройте развертывания моделей по умолчанию для ресурса Content Understanding. По умолчанию вы создаете подключение к моделям Microsoft Foundry, используемым для запросов на распознавание контента. Выберите один из следующих методов:

  1. Перейдите на страницу параметров распознавания содержимого.

  2. Нажмите кнопку +Добавить ресурс в левом верхнем углу.

  3. Выберите ресурс Foundry, который вы хотите использовать, и нажмите кнопку "Далее>сохранить".

    Убедитесь, что установлен флажок Enable autodeployment для обязательных моделей, если значения по умолчанию недоступны. Этот выбор гарантирует, что ваш ресурс полностью настроен с необходимыми моделями GPT-4.1, GPT-4.1-mini и text-embedding-3-large. Для различных предварительно созданных анализаторов требуются разные модели.

    Важно

    Семейство моделей GPT-4.1 (gpt-4.1, gpt-4.1-mini, ) gpt-4.1-nanoотменяется в октябре 2026 года. Мы рекомендуем выполнить миграцию на gpt-5.2, который обеспечивает расширенные возможности. Для получения полного графика выведения из эксплуатации см. раздел Выведение из эксплуатации моделей Azure OpenAI.

Выполнив эти действия, вы настроите подключение между моделями Content Understanding и Foundry в ресурсе Foundry.

Обновление анализаторов

Чтобы обновить существующие анализаторы, рекомендуется выполнить этот трехэтапный процесс.

Шаг 1. Получение определения анализатора

Получите определение анализатора путем вызова:

GET /analyzers/{analyzerName}

Определение анализатора может выглядеть так, если он был создан с помощью 2025-05-01-preview API.

{
  "analyzerId": "my-custom-invoice-analyzer",
  "description": "Extracts vendor information, line items, and totals from commercial invoices",
  "baseAnalyzerId": "prebuilt-documentSearch",
  "config": {
    /*...*/
  },
  "fieldSchema": {/*...*/}
}

Шаг 2. Обновите определение анализатора для GA API

Внесите следующие изменения, чтобы анализатор работал с API Google Analytics.

  1. Добавьте или обновите baseAnalyzerId свойство на верхнем уровне определения анализатора и задайте для него одно из поддерживаемых значений: prebuilt-document, , prebuilt-audioprebuilt-videoили prebuilt-image. Выберите тот, который соответствует файлам, которые планируется обработать с помощью этого анализатора. Свойство Scenario из предварительного выпуска устарело.

  2. models Добавьте объект и укажите модель завершения и внедрения. Этот объект задает созданные по умолчанию модели, используемые этим анализатором.

Например, схема из шага 1 обновляется следующим образом:

{
  "analyzerId": "my-custom-invoice-analyzer",
  "description": "Extracts vendor information, line items, and totals from commercial invoices",
  "baseAnalyzerId": "prebuilt-document",
  "config": {
    /*...*/
  },
  "fieldSchema": {/*...*/},
  "models": {
    "completion": "gpt-5.2",
    "embedding": "text-embedding-3-large"
  }
}

Шаг 3. Создание анализатора

Для создания нового анализатора можно использовать обновленное определение:

PUT /analyzers/{analyzerName}_updated

Чтобы повторно использовать имя, необходимо удалить существующий анализатор.

Рассмотрите эти другие изменения API

  • Классификаторы содержимого и сегментация видео теперь объединяются в анализаторы содержимого. Чтобы сегментировать и классифицировать содержимое, используйте contentCategories свойства анализатора. См. Создание решения для автоматизации роботизированных процессов (RPA) и сегментацию видео для получения рекомендаций.

  • Доверие и заземление теперь являются необязательными свойствами для полей. Определение поля по умолчанию не возвращает достоверность и заземление. Чтобы добавить уверенность и основу, установите estimateFieldSourceAndConfidence на true. Это поведение не отличается от 2025-05-01-preview API.

  • Запрос на получение определенных analyze компонентов результата упрощен. Чтобы получить внедренные изображения или содержимое, вызовите:

    GET /analyzerResults/{operationId}/files/{path}
    

    Здесь path может включать:

    • contents/{contentIndex}/pages/{pageNumber} - DocumentContent.pages[*].pageNumber
    • contents/{contentIndex}/figures/{figureId} - DocumentContent.figures[*].id
  • Теперь операция analyze поддерживает только анализ файлов по URL-адресу. Используйте новую analyzeBinary операцию для отправки файлов в тело запроса в виде строки в кодировке Base64. Если вы ранее использовали операцию analyze для загрузки файлов напрямую в коде, необходимо обновить ваш код, чтобы вместо этого использовать операцию analyzeBinary. Дополнительные сведения об analyzeBinary операции.

  • Схема JSON полезной нагрузки операции analyze обновлена. Теперь есть массив входных данных, содержащий сведения о файле для анализа. Каждый входной элемент содержит указатель URL-адреса на файл. Дополнительные сведения об analyze операции.

    Примечание

    Массив входных данных поддерживает только один элемент в 2025-11-01 версии.

    Ниже приведен пример обновленной схемы для PUT /analyzers/{analyzerName}:

    
    {
          "inputs":[
          {
            "url": "https://documentintelligence.ai.azure.com/documents/samples/read/read-healthcare.png" /*This is the file to be analyzed*/
          }
          ]
    }
    
  • Если вы использовали в контекстном обучении или использовании помеченных данных, запрос API, определяющий помеченный набор данных, теперь указывает помеченные данные как тип knowledgeSources. Дополнительные сведения см. в разделе "Создание или замена".

  • Для видеоанализаторов ключевые кадры теперь возвращаются в виде массива keyFrames. Дополнительные сведения см. в разделе "Анализ".

Новые возможности

  • Метод извлечения полей необязателен. Если метод не задан, анализатор определяет подход (extract или generate). Не добавляйте свойство method, если не требуется дословное извлечение значения.
  • Добавлена поддержка оценки достоверности и привязки к исходным данным для полей в анализаторах документов, у которых метод задан для генерации.
  • Теперь в анализаторе количество полей увеличивается до 1000 полей.
  • Для документов, классификация и сегментация поддерживают до 200 различных типов.

Устаревшие функции

  • API общедоступной версии не включает режим Pro, который по-прежнему находится в предварительной версии (2025-05-01-preview). В результате AnalysisMode устарел, и стандартный режим — единственный поддерживаемый режим в общедоступной версии API.
  • Каталог пользователей и API распознавания лиц не являются частью API-интерфейсов общедоступной версии, включая функции видеоанализатора для обнаружения и распознавания лиц в видео.
  • Эта TrainingData функция устарела и заменена функцией knowledgeSources .