Возможности надстройки аналитики документов

Это содержимое относится к следующему:🟩v4.0 (GA) | Предыдущие версии:🟦v3.1 (GA)

Это содержимое относится к следующему:🟩v3.1 (GA) | Последняя версия:🟪v4.0 (GA)

Примечание.

Дополнительные возможности доступны во всех моделях, кроме модели визитки.

Возможности

Аналитика документов поддерживает более сложные и модульные возможности анализа. Используйте возможности надстройки, чтобы расширить результаты, включив в них дополнительные возможности, извлечённые из ваших документов. Некоторые дополнительные функции предоставляются за дополнительную плату. Эти необязательные функции можно включить и отключить в зависимости от сценария извлечения документов. Чтобы включить функцию, добавьте связанное имя функции в features свойство строки запроса. Вы можете включить в запросе несколько дополнительных функций, указав список функций, разделённых запятыми. Следующие дополнительные возможности доступны начиная с версии 2023-07-31 (GA) и в более поздних выпусках.

Примечание.

Не все модели или типы файлов Microsoft Office поддерживают возможности надстройки. Дополнительные сведения см. в статьеоб извлечении данных модели.

Доступность версий

Возможность надстройки Дополнение/Бесплатно 2024-11-30 (GA) 2023-07-31 (GA) 2022-08-31 (GA) v2.1 (GA)
Извлечение штрихкодов Бесплатно ✔️ ✔️ Недоступно Недоступно
Распознавание языка Бесплатно ✔️ ✔️ Недоступно Недоступно
Пары "ключ — значение" Бесплатно ✔️ Недоступно Недоступно Недоступно
Pdf-файл, доступный для поиска Бесплатно ✔️ Недоступно Недоступно Недоступно
Извлечение свойств шрифта Дополнение ✔️ ✔️ Недоступно Недоступно
Извлечение формул Дополнение ✔️ ✔️ Недоступно Недоступно
Извлечение в высоком разрешении Дополнение ✔️ ✔️ Недоступно Недоступно
Поля запроса Дополнение ✔️ Недоступно Недоступно Недоступно

✱ Надстройка — поля запроса тарифицируются иначе, чем другие функции надстройки. Подробные сведения см. в разделе Цены.
** Дополнение — PDF-файл с возможностью поиска доступен только для модели Read в виде дополнительной функции.

Поддерживаемые типы файлов

  • PDF

  • Изображения: JPEG/JPG, , PNG, BMPTIFFHEIF

✱ Файлы Microsoft Office в настоящее время не поддерживаются.

Извлечение в высоком разрешении

Задача распознавания небольшого текста из документов большого размера, таких как инженерные рисунки, является проблемой. Часто текст смешан с другими графическими элементами и имеет различные шрифты, размеры и ориентации. Кроме того, текст можно разбить на отдельные части или соединить с другими символами. Document Intelligence теперь поддерживает извлечение содержимого из документов этих типов с помощью функции ocr.highResolution. Вы получаете улучшенное качество извлечения содержимого из документов A1/A2/A3, включив эту возможность надстройки.

{your-resource-endpoint}.cognitiveservices.azure.com/documentintelligence/documentModels/prebuilt-layout:analyze?api-version=2024-11-30&features=ocrHighResolution
{your-resource-endpoint}.cognitiveservices.azure.com/formrecognizer/documentModels/prebuilt-layout:analyze?api-version=2023-07-31&features=ocrHighResolution

Извлечение формул

Функция ocr.formula извлекает все обнаруженные формулы, такие как математические уравнения, в коллекции formulas как объект верхнего уровня в content. Внутри contentобнаруженные формулы представлены как :formula:. Каждая запись в этой коллекции представляет собой формулу с указанием типа формулы как inline или display, её представления в LaTeX как value, а также её координат polygon. Изначально формулы отображаются в конце каждой страницы.

Примечание.

Оценка confidence жестко закодирована.

{your-resource-endpoint}.cognitiveservices.azure.com/documentintelligence/documentModels/prebuilt-layout:analyze?api-version=2024-11-30&features=formulas
{your-resource-endpoint}.cognitiveservices.azure.com/formrecognizer/documentModels/prebuilt-layout:analyze?api-version=2023-07-31&features=formulas

Извлечение свойств шрифта

Возможность ocr.font извлекает все свойства шрифта из текста, извлечённого в коллекции styles, как объект верхнего уровня в content. Каждый объект стиля задает одно свойство шрифта, фрагмент текста, к которому оно применяется, и соответствующую ему оценку уверенности. Существующее свойство style расширено дополнительными свойствами шрифта, такими как similarFontFamily для шрифта текста, fontStyle для таких начертаний, как курсив и обычное, fontWeight для полужирного или обычного начертания, color для цвета текста и backgroundColor для цвета ограничивающей рамки текста.

  {your-resource-endpoint}.cognitiveservices.azure.com/documentintelligence/documentModels/prebuilt-layout:analyze?api-version=2024-11-30&features=styleFont
  {your-resource-endpoint}.cognitiveservices.azure.com/formrecognizer/documentModels/prebuilt-layout:analyze?api-version=2023-07-31&features=styleFont

Извлечение свойств штрихкода

Возможность ocr.barcode извлекает все обнаруженные штрихкоды из коллекции barcodes в виде объекта верхнего уровня в content. Внутри content обнаруженные штрихкоды отображаются как :barcode:. Каждая запись в этой коллекции представляет собой штрихкод и включает тип штрихкода в виде kind, закодированное в штрихкоде содержимое в виде value, а также его координаты polygon. Изначально штрихкоды отображаются в конце каждой страницы. confidence жёстко задан равным 1.

Поддерживаемые типы штрихкодов

Тип штрихкода Пример
QR Code Снимок экрана: QR-код.
Code 39 Снимок экрана: код 39.
Code 93 Снимок экрана: код 93.
Code 128 Снимок экрана: код 128.
UPC (UPC-A & UPC-E) Снимок экрана UPC.
PDF417 Снимок экрана: PDF417.
EAN-8 Снимок экрана: штрихкод европейского номера статьи ean-8.
EAN-13 Снимок экрана: штрихкод европейского номера статьи ean-13.
Codabar Снимок экрана: Codabar.
Databar Снимок экрана: панель данных.
Databar Расширенный Снимок экрана: развернутая панель данных.
ITF Снимок экрана со штрихкодом «Interleaved 2 of 5» (ITF).
Data Matrix Снимок экрана: матрица данных.
{your-resource-endpoint}.cognitiveservices.azure.com/documentintelligence/documentModels/prebuilt-layout:analyze?api-version=2024-11-30&features=barcodes
{your-resource-endpoint}.cognitiveservices.azure.com/formrecognizer/documentModels/prebuilt-layout:analyze?api-version=2023-07-31&features=barcodes

Распознавание языка

Добавление функции languages к запросу analyzeResult позволяет определить обнаруженный основной язык для каждой строки текста вместе с confidence в коллекции languages в разделе analyzeResult.

{your-resource-endpoint}.cognitiveservices.azure.com/documentintelligence/documentModels/prebuilt-layout:analyze?api-version=2024-11-30&features=languages
{your-resource-endpoint}.cognitiveservices.azure.com/formrecognizer/documentModels/prebuilt-layout:analyze?api-version=2023-07-31&features=languages

Pdf-файл, доступный для поиска

Возможность PDF с возможностью поиска позволяет преобразовать аналоговый PDF-файл( например, сканированный PDF-файл в PDF-файл с внедренным текстом). Встроенный текст позволяет выполнять глубокий поиск по тексту в содержимом, извлечённом из PDF, путём наложения обнаруженных текстовых элементов поверх файлов изображений.

Внимание

  • В настоящее время только модель Read prebuilt-read поддерживает функцию поиска по PDF. При использовании этой функции укажите modelId как prebuilt-read.
  • PDF с возможностью поиска входит в модель 2024-11-30(GA)prebuilt-read без платы за использование при стандартной работе с PDF.

Использование PDF с возможностью поиска

Чтобы использовать PDF с возможностью поиска, выполните запрос POST с помощью операции Analyze и укажите формат вывода как pdf:


POST /documentModels/prebuilt-read:analyze?output=pdf
{...}
202

Analyze После завершения операции выполните GET запрос на получение Analyze результатов операции.

После успешного завершения PDF-файл можно получить и скачать как application/pdf. Эта операция позволяет напрямую загружать внедренную текстовую форму PDF вместо JSON в кодировке Base64.


// Monitor the operation until completion.
GET /documentModels/prebuilt-read/analyzeResults/{resultId}
200
{...}

// Upon successful completion, retrieve the PDF as application/pdf.
GET /documentModels/prebuilt-read/analyzeResults/{resultId}/pdf
200 OK
Content-Type: application/pdf

Пары "Ключ-значение"

В более ранних версиях API prebuilt-document модель извлекала пары "ключ — значение" из форм и документов. При добавлении функции к предварительно созданному макету модель макета keyValuePairs теперь выдает те же результаты.

Пары "ключ-значение" — это отдельные фрагменты внутри документа, которые определяют метку или ключ и связанный с ними ответ или значение. В структурированной форме эти пары могут быть меткой и значением, которое пользователь указал для данного поля. В неструктурированном документе они могут быть датой подписания договора на основании текста в абзаце. Модель искусственного интеллекта предназначена для извлечения идентифицируемых ключей и значений на основе широкого спектра типов документов, форматов и структур.

Ключи также могут существовать в изоляции, когда модель обнаруживает, что ключ существует, но с ним не связано ни одно значение, или при обработке необязательных полей. Например, в некоторых случаях поле для второго имени в форме можно оставить пустым. Пары ключ-значение являются фрагментами текста, содержащимися в документе. Для документов, в которых одно и то же понятие описывается по-разному, например customer/user, соответствующим ключом будет либо customer, либо user (в зависимости от контекста).

REST API

{your-resource-endpoint}.cognitiveservices.azure.com/documentintelligence/documentModels/prebuilt-layout:analyze?api-version=2024-11-30&features=keyValuePairs

Поля запроса

Поля запросов — это возможность расширения схемы, извлеченной из любой предварительно созданной модели, или определения определенного имени ключа при переменной имени ключа. Чтобы использовать поля запроса, задайте функции queryFields и укажите список имен полей с разделием запятыми в свойстве queryFields .

  • Аналитика документов теперь поддерживает извлечение полей запросов. При извлечении полей по запросу вы можете добавлять поля в процесс извлечения с помощью запроса без дополнительного обучения.

  • Используйте поля запроса, если необходимо расширить схему предварительно созданной или пользовательской модели или извлечь несколько полей с выходными данными макета.

  • Поля запроса доступны только как дополнительная функция уровня «Премиум». Для получения наилучших результатов определите поля, которые требуется извлечь, используя стиль camelCase или PascalCase для имен полей, состоящих из нескольких слов.

  • Поля запросов поддерживают не более 20 полей на запрос. Если документ содержит значение для поля, возвращается поле и значение.

  • Этот выпуск имеет новую реализацию возможностей полей запроса, которая имеет более низкую цену, чем более ранняя реализация, и должна быть проверена.

Примечание.

Извлечение полей по запросу в Document Intelligence Studio в настоящее время доступно для моделей Layout и Prebuilt через API 2024-11-30 (GA), за исключением американских налоговых моделей W2, 1098 и 1099.

Извлечение поля запроса

Для извлечения полей запроса укажите поля, которые необходимо извлечь, и аналитика документов анализирует документ соответствующим образом. Приведем пример:

  • Если вы обрабатываете контракт в Студии аналитики документов, используйте версию 2024-11-30 (GA):

    Снимок экрана: кнопка полей запроса в Document Intelligence Studio.

  • Вы можете передать список меток полей, например Party1, Party2, TermsOfUse, PaymentTermsи PaymentDateTermEndDate как часть analyze document запроса.

    Снимок экрана: окно выбора полей запроса в Document Intelligence Studio.

  • Аналитика документов может анализировать и извлекать данные поля и возвращать значения в структурированных выходных данных JSON.

  • В дополнение к полям запроса ответ включает текст, таблицы, метки выделения и другие соответствующие данные.

{your-resource-endpoint}.cognitiveservices.azure.com/documentintelligence/documentModels/prebuilt-layout:analyze?api-version=2024-11-30&features=queryFields&queryFields=TERMS

Следующие шаги

Дополнительные сведения: Модель чтенияМодель макета

Примеры пакета SDK: Python

Дополнительные примеры: возможности надстройки

Дополнительные примеры: возможности надстройки