Модель контракта аналитики документов

Это содержимое относится к следующему:🟩v4.0 (GA) | Предыдущие версии:🟦v3.1 (GA)🟥версия 3.0 (выход на пенсию)🟥версия 2.1 (выход на пенсию)

Это содержимое относится к следующему:🟩v3.1 (GA) | Последняя версия:🟪v4.0 (GA)

Это содержимое относится к следующему:🟥версия 3.0 (выход на пенсию) | Последняя версия:🟪v4.0 (GA)

Модель контракта аналитики документов использует мощные возможности оптического распознавания символов (OCR) для анализа и извлечения ключевых полей и элементов строки из группы важных сущностей контракта. Контракты могут быть различными форматами и качеством, включая захваченные телефоном изображения, сканированные документы и цифровые PDF-файлы. API анализирует текст документа; извлекает ключевые сведения, такие как стороны, юрисдикции, идентификатор контракта и название; и возвращает структурированное представление данных JSON. В настоящее время модель поддерживает форматы документов на английском языке.

Автоматическая обработка контракта

Автоматическая обработка контрактов — это процесс извлечения ключевых полей контракта из документов. Традиционно процесс анализа договора выполняется вручную и, следовательно, занимает очень много времени. Точное извлечение ключевых данных из контрактов обычно является первым и одним из наиболее важных шагов в процессе автоматизации контрактов.

Варианты разработки

Аналитика документов версии 4.0: 2024-11-30 (GA) поддерживает следующие средства, приложения и библиотеки:

Функция Ресурсы Идентификатор модели
Модель контракта Студия Document Intelligence
REST API
SDK для C#
SDK для Python
SDK для Java
SDK для JavaScript
готовый контракт

Аналитика документов версии 3.1 поддерживает следующие средства, приложения и библиотеки:

Функция Ресурсы Идентификатор модели
Модель контракта Студия Document Intelligence
REST API
SDK для C#
SDK для Python
SDK для Java
SDK для JavaScript
готовый контракт

Аналитика документов версии 3.0 поддерживает следующие средства, приложения и библиотеки:

Функция Ресурсы Идентификатор модели
Модель контракта Студия Document Intelligence
REST API
SDK для C#
SDK для Python
SDK для Java
SDK для JavaScript
готовый контракт

Требования к входным данным

Поддерживаются следующие форматы файлов.

Модель PDF Изображение:
JPEG/JPG, PNG, BMP, TIFF, HEIF
Office:
Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML
Читать
Макет
Общий документ
Предварительно собранный
Настраиваемая функция извлечения
Настраиваемая классификация
  • Фотографии и скан-копии: Для наилучших результатов предоставьте одну четкую фотографию или высококачественную скан-копию для каждого документа.
  • PDF и TIFF: для PDF и TIFF можно обработать до 2 000 страниц. (С подпиской на бесплатный уровень обрабатываются только первые две страницы.)
  • Размер файла: размер файла для анализа документов составляет 500 МБ для платного уровня (S0) и 4 МБ для бесплатного уровня (F0).
  • Размеры изображения: размеры должны находиться в диапазоне от 50 пикселей до 10 000 пикселей x 10 000 пикселей.
  • Блокировки паролей. Если pdf-файлы заблокированы паролем, необходимо удалить блокировку перед отправкой.
  • Высота текста: минимальная высота извлеченного текста составляет 12 пикселей для изображения 1024 x 768 пикселей. Этот размер соответствует тексту кеглем около 8 пунктов при разрешении 150 точек на дюйм.
  • Обучение пользовательской модели: максимальное количество страниц для обучающих данных составляет 500 для пользовательской модели шаблона и 50 000 для пользовательской нейронной модели.
  • Обучение пользовательской модели извлечения: общий размер обучающих данных составляет 50 МБ для модели шаблона и 1 ГБ для нейронной модели.
  • Обучение пользовательской модели классификации: общий размер обучающих данных составляет 1 ГБ, не более 10 000 страниц. Для 2024-11-30 (GA) общий размер обучающих данных составляет 2 ГБ с максимум 10 000 страниц.
  • Типы файлов Office (DOCX, XLSX, PPTX): максимальная длина строки составляет 8 миллионов символов.

Попробуйте извлечь данные документа контракта

Узнайте, как из договоров извлекаются данные, включая информацию о клиентах, поставщиках и отдельных позициях. Вам потребуются следующие ресурсы:

  • Подписка Azure — ее можно создать бесплатно.

  • Экземпляр Document Intelligence на портале Azure. Вы можете использовать бесплатный ценовой уровень (F0), чтобы опробовать сервис. После развертывания ресурса выберите Перейти к ресурсу, чтобы получить ключ и конечную точку.

Снимок экрана: расположение ключей и конечной точки на портале Azure.

Document Intelligence Studio

  1. На домашней странице Document Intelligence Studio выберите "Налоговые документы".

  2. Вы можете проанализировать примеры налоговых документов или отправить собственные файлы.

  3. Нажмите кнопку "Выполнить анализ", а при необходимости настройте параметры анализа:

    Снимок экрана: кнопки

Поддерживаемые языки и локали

Чтобы увидеть полный список поддерживаемых языков, см. нашу страницу «Поддержка языков — предварительно созданные модели».

Извлечение полей

  • Список поддерживаемых полей для извлечения из документов см. на странице схемы модели контракта в нашем репозитории примеров на GitHub.

  • Пары "ключ-значение контракта" и извлеченные элементы строки находятся в documentResults разделе выходных данных JSON.

Следующие шаги

  • Попробуйте обработать собственные формы и документы с помощью Document Intelligence Studio.

  • Выполните краткое руководство по анализу документов и начните создавать приложение для обработки документов на выбранном языке разработки.