Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Это содержимое относится к следующему:🟩v4.0 (GA) | Предыдущие версии:🟦v3.1 (GA)🟥версия 3.0 (выход на пенсию)🟥версия 2.1 (выход на пенсию)
Это содержимое относится к следующему:🟩v3.1 (GA) | Последняя версия:🟪v4.0 (GA)
Это содержимое относится к следующему:🟥версия 3.0 (выход на пенсию) | Последняя версия:🟪v4.0 (GA)
Модель контракта аналитики документов использует мощные возможности оптического распознавания символов (OCR) для анализа и извлечения ключевых полей и элементов строки из группы важных сущностей контракта. Контракты могут быть различными форматами и качеством, включая захваченные телефоном изображения, сканированные документы и цифровые PDF-файлы. API анализирует текст документа; извлекает ключевые сведения, такие как стороны, юрисдикции, идентификатор контракта и название; и возвращает структурированное представление данных JSON. В настоящее время модель поддерживает форматы документов на английском языке.
Автоматическая обработка контракта
Автоматическая обработка контрактов — это процесс извлечения ключевых полей контракта из документов. Традиционно процесс анализа договора выполняется вручную и, следовательно, занимает очень много времени. Точное извлечение ключевых данных из контрактов обычно является первым и одним из наиболее важных шагов в процессе автоматизации контрактов.
Варианты разработки
Аналитика документов версии 4.0: 2024-11-30 (GA) поддерживает следующие средства, приложения и библиотеки:
| Функция | Ресурсы | Идентификатор модели |
|---|---|---|
| Модель контракта | • Студия Document Intelligence • REST API • SDK для C# • SDK для Python • SDK для Java • SDK для JavaScript |
готовый контракт |
Аналитика документов версии 3.1 поддерживает следующие средства, приложения и библиотеки:
| Функция | Ресурсы | Идентификатор модели |
|---|---|---|
| Модель контракта | • Студия Document Intelligence • REST API • SDK для C# • SDK для Python • SDK для Java • SDK для JavaScript |
готовый контракт |
Аналитика документов версии 3.0 поддерживает следующие средства, приложения и библиотеки:
| Функция | Ресурсы | Идентификатор модели |
|---|---|---|
| Модель контракта | • Студия Document Intelligence • REST API • SDK для C# • SDK для Python • SDK для Java • SDK для JavaScript |
готовый контракт |
Требования к входным данным
Поддерживаются следующие форматы файлов.
| Модель | Изображение: JPEG/JPG, PNG, BMP, TIFF, HEIF |
Office: Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML |
|
|---|---|---|---|
| Читать | ✔ | ✔ | ✔ |
| Макет | ✔ | ✔ | ✔ |
| Общий документ | ✔ | ✔ | |
| Предварительно собранный | ✔ | ✔ | |
| Настраиваемая функция извлечения | ✔ | ✔ | |
| Настраиваемая классификация | ✔ | ✔ | ✔ |
- Фотографии и скан-копии: Для наилучших результатов предоставьте одну четкую фотографию или высококачественную скан-копию для каждого документа.
- PDF и TIFF: для PDF и TIFF можно обработать до 2 000 страниц. (С подпиской на бесплатный уровень обрабатываются только первые две страницы.)
- Размер файла: размер файла для анализа документов составляет 500 МБ для платного уровня (S0) и 4 МБ для бесплатного уровня (F0).
- Размеры изображения: размеры должны находиться в диапазоне от 50 пикселей до 10 000 пикселей x 10 000 пикселей.
- Блокировки паролей. Если pdf-файлы заблокированы паролем, необходимо удалить блокировку перед отправкой.
- Высота текста: минимальная высота извлеченного текста составляет 12 пикселей для изображения 1024 x 768 пикселей. Этот размер соответствует тексту кеглем около 8 пунктов при разрешении 150 точек на дюйм.
- Обучение пользовательской модели: максимальное количество страниц для обучающих данных составляет 500 для пользовательской модели шаблона и 50 000 для пользовательской нейронной модели.
- Обучение пользовательской модели извлечения: общий размер обучающих данных составляет 50 МБ для модели шаблона и 1 ГБ для нейронной модели.
- Обучение пользовательской модели классификации: общий размер обучающих данных составляет 1 ГБ, не более 10 000 страниц. Для 2024-11-30 (GA) общий размер обучающих данных составляет 2 ГБ с максимум 10 000 страниц.
- Типы файлов Office (DOCX, XLSX, PPTX): максимальная длина строки составляет 8 миллионов символов.
Попробуйте извлечь данные документа контракта
Узнайте, как из договоров извлекаются данные, включая информацию о клиентах, поставщиках и отдельных позициях. Вам потребуются следующие ресурсы:
Подписка Azure — ее можно создать бесплатно.
Экземпляр Document Intelligence на портале Azure. Вы можете использовать бесплатный ценовой уровень (
F0), чтобы опробовать сервис. После развертывания ресурса выберите Перейти к ресурсу, чтобы получить ключ и конечную точку.
Document Intelligence Studio
На домашней странице Document Intelligence Studio выберите "Налоговые документы".
Вы можете проанализировать примеры налоговых документов или отправить собственные файлы.
Нажмите кнопку "Выполнить анализ", а при необходимости настройте параметры анализа:
Поддерживаемые языки и локали
Чтобы увидеть полный список поддерживаемых языков, см. нашу страницу «Поддержка языков — предварительно созданные модели».
Извлечение полей
Список поддерживаемых полей для извлечения из документов см. на странице схемы модели контракта в нашем репозитории примеров на GitHub.
Пары "ключ-значение контракта" и извлеченные элементы строки находятся в
documentResultsразделе выходных данных JSON.
Следующие шаги
Попробуйте обработать собственные формы и документы с помощью Document Intelligence Studio.
Выполните краткое руководство по анализу документов и начните создавать приложение для обработки документов на выбранном языке разработки.