Модель payStub аналитики документов

Это содержимое относится к: 🟩 версии 4.0 (GA)

Модель payStub в Document Intelligence сочетает мощные возможности оптического распознавания символов (OCR) с моделями глубокого обучения для анализа и извлечения данных о компенсациях и заработке из расчётных листков. API анализирует документы и файлы с информацией о заработной плате, извлекает ключевую информацию и возвращает структурированное представление данных в формате JSON.

Функция версия Идентификатор модели
Модель payStub v4.0: 2024-11-30 (GA) prebuilt-payStub.us

Попробуйте извлечь данные payStub

Расчётные листки — это важные документы, выдаваемые работодателями сотрудникам и содержащие информацию о начислениях, удержаниях и сумме к выплате за определённый расчётный период. Узнайте, как извлекаются данные с помощью prebuilt-payStub.us модели. Вам потребуются следующие ресурсы:

  • Подписка Azure — создайте бесплатную учетную запись

  • Экземпляр Document Intelligence на портале Azure. Вы можете использовать бесплатный ценовой уровень (F0), чтобы опробовать сервис. После развертывания ресурса выберите Перейти к ресурсу, чтобы получить ключ и конечную точку.

    Снимок экрана: расположение ключей и конечной точки на портале Azure.

Document Intelligence Studio

  1. На домашней странице Document Intelligence Studio выберите payStub.

  2. Вы можете проанализировать образец расчётного листка или загрузить собственные файлы.

  3. Нажмите кнопку "Выполнить анализ ", а при необходимости настройте параметры анализа:

Требования к входным данным

Поддерживаются следующие форматы файлов.

Модель PDF Изображение:
JPEG/JPG, PNG, BMP, TIFF, HEIF
Office:
Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML
Читать
Макет
Общий документ
Предварительно собранный
Настраиваемая функция извлечения
Настраиваемая классификация
  • Фотографии и скан-копии: Для наилучших результатов предоставьте одну четкую фотографию или высококачественную скан-копию для каждого документа.
  • PDF и TIFF: для PDF и TIFF можно обработать до 2 000 страниц. (С подпиской на бесплатный уровень обрабатываются только первые две страницы.)
  • Размер файла: размер файла для анализа документов составляет 500 МБ для платного уровня (S0) и 4 МБ для бесплатного уровня (F0).
  • Размеры изображения: размеры должны находиться в диапазоне от 50 пикселей до 10 000 пикселей x 10 000 пикселей.
  • Блокировки паролей. Если pdf-файлы заблокированы паролем, необходимо удалить блокировку перед отправкой.
  • Высота текста: минимальная высота извлеченного текста составляет 12 пикселей для изображения 1024 x 768 пикселей. Этот размер соответствует тексту кеглем около 8 пунктов при разрешении 150 точек на дюйм.
  • Обучение пользовательской модели: максимальное количество страниц для обучающих данных составляет 500 для пользовательской модели шаблона и 50 000 для пользовательской нейронной модели.
  • Обучение пользовательской модели извлечения: общий размер обучающих данных составляет 50 МБ для модели шаблона и 1 ГБ для нейронной модели.
  • Обучение пользовательской модели классификации: общий размер обучающих данных составляет 1 ГБ, не более 10 000 страниц. Для 2024-11-30 (GA) общий размер обучающих данных составляет 2 ГБ с максимум 10 000 страниц.
  • Типы файлов Office (DOCX, XLSX, PPTX): максимальная длина строки составляет 8 миллионов символов.

Поддерживаемые языки и локали

Полный список поддерживаемых языков см. на странице поддержки языков предварительно созданной модели.

Извлечение полей

Для поддерживаемых полей извлечения документов см. страницу схемы модели payStub в нашем репозитории примеров на GitHub.

Поддерживаемые локали

Версия prebuilt-payStub.us поддерживает локаль en-us.

Следующие шаги

  • Попробуйте обработать собственные формы и документы с помощью Document Intelligence Studio

  • Выполните краткое руководство по анализу документов и начните создавать приложение для обработки документов на выбранном языке разработки.