Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Это содержимое относится к: 🟩 версии 4.0 (GA)
Модель payStub в Document Intelligence сочетает мощные возможности оптического распознавания символов (OCR) с моделями глубокого обучения для анализа и извлечения данных о компенсациях и заработке из расчётных листков. API анализирует документы и файлы с информацией о заработной плате, извлекает ключевую информацию и возвращает структурированное представление данных в формате JSON.
| Функция | версия | Идентификатор модели |
|---|---|---|
| Модель payStub | v4.0: 2024-11-30 (GA) | prebuilt-payStub.us |
Попробуйте извлечь данные payStub
Расчётные листки — это важные документы, выдаваемые работодателями сотрудникам и содержащие информацию о начислениях, удержаниях и сумме к выплате за определённый расчётный период. Узнайте, как извлекаются данные с помощью prebuilt-payStub.us модели. Вам потребуются следующие ресурсы:
Подписка Azure — создайте бесплатную учетную запись
Экземпляр Document Intelligence на портале Azure. Вы можете использовать бесплатный ценовой уровень (
F0), чтобы опробовать сервис. После развертывания ресурса выберите Перейти к ресурсу, чтобы получить ключ и конечную точку.
Document Intelligence Studio
На домашней странице Document Intelligence Studio выберите payStub.
Вы можете проанализировать образец расчётного листка или загрузить собственные файлы.
Нажмите кнопку "Выполнить анализ ", а при необходимости настройте параметры анализа:
Требования к входным данным
Поддерживаются следующие форматы файлов.
| Модель | Изображение: JPEG/JPG, PNG, BMP, TIFF, HEIF |
Office: Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML |
|
|---|---|---|---|
| Читать | ✔ | ✔ | ✔ |
| Макет | ✔ | ✔ | ✔ |
| Общий документ | ✔ | ✔ | |
| Предварительно собранный | ✔ | ✔ | |
| Настраиваемая функция извлечения | ✔ | ✔ | |
| Настраиваемая классификация | ✔ | ✔ | ✔ |
- Фотографии и скан-копии: Для наилучших результатов предоставьте одну четкую фотографию или высококачественную скан-копию для каждого документа.
- PDF и TIFF: для PDF и TIFF можно обработать до 2 000 страниц. (С подпиской на бесплатный уровень обрабатываются только первые две страницы.)
- Размер файла: размер файла для анализа документов составляет 500 МБ для платного уровня (S0) и 4 МБ для бесплатного уровня (F0).
- Размеры изображения: размеры должны находиться в диапазоне от 50 пикселей до 10 000 пикселей x 10 000 пикселей.
- Блокировки паролей. Если pdf-файлы заблокированы паролем, необходимо удалить блокировку перед отправкой.
- Высота текста: минимальная высота извлеченного текста составляет 12 пикселей для изображения 1024 x 768 пикселей. Этот размер соответствует тексту кеглем около 8 пунктов при разрешении 150 точек на дюйм.
- Обучение пользовательской модели: максимальное количество страниц для обучающих данных составляет 500 для пользовательской модели шаблона и 50 000 для пользовательской нейронной модели.
- Обучение пользовательской модели извлечения: общий размер обучающих данных составляет 50 МБ для модели шаблона и 1 ГБ для нейронной модели.
- Обучение пользовательской модели классификации: общий размер обучающих данных составляет 1 ГБ, не более 10 000 страниц. Для 2024-11-30 (GA) общий размер обучающих данных составляет 2 ГБ с максимум 10 000 страниц.
- Типы файлов Office (DOCX, XLSX, PPTX): максимальная длина строки составляет 8 миллионов символов.
Поддерживаемые языки и локали
Полный список поддерживаемых языков см. на странице поддержки языков предварительно созданной модели.
Извлечение полей
Для поддерживаемых полей извлечения документов см. страницу схемы модели payStub в нашем репозитории примеров на GitHub.
Поддерживаемые локали
Версия prebuilt-payStub.us поддерживает локаль en-us.
Следующие шаги
Попробуйте обработать собственные формы и документы с помощью Document Intelligence Studio
Выполните краткое руководство по анализу документов и начните создавать приложение для обработки документов на выбранном языке разработки.