Это содержимое относится к следующему:🟩v4.0 (GA)🟩v3.1 (GA)🟥версия 3.0 (выход на пенсию)🟥версия 2.1 (выход на пенсию)
Azure Document Intelligence в инструментах Foundry — это облачная служба, использующая модели машинного обучения для извлечения пар ключ/значение, текста и таблиц из ваших документов. Возвращенный результат представляет собой структурированные выходные данные JSON. Варианты использования аналитики документов включают автоматическую обработку данных, расширенные стратегии на основе данных и расширенные возможности поиска документов.
Обзор
Являются ли Azure Document Intelligence и Azure Document Intelligence в средствах Foundry одной и той же службой?
Да.
Azure аналитика документов и Azure аналитика документов в средстве Foundry являются одной и той же службой. Служба была переименована из Azure Document Intelligence в Foundry Tools в Azure Document Intelligence в июле 2023 года. Служба предоставляет те же возможности и функции, что и перед переименованием.
Изменения в ценах: нет изменений в ценах. Названия Cognitive Services и службы прикладного ИИ продолжают использоваться в Azure для выставления счетов, анализа затрат, прайс-списков и ценовых API.
Критические изменения: не существует критических изменений в API или клиентских библиотеках.
Интегрируется ли аналитика документов с другими службы Майкрософт?
Да.
Аналитика документов интегрируется со следующими службами:
Возможности искусственного интеллекта
Можно ли использовать аналитику документов с генерируемым ИИ для обработки документов?
Да.
Вы также можете использовать генеративное решение ИИ для работы с документами для взаимодействия с документами (RAG), создания привлекательного содержимого из этих документов и доступа к моделям OpenAI Azure на ваших данных.
С помощью Azure аналитики документов и Azure OpenAI можно создать корпоративное приложение для эффективного взаимодействия с документами с помощью естественного языка. Вы можете легко найти ответы, получить ценные сведения и создать новое и привлекательное содержимое из существующих документов.
Вы можете найти больше информации о шаблоне генерации с дополнением с помощью поиска здесь.
Может ли интеллектуальная обработка документов помочь с семантическим фрагментированием в документах для генерации с дополнением извлечения?
Да.
Аналитика документов может предоставить основные элементы для обеспечения семантического разбиения. Семантическое деление на блоки — это ключевой шаг в дополненной генерации с извлечением (RAG), чтобы обеспечить более плотные контекстные блоки и улучшение релевантности.
Аналитика документов предоставляет модель макета, которая обеспечивает визуальное разложение документа на строки, абзацы, разделы, верхние и нижние колонтитулы.
Затем можно получить результаты в формате markdown, чтобы дополнительно фрагментировать документ по границам раздела или абзаца.
Дополнительные сведения см. в обзоре RAG в аналитике документов
Студия аналитики документов и содержимого
Требуются ли определенные разрешения для доступа к Document Intelligence Studio?
Да.
Необходима активная учетная запись Azure и подписка с по крайней мере ролью читателя для доступа к Document Intelligence Studio.
Для анализа документов и предварительно созданных моделей ниже приведены требования к роли для пользовательских сценариев:
Основные
- Cognitive Services User: Вам нужна эта роль для использования Document Intelligence или ресурса Azure Cognitive Services с несколькими сервисами в Document Intelligence Studio.
Расширенный
- Участник: Эта роль необходима для создания группы ресурсов или ресурса Документального интеллекта.
Для проектов пользовательской модели ниже приведены требования к роли для пользовательских сценариев:
Основные
Cognitive Services User: Вам нужна эта роль для ресурса Document Intelligence или многосервисного Cognitive Services, чтобы обучать пользовательскую модель или анализировать с помощью обученных моделей.
Участник BLOB-объектов хранилища: Эта роль необходима для учетной записи хранилища, чтобы создавать данные проекта и метки.
Расширенный
Участник учетной записи хранения. Эта роль необходима для настройки параметров общего доступа к ресурсам (CORS) для учетной записи хранения. Это однократная попытка, если вы повторно используете ту же учетную запись хранения.
Участник. Для создания группы ресурсов и ресурсов требуется эта роль. Роль участника или участника учетной записи хранения не предоставляет доступ к использованию ресурса аналитики документов или учетной записи хранения, если локальная проверка подлинности (на основе ключей) отключена. Для использования функций в Document Intelligence Studio по-прежнему необходимы основные роли (Пользователь служб Cognitive и Вкладчик данных Blob хранилища).
Дополнительные сведения см. в разделе встроенные роли Microsoft Entra и о назначении ролей Azure в кратком руководстве Document Intelligence Studio.
Можно ли обрабатывать документы с более чем двумя страницами в Document Intelligence Studio?
Да, для платных ресурсов.
Нет, для ресурсов уровня "Бесплатный".
Для ресурсов уровня "Бесплатный" (F0) анализируются только первые две страницы, независимо от того, используете ли вы Document Intelligence Studio, REST API или клиентские библиотеки.
Если вы хотите проанализировать все страницы в документе, перейдите на платный ресурс (S0). В Document Intelligence Studio нажмите кнопку "Параметры" (шестеренка), выберите вкладку "Ресурсы" и проверьте ценовой уровень для анализа документов.
Можно ли изменить каталоги или подписки в Document Intelligence Studio?
Да.
Чтобы изменить каталог в Document Intelligence Studio, выберите кнопку "Параметры" (шестеренка). В разделе "Каталог" выберите каталог из списка и выберите пункт "Переключить каталог". Снова войдите после переключения каталога.
Чтобы изменить подписку или ресурс, перейдите на вкладку "Ресурс " в разделе "Параметры".
Можно ли использовать Document Intelligence Studio с ресурсом, настроенным с брандмауэром или виртуальной сетью?
Да.
Для v4.0 11-30-2024 (GA) автоматическая маркировка размещается в собственной среде вместе с остальной частью сервиса, поэтому нет необходимости в белом списке IP-адресов. Для любой предыдущей версии, если ресурс аналитики документов настроен с брандмауэром или виртуальной сетью, необходимо добавить выделенный IP-адрес 20.3.165.95 в список разрешений брандмауэра для ресурса Аналитики документов. Некоторые функции в пользовательских проектах (например, автоматическая маркировка, управление проектами и участие человека в процессе) не работают, если отключен доступ к публичной сети.
Когда я загружаю файл в Document Intelligence Studio с помощью функции "Извлечение из URL", могу ли я использовать URL из моего блоб-хранилища?
Да.
Если URL-адрес вашего хранилища BLOB-объектов Azure включает токен SAS и доступен из публичных сетей. Вы не можете использовать функцию Fetch для учетных записей хранения, где доступ к ключу отключен или находится за брандмауэром или виртуальной сетью.
Можно ли повторно использовать или настраивать возможности маркировки из Document Intelligence Studio и создавать их в собственном приложении?
Да.
Опыт маркировки из Document Intelligence Studio опубликован как open source в репозитории Toolkit.
Существуют ли отдельные конечные точки URL-адресов для национальных облачных регионов Аналитики документов?
Да.
Document Intelligence Studio имеет отдельные URL-адреса для суверенных облачных регионов.
URL-адрес облака Azure US Government (Azure Fairfax): Document Intelligence Studio для государственных организаций США.
URL Microsoft Azure, управляемый 21Vianet (Azure Китай): Document Intelligence Studio Китай.
Разработка приложений
Можно ли разрабатывать приложения с помощью Azure аналитики документов с помощью последних вариантов разработки?
Да.
Аналитика документов предлагает последние варианты разработки на следующих платформах:
Можно ли перенести приложение в последнюю версию аналитики документов?
Да.
В следующей таблице приведены ссылки на подробные инструкции по миграции в последнюю версию аналитики документов:
| Язык или API | Руководство по миграции |
|---|---|
| REST API | версия 3 |
| C#/.NET | 4.0.0 |
| Java | 4.0.0 |
| Javascript | 4.0.0 |
| Python | 3.2.0 |
Можно ли указать диапазон страниц для анализа в документе?
Да.
pages Используйте параметр (поддерживается в версии 2.1, версии 3.0 и более поздних версиях REST API) и укажите страницы для документов PDF и TIFF. Принятые входные данные включают следующие диапазоны:
- Отдельные страницы. Например, если указать
1, 2, обрабатываются страницы 1 и 2. - Конечные диапазоны. Например, если указать
2-5, обрабатываются страницы 2–5. - Открытые диапазоны. Например, если указать
5-, обрабатываются все страницы со страницы 5. При указании-10обрабатываются страницы 1–10.
Эти параметры можно смешивать вместе, а диапазоны могут перекрываться. Например, если указать -5, 1, 3, 5-10, обрабатываются страницы 1–10.
Служба принимает запрос, если он может обрабатывать по крайней мере одну страницу документа. Например, использование 5-100 на пятистраничном документе является допустимым вводом, который означает, что страница 5 обрабатывается.
Если вы не предоставляете диапазон страниц, весь документ обрабатывается.
Рекомендуется ли использовать Document Intelligence Studio, а не средство FOTT Sample Labeling для моего проекта?
Да.
Мы рекомендуем Document Intelligence Studio большую часть времени, так как это может сократить время настройки ресурсов аналитики документов и служб хранилища.
Только рассматривайте использование средства тестирования форм (FOTT) для следующих сценариев:
Данные должны оставаться на одном компьютере. Используйте средство FOTT Sample Labeling и контейнер аналитики документов.
Проект очень зависит от api аналитики документов версии 2.1, и вы хотите продолжать использовать API версии 2.1.
Существуют ли лучшие практики по смягчению дросселирования?
Да.
Интеллектуальный анализ документов использует автомасштабирование для предоставления необходимых вычислительных ресурсов по требованию, при этом затраты клиентов остаются низкими. Чтобы уменьшить регулирование во время автомасштабирования, рекомендуется использовать следующий подход:
Реализуйте логику повторных попыток в приложении.
Если вы обнаружите, что количество
POSTзапросов подвергается ограничению, рассмотрите добавление задержки между запросами.Постепенно увеличивайте рабочую нагрузку. Избегайте резких изменений.
Создайте запрос на поддержку для увеличения лимита транзакций в секунду (TPS).
Дополнительные сведения о квотах и ограничениях интеллектуального анализа документов.
Пользовательские модели
Можно ли улучшить оценку точности для пользовательской модели?
Да.
Изменения в визуальной структуре ваших документов могут влиять на точность модели. Ниже приведены некоторые советы.
Включите все варианты документа в обучающий набор данных. Варианты включают различные форматы; например, цифровые и сканированные PDF-файлы.
Разделите визуально различимые типы документов и обучайте разные модели.
Убедитесь, что у вас нет лишних меток.
Для подписи и метки регионов не включайте окружающий текст.
Дополнительные сведения см. в разделе "Точность и оценка достоверности".
Можно ли переобучить пользовательскую модель?
Нет.
Аналитика документов не имеет явной операции переобучения. Каждая операция поезда создает новую модель.
Если вы обнаружите, что вашу модель необходимо переобучить, вы можете добавить больше примеров в обучающий набор данных и обучить новую модель.
Вы также можете создать новую модель для использования вместе с вашей исходной моделью следующим образом:
Создайте набор данных для нового шаблона.
Разметить и обучить новую модель.
Убедитесь, что новая модель хорошо работает для определенных типов документов.
Объедините вашу новую модель с существующей моделью в единую конечную точку. Затем аналитика документов может определить лучшую модель для каждого документа, который необходимо проанализировать.
Дополнительные сведения см. в статье о составных моделях.
Можно ли переместить обученные модели из одной среды (например, бета-версии) в другую (например, рабочую среду)?
Да.
API копирования можно использовать для копирования пользовательских моделей из одной учетной записи аналитики документов в другие, которые существуют в любом поддерживаемом географическом регионе. Подробные инструкции см. в разделе "Аварийное восстановление".
Операция копирования ограничена копированием моделей в конкретной облачной среде, в которой вы обучили модель. Например, копирование моделей из общедоступного облака в облако Azure для государственных организаций не поддерживается.
Взимается ли плата при использовании автоматической маркировки?
Да. Автоматическая метка сопряжена с затратами, эквивалентными запросу на анализ соответствующей модели для документа.
Взимается ли плата при обучении пользовательских моделей?
Да.
Для v4.0 11-30-2024 (GA) настраиваемых нейронных моделей обучение может проводиться бесплатно в течение максимум 10 часов. Если вы обучаете одну модель в течение 10 часов или обучаете несколько моделей в течение 10 часов, плата за первые 10 часов не взимается. После использования бесплатных 10 часов с вас автоматически взимается плата за дополнительный час обучения. Дополнительные сведения о ценах см. на странице цен. Эта новая функция платного обучения позволяет модели обучения в течение длительного времени обрабатывать более крупные документы. Дополнительные сведения об этой платной обучающей функции см. в разделе биллинга для пользовательской нейронной модели.
Для v3.0 2022-08-31 или v3.1 2023-07-31, пользовательские нейронные модели могут быть обучены бесплатно для не более чем 20 обучающих сеансов, при этом каждый сеанс ограничен 30 минутами обучения. После использования всех 20 тренировочных сессий вы можете обратиться в техподдержку Azure, чтобы создать тикет для увеличения лимита сессий. Чтобы увеличить ограничение, две тренировки считаются одним учебным часом, и плата взимается за два сеанса / один учебный час. Дополнительные сведения о ценах см. на странице цен. Для получения дополнительной информации о способах увеличения лимита см. раздел оплаты пользовательской нейронной модели. Для v3.0 и v3.1, платная функция обучения недоступна. Функция платного обучения для пользовательской нейронной модели доступна только в v4.0.
Учетная запись хранения
Существует ли срок действия для токена SAS, который я использую для аутентификации учетной записи хранения?
Да.
При создании разделяемой сигнатуры доступа (SAS) длительность по умолчанию составляет 48 часов. Через 48 часов необходимо создать новый токен.
Рассмотрите возможность увеличения периода использования вашей учетной записи хранения в рамках технологии Document Intelligence.
Может ли аналитика документов получить доступ к данным в учетной записи хранения, если она находится за виртуальной сетью или брандмауэром?
Нет, не напрямую.
Аналитика документов не может получить доступ к учетной записи хранения, если она защищена виртуальной сетью или брандмауэром.
Тем не менее, доступ и проверка подлинности для частной учетной записи хранения Azure поддерживают управляемые идентификаторы для ресурсов Azure. При использовании управляемого удостоверения Document Intelligence может получить доступ к вашей учетной записи хранения с помощью назначенных учетных данных.
Если вы планируете проанализировать данные частной учетной записи хранения с помощью FOTT, необходимо развернуть средство в рамках виртуальной сети или брандмауэра.
Узнайте, как создать и использовать управляемое удостоверение для ресурса Аналитики документов.
Контейнеры
Существует ли разница между отключенными и подключенными контейнерами?
Да.
Хотя возможности модели одинаковы для подключенных и отключенных контейнеров, методы выставления счетов и подключений отличаются:
Подключенные контейнеры отправляют сведения о выставлении счетов в Azure с помощью ресурса аналитики документов в учетной записи Azure. При использовании подключенных контейнеров для отправки биллинг информации в Azure требуется подключение к Интернету. Контейнеры, подключенные к аналитике документов, отправляют информацию о выставлении счетов в Azure с использованием ресурса аналитики документов на вашей учетной записи Azure. Подключенные контейнеры не отправляют данные клиента, такие как изображение или текст, который анализируется, в Microsoft. Пример сведений о том, какую информацию подключенные контейнеры отправляют в Microsoft для выставления счетов, см. в разделе Часто задаваемые вопросы о контейнерах Azure.
Отключенные контейнеры позволяют использовать API, которые отключены от Интернета. Сведения о выставлении счетов не отправляются через Интернет. Вместо этого плата основана на приобретенном уровне подписки. В настоящее время отключенное использование контейнера доступно для пользовательских моделей аналитики документов и счетов.
Можно ли использовать локальное хранилище для контейнера средства разметки образцов для интеллектуального анализа документов (FOTT)?
Да.
FOTT имеет версию, которая использует локальное хранилище. Версия должна быть установлена на компьютере Windows. Его можно установить из этого места.
На странице проекта укажите URI папки меток как /shared или /shared/sub-dir , если файлы меток находятся в подкаталоге. Все остальные функции средства разметки образцов Document Intelligence аналогичны работе размещенной службы.
Существуют ли лучшие методы для увеличения масштаба?
Да.
Для асинхронных вызовов можно запускать несколько контейнеров с общим хранилищем. Контейнер, обрабатывающий POST вызов анализа, сохраняет выходные данные в хранилище. Затем любой другой контейнер может получить результаты из хранилища и обслуживать GET вызовы. Идентификатор запроса не привязан к контейнеру.
Для синхронных вызовов можно запускать несколько контейнеров, но только один контейнер обслуживает запрос. Так как это блокирующий вызов, любой контейнер из пула может обработать запрос и отправить ответ. Здесь только один контейнер привязан к запросу за раз, и опрос не требуется.
Можно ли настроить контейнеры с общим хранилищем?
Да.
Контейнеры используют Mounts: Shared свойство при запуске для указания общего хранилища для хранения файлов обработки. Сведения об использовании этого свойства см. в документации по контейнерам.
Безопасность и конфиденциальность
Сохраняет ли Document Intelligence мои данные?
Да, кратко.
Для всех функций Document Intelligence временно сохраняет данные и результаты в служба хранилища Azure в том же регионе, что и запрос. Затем данные удаляются через 24 часа с момента отправки запроса на анализ. Если вы хотите, чтобы данные были удалены раньше, вы можете вызвать delete analyze response. Этот API помечает результаты удаления и доступен в API версии 4.0.
Дополнительные сведения о данных, конфиденциальности и безопасности для аналитики документов.
Для обученных пользовательских моделей машинного обучения промежуточные выходные данные после анализа и разметки хранятся в том же расположении служба хранилища Azure, где хранятся данные обучения. Обученные пользовательские модели хранятся в служба хранилища Azure в том же регионе и логически изолированы с использованием вашей подписки Azure и учетных данных API.
Дополнительная помощь и поддержка
Доступны ли другие ресурсы для решения вопросов Azure интеллектуальной обработки документов?
Да.
Можно ли предоставить прямую обратную связь, если служба не распознает определенный текст или неправильно распознает его, когда я подписываю документы?
Да.
Мы постоянно обновляем и совершенствуем модели аналитики документов. Вы можете отправить сообщение группе аналитики документов. По возможности поделитесь примером документа с выделенной проблемой.