Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Служба распознавания содержимого Azure в средстве Foundry обновляется на постоянной основе. Добавьте эту страницу в закладки, чтобы оставаться в курсе заметок о выпуске, улучшений функций и новой документации.
Примечание
Служба "Понимание содержимого 2025-11-01" теперь доступна для всех с выпуском версии API.
Важно
Предварительная версия API 2024-12-01-preview и 2025-05-01-preview будет прекращена к 15 июля 2026 года. Если вы по-прежнему используете API предварительной версии, обновите код, чтобы выбрать последнюю версию 2025-11-01 (GA)API.
Версии 2024-12-01-preview API и 2025-05-01-preview доступны в общедоступной предварительной версии. Эти предварительные версии предоставляются без соглашения об уровне обслуживания и не рекомендуется для использования в производственной среде. Дополнительные сведения см. в разделе Supplemental Terms of Use for Microsoft Azure Previews и Microsoft Products and Services Data Protection Addendum (DPA).
Май 2026 г.
Интеграция MarkItDown
Теперь функция "Понимание содержимого" интегрирована с средством MarkItDown Microsoft для преобразования документов и других типов файлов в Markdown. Используйте возможность Azure Content Understanding для преобразования изображений, аудио, видео и документов в Markdown для использования с языковыми моделями и конвейерами агентов.
Встроенные роли RBAC для распознавания содержимого
Добавлены встроенные роли RBAC Cognitive Service Content Understanding Owner, Contributor и Reader для обеспечения детализированного управления доступом. Для получения дополнительной информации см. Управляемые удостоверения.
Новые регионы поддержки GPT-5.2 в Студии распознавания содержимого
Студия Content Understanding Studio теперь поддерживает GPT-5.2 за пределами исходного региона "Восточная часть США 2", что обеспечивает более широкое региональное покрытие для создания ресурсов и развертывания. Теперь поддерживаются следующие регионы:
- Восточная часть США 2
- Восточная часть США
- Восточная Австралия
- Восточная Япония
- Северная Европа
- Южная часть США
- Юго-Восточная Азия
- Центральная Швеция
- Южная Часть Великобритании
- Западная Европа
- Западная часть США
- Западная часть США 3
Полный список поддерживаемых моделей и регионов см. в таблице регионов Foundry Models.
Апрель 2026 г.
Поддержка модели GPT-5.2 и обновления по развертыванию модели
Content Understanding теперь поддерживает модель GPT-5.2 в качестве рекомендуемой модели завершения. GPT-5.2 обеспечивает улучшенное качество и производительность по сравнению с предыдущими поколениями. Полный список поддерживаемых моделей и параметров развертывания см. в разделе "Варианты развертывания модели" для анализаторов "Распознавание содержимого".
Интеграция LangChain
В пакете langchain-azure-ai теперь доступен загрузчик документов для понимания содержимого для LangChain. Используйте его для загрузки и обработки документов с помощью понимания контента непосредственно из конвейеров LangChain. Ознакомьтесь с демонстрационной записной книжкой для пошагового руководства по использованию.
интеграция Microsoft Agent Framework (предварительная версия)
Функция "Понимание содержимого" теперь доступна в виде пакета для платформы агента Microsoft. Установите agent-framework-azure-contentunderstanding из PyPI, чтобы добавить функции понимания содержимого вашим агентам. Примеры использования см. в примерах .
Обновления пакета SDK: to_llm_input() вспомогательный (предварительная версия)
Новая вспомогательная функция to_llm_input() доступна во всех языках SDK. Он форматирует результаты извлечения полей "Распознавание содержимого" в markdown с помощью frontmatter YAML, что упрощает передачу структурированных выходных данных непосредственно в языковые модели.
| Язык | Версия пакета | Образец |
|---|---|---|
| Python | azure-ai-contentunderstanding 1.2.0b1 |
sample_to_llm_input.py |
| .NET | Azure.AI.ContentUnderstanding 1.2.0-beta.1 |
samples |
| JavaScript/TypeScript | @azure/ai-content-understanding 1.2.0-beta.1 |
JS · TS |
| Java | azure-ai-contentunderstanding |
samples |
Обновления портала Foundry
Портал Foundry теперь включает предварительно созданную площадку анализаторов для изучения возможностей распознавания содержимого без написания кода. Чтобы сравнить доступные возможности в Foundry и Content Understanding Studio, см. "Сравнение понимания контента в Foundry и Content Understanding Studio".
Март 2026 г.
Клиентские библиотеки пакета SDK для распознавания содержимого теперь общедоступны
Нативные клиентские библиотеки SDK для осмысления контента теперь доступны для Python, .NET, Java и JavaScript/TypeScript — предназначенные для версии API 2025-11-01 GA. Пакеты SDK предоставляют строго типизированные модели, встроенные механизмы опроса длительных операций, интеграцию аутентификации Azure, автоматические повторные попытки и полную согласованность с рекомендациями по проектированию Azure SDK. Для продуктовых приложений рекомендуется использовать официальные пакеты SDK вместо необработанных вызовов REST.
| Язык | Пакет | Примеры пакета SDK | Установить | Репозиторий SDK |
|---|---|---|---|---|
| Python | azure-ai-contentunderstanding |
samples | pip install azure-ai-contentunderstanding |
azure-sdk-for-python |
| .NET | Azure.AI.ContentUnderstanding |
samples | dotnet add package Azure.AI.ContentUnderstanding |
azure-sdk-for-net |
| Java | azure-ai-contentunderstanding |
samples | См . Maven Central | azure-sdk-for-java |
| Javascript | @azure/ai-content-understanding |
samples | npm install @azure/ai-content-understanding |
azure-sdk-for-js |
| Typescript | @azure/ai-content-understanding |
samples | npm install @azure/ai-content-understanding |
azure-sdk-for-js |
Совет
Ознакомьтесь с кратким руководством по пониманию содержимого и ознакомьтесь со ссылками на ресурсы для получения дополнительных сведений.
Поддержка межрегиональной собственной емкости (BYOC)
Теперь возможность BYOC поддерживает развертывание моделей между регионами. Клиенты могут использовать любые Azure развертывания OpenAI независимо от ресурса или региона. Для получения деталей см. раздел "Использование собственной кросс-ресурсной емкости в понимании содержимого".
Обновления Студии анализа содержимого
- Выбор модели GPT-4.1-mini: Студия теперь поддерживает выбор модели GPT-4.1-mini, что дает более гибкие возможности для балансировки качества и стоимости.
- Поддержка ввода обычного текста (.txt) — теперь вы можете обрабатывать обычные текстовые документы непосредственно в Studio.
- Анализаторы RAG на вкладке "Обнаружение": вкладка "Обнаружение" теперь включает анализаторы RAG, что упрощает изучение и пробную попытку непосредственно из пользовательского интерфейса.
Обновления анализатора
- Поддержка более крупных анализаторов: для сложных типов документов (таких как крупные формы или подробные контракты), теперь можно определить комплексные схемы извлечения, что обеспечивает более полную запись данных в одном проходе.
- Увеличена глубина вложенной схемы: максимальная глубина вложения для анализаторов извлечения документов увеличена с 5 до 7. Это поддерживает более сложные комбинации анализаторов, допускающие два дополнительных уровня вложенных анализаторов, что приносит преимущества в таких сценариях, как налоговые и аудиторские рабочие процессы.
Январь 2026 г.
- Доступность Foundry (new) — новые модели чтения и раскладки теперь доступны прямо на портале Foundry (new).
- Анализаторы чтения и макета перестроены: предварительно созданные модели чтения и макета больше не требуют указания модели (LLM). Кроме того, они больше не требуют настройки ресурса Foundry с помощью модели. Понимание контента может использовать их, даже если модель не определена в
contentunderstanding/defaults. - Updated GitHub samples: доступны новые и обновленные примеры, включая обновленные примеры Python и .NET. Были также обновлены другие примеры.
Декабрь 2025 г.
Обновление процессов чтения и макета
- Предопределенные модели Чтения и Компоновки больше не требуют указания модели (LLM). Кроме того, они больше не требуют настройки ресурса Foundry с помощью модели. Content Understanding запускает их, даже в случае отсутствия определенной модели
contentunderstanding/defaults.
Обновлённые примеры GitHub
- Теперь доступны новые и обновленные примеры, включая обновленные примеры Python и .NET. Были также обновлены другие примеры.
Доступность foundry (new)
- Предварительно созданные модели анализатора чтения и макета теперь доступны непосредственно на портале Foundry (new).
Ноябрь 2025 г.
Azure Распознавание содержимого в инструментах Foundry теперь общедоступно с версией API 2025-11-01. В выпуске обеспечивается готовность к производству, а также улучшения, ориентированные на потребности клиентов, в выборе моделей, управлении и безопасности.
Гибкость выбора правильной модели создания искусственного интеллекта для каждой рабочей нагрузки
- Подключите понимание содержимого к развертыванию модели Foundry Microsoft для создания искусственного интеллекта, чтобы управлять качеством, задержкой и затратами. Вы можете выбрать развертывания единиц пропускной способности (PTU) с оплатой по факту использования или с резервированием для вашей модели Foundry. Узнайте, какие модели сейчас поддерживаются. Чтобы попробовать это, см. Как создать пользовательский анализатор в Студии понимания контента.
- Выбор модели дает возможность гибко оптимизировать развертывание модели Foundry с такими параметрами, как тип (Global, DataZone или Региональный) и обеспеченные единицы пропускной способности (PTUs), чтобы зарезервировать емкость для прогнозируемых, высокообъемных рабочих нагрузок. Дополнительные сведения см. в разделе "Типы развертывания" для моделей Foundry.
- Прозрачная модель ценообразования обеспечивает четкое представление о затратах на извлечение содержимого, контекстуализацию и использование модели создания. Понимание содержимого взимает плату только за извлечение содержимого (на страницу или минуту) и контекстуализацию. Генеративные функции напрямую используют развертывание модели Foundry с взиманием платы за использование стандартных токенов. Дополнительные сведения см. в описании ценообразования.
Обновления анализатора
-
Оптимизируйте производительность и сокращайте затраты с помощью детального контроля над извлечением полей. Включите оценки достоверности и ориентир на источник только для полей, в которых требуется проверка и трассировка, используя параметр конфигурации
estimateSourceAndConfidence. Этот выборочный подход сокращает размеры полезных данных ответа и снижает затраты на обработку и задержку, вычисляя метрики достоверности только при необходимости. Оценки достоверности поддерживаются только для файлов документов. -
Классификация теперь интегрирована с API анализатора, который поддерживает классификацию
contentCategoriesс помощью свойства. Число поддерживаемых категорий расширяется от 50 до 200, что позволяет точно классификировать и маршрутизацию различных типов файлов в одном анализаторе — не требуется отдельный классификатор. Пример см. в статье "Создание решения для автоматизации роботизированных процессов ". - API жизненного цикла анализатора расширяются для поддержки копирования, удаления и замены, чтобы обеспечить полный контроль над версиями анализатора. Дополнительные сведения см. в статье "Миграция проектов из предварительной версии в общедоступную версию ".
- Удаление результатов анализа. Теперь вы можете явно удалить результаты анализатора после их получения, что позволяет контролировать хранение данных для соответствия требованиям и конфиденциальности. См. раздел "Удалить ответ на анализ".
Анализаторы RAG
Оптимизированные анализаторы RAG для сценариев генерации, дополненной извлечением. Они извлекают содержимое в формате markdown и выполняют семантический анализ, чтобы повысить качество извлечения для последующих приложений.
-
Документы:
prebuilt-documentSearchизвлекает абзацы, таблицы и описания рисунков из документов. Он включает текстовое описание изображений, диаграмм и схем. Он записывает рукописные заметки, создает сводки содержимого и поддерживает широкий спектр форматов файлов , включая PDF, изображения, документы Office и текстовые файлы. - Поддержка мультимодальных операций: распространяется на видео, изображения и аудио с извлечением транскриптов и сводками на основе сегментов с автоматическим обнаружением сцен для описания визуального содержимого и анализа, а также для транскрибирования бесед с диаризацией говорящих и поддержкой нескольких языков.
Просмотрите полный каталог анализаторов в разделе готовые анализаторы в Понимании содержимого.
Предварительно созданные анализаторы для отраслевых рабочих нагрузок
Предварительно созданные анализаторы для конкретного домена предназначены для отраслевых сценариев. Они позволяют автоматически извлекать структурированные данные из специализированных типов документов без пользовательского обучения.
- Финансы и налог: извлечение ключевых данных из финансовых заявлений, налоговых форм, W-2s, 1099s и других налоговых документов с настроенными схемами, которые фиксируют суммы, даты, налоговые идентификаторы и финансовые сущности. Ознакомьтесь с финансами и налогами.
- Закупки и контракты: обработка заказов на покупку, контракты и документы о закупках для извлечения сведений о поставщиках, строковых элементах, ценах, условиях и договорных обязательствах. См. юридические и бизнес-документы.
- Ипотека и кредитование: автоматизация извлечения из ипотечных приложений, документов кредита и форм кредитования, захват сведений о заемщике, информации о собственности, условиях кредита и финансовых раскрытиях. См. ипотеку и кредитование.
-
Проверка личности: обработка паспортов, водительских удостоверений, идентификационных карт и других документов удостоверения личности с
prebuilt-idDocument, извлечение персональных данных, номеров документов и сведений для проверки. Классификация позволяет отправлять определенные разделы, такие как страницы паспорта, в специально созданные анализаторы во время одного запуска. См. документы, удостоверяющие личность. - Коммунальные услуги, выставление счетов и многое другое: извлечение структурированных данных из счетов за коммунальные услуги, счетов-фактур и платежных ведомостей в разных отраслях, включая данные об учетной записи, информация об использовании и данные об оплате.
Ознакомьтесь с рядом анализаторов для конкретных доменов и рекомендациями по их использованию в встроенных анализаторах в разделе "Понимание содержания".
Извлечение содержимого
-
Аннотации содержимого -
digital PDFполя ввода поддерживают аннотации для предоставления дополнительных метаданных о документе. Метаданные могут определять диапазоны содержимого с заметками, такими как выделение, подчеркивание, зачеркивание и многое другое. - Таблицы с несколькими страницами и форматы выходных данных— можно выбрать формат выходных данных таблицы между HTML или Markdown, чтобы выровнять потребности приложения. Таблицы также являются многостраниными по умолчанию. Служба возвращает многостраничные таблицы в виде одного объекта таблицы.
- Извлечение гиперссылки . Теперь служба извлекает гиперссылки, внедренные в документы в виде URL-адреса.
- Извлечение изображений. Теперь служба может извлекать графики и диаграммы в синтаксисе chart.js или mermaid.js в зависимости от типа, а также их описание.
Извлечение полей
- Оценки достоверности теперь постоянно доступны во всех методах извлечения информации из документов — будь то извлечение, генерация или классификация, — предоставляя вам одинаковые показатели качества независимо от того, как вы обрабатываете поля. Оценка достоверности поддерживается только в текстовом формате. Узнайте, как включить оценки достоверности для извлечения полей.
- Упрощенное определение схемы с интеллектуальными значениями по умолчанию и оптимизированными рабочими процессами. Метод извлечения теперь необязателен. Служба "Понимание содержимого" автоматически выбирает оптимальный подход для каждого поля, что снижает сложность конфигурации. Это интеллектуальное поведение упрощает создание и обслуживание анализаторов без глубокого знания методов извлечения.
- Добавлена поддержка сложных типов, таких как объекты: определение объекта, например объекта клиента с содержащимися полями имени, адреса и телефона.
Корпоративная безопасность и управление
- Общая доступность функций включает Microsoft Entra ID, управляемые удостоверения, ключи, управляемые клиентом, виртуальные сети и частные конечные точки.
- Эти элементы управления сохраняют конфиденциальное содержимое в границах Azure и помогают соответствовать требованиям соответствия нормативным стандартам. Дополнительные сведения см. в разделе "Безопасный доступ к пониманию содержимого".
Другие улучшения
-
prebuilt-readиprebuilt-layoutанализаторы теперь позволяют использовать ключевые возможности интеллектуального анализа документов для понимания содержимого. См. предварительно созданные анализаторы. -
prebuilt-layoutWithFiguresрасширяет извлечение макета с помощью обнаружения и анализа фигур, извлечения и суммирования диаграмм, схем и изображений с их контекстом. См. предварительно созданные анализаторы. - При анализе содержимого теперь можно предоставить диапазон страниц только для анализа определенных страниц входного документа.
- Сегментация и классификация (
contentCategories) позволяют отправлять разделы в специально созданные анализаторы во время одного запуска. Например,prebuilt-idDocumentклассифицирует страницы и направляет их в конкретные анализаторы (такие как анализаторы паспортов и водительских удостоверений), каждый из которых имеет собственные схемы — все в рамках единого запуска.
Расширение и доступность регионов
- Теперь понимание содержимого поддерживается в 14 регионах по всему миру, обеспечивая более широкий географический охват и улучшенные варианты расположения данных. Подробный список доступных регионов см. в документации по поддержке языка и региона .
- Понимание содержимого доступно в Content Understanding Studio и с помощью REST API для программного взаимодействия.
Критические изменения
- Управляемая мощность для генеративных моделей предварительной версии упразднена. Чтобы использовать распознавание содержимого, вы всегда используете собственную большую языковую модель Foundry и внедрения встраиваний.
- API специальных классификаторов устарели, так как классификация теперь находится внутри API анализатора как функция
contentCategories. - Сегментирование видео теперь можно сделать при помощи функционала
contentCategories, объединяя API для сегментирования файлов в анализаторах документов и видео. - API предварительной версии (
2025-05-01-preview) не переносит режим Pro для межфайлового анализа или каталога пользователя с интеграцией API распознавания лиц.
Октябрь 2025 г.
Предварительная версия службы "Общие сведения о содержимом" содержит следующие обновления:
- Теперь понимание содержимого увеличило количество полей (1000) для всех модальностей.
- Теперь текст ответа API включает входные, выходные и контекстуальные токены, используемые как часть объекта токенов. Посмотрите статью по быстрому старту для получения дополнительной информации.
Май 2025 г.
Теперь доступен REST API Azure распознавания содержимого 2025-05-01-preview. Это обновление содержит следующие обновления и расширенные возможности:
Режимы обработки
В выпуске 2025-05-01-preview вводятся два режима: standard и pro. Режим по умолчанию для всех анализаторов standard.
Режим "Понимание содержимого" добавляет причины, поддержку нескольких входных документов и возможность настроить внешнюю базу знаний для связывания, обогащения и проверки. Эти функции автоматизируют сложные задачи, расширяя возможности извлечения полей, чтобы охватить сценарии, которые ранее требовали пользовательского кода или человеческих усилий.
Режим pro (предварительная версия) в настоящее время ограничен использованием документов в качестве входных данных, но в ближайшее время будет добавлена поддержка других типов содержимого. Распространенные проблемы, которые решает профессиональный режим, включают агрегирование схемы из содержимого различных входных файлов, проверку результатов в документах и использование внешних знаний для генерации выходной схемы. Дополнительные сведения о режиме pro (предварительная версия).
Опыт Foundry
В этом выпуске теперь доступны следующие обновления в интерфейсе "Понимание содержимого" в Microsoft Foundry:
- Добавлена поддержка создания задач как режима
standard, так и режимаproв существующем интерфейсе работы с распознаванием контента. Теперь, используя режим «Pro», вы можете привлекать собственные эталонные данные и создавать задачу, выполняющую многогранное рассуждение с использованием ваших данных. Дополнительные сведения о двух разных типах задач см. в разделе Создание стандартных и профессиональных задач по пониманию контента на портале Foundry (классическая версия). - Теперь доступны пробные версии для анализа общих документов и счетов. Попробуйте эти предварительно созданные функции в собственных данных и начните получать аналитические сведения без необходимости создавать настраиваемую задачу.
Классификация и разделение документов
В этом выпуске представлен новый API классификации. Этот API поддерживает классификацию и логический разделение одного файла, содержащего несколько документов с необязательной маршрутизацией для анализаторов извлечения полей. Можно создать пользовательский классификатор, чтобы разделить и классифицировать файл в несколько логических документов и перенаправлять отдельные документы в нижестоящей модели извлечения полей в одном вызове API.
Улучшения обработки документов
- Добавлена поддержка извлечения таблицы, охватывающей несколько страниц в виде одной логической таблицы. Дополнительные сведения об извлечении структуры в документах.
- Поддержка меток выделения для флажка и переключателей в виде символов Юникода. Дополнительные сведения об извлечении структуры в документах.
- Извлечение штрихкода как часть извлечения содержимого по умолчанию вместе с
OCR. Дополнительные сведения об извлечении структуры в документах. - Улучшение оценки достоверности с лучшими результатами обоснования для извлеченных полей.
- Поддержка нового формата файла для следующих типов документов:
docx,xslx,pptxmsgemlrtf,htmlmdи .xml
Улучшения обработки видео
- Добавлена поддержка целых полей видео. Узнайте больше об улучшениях обработки видео.
- Добавлена поддержка видеоглавы с помощью сегментации. Узнайте больше об улучшениях обработки видео.
- Добавлена поддержка идентификации лиц на извлеченных миниатюрах лиц. Идентичность улучшает описание и последующие задачи, такие как поиск и извлечение.
- Добавлена поддержка деактивации размытия лиц в настройках анализатора. Узнайте больше об улучшениях обработки видео.
Улучшения обработки звука
- Добавлены дополнительные региональные настройки для транскрибирования звука. Дополнительные сведения о возможностях звука.
- Добавлена поддержка многоязычной обработки звука. Узнайте больше об улучшениях обработки языка в аудио.
- Увеличен максимальный размер поддерживаемого файла до 1 ГБ и длина до 4 часов. Дополнительные сведения об ограничениях аудиослужбы.
API распознавания лиц (предварительная версия)
В этом выпуске добавлены новые возможности обнаружения лиц и распознавания лиц в Content Understanding. Вы можете создать каталог лиц и персон. Используйте каталог для распознавания лиц в обработанном содержимом. Узнайте больше об обнаружении и распознавании лиц.
Апрель 2025 г.
2024-12-01-preview REST API представляет следующие обновления и расширенные возможности:
-
Общие улучшения. Чтобы запросить увеличение текущих лимитов, обратитесь
cu_contact@microsoft.comпо всем модальностям. - Предварительно созданный шаблон счета. Шаблон счета теперь настраивается. Выбрав шаблон счета, вы можете получить доступ к предопределенному списку полей, которые можно настроить в соответствии с вашими потребностями, добавив или удалив поля.
-
Генеративные и классификационные поля
- Теперь для модальности документов поддерживаются как генеративные, так и классификационные поля.
- Теперь можно использовать конечную точку REST или Студию для определения полей создания и классификации с выходными данными нулевого снимка для документов. Эта функция позволяет создавать сводки, выводить результаты и классифицировать отдельные документы по нескольким файлам.
- Для обработки отдельных файлов можно вызвать несколько анализаторов.
-
Модальность видео
- Улучшение задержки для обработки видео, что приводит к снижению задержки в 50%.
- Расширенные типы выходных данных для добавления поддержки
ObjectиArrays. - Добавлена поддержка видеофайлов, предоставляемых с помощью предварительного приема URL-адреса S3.
- Улучшена семантическая сегментация видео, особенно в случаях, когда в видео нет монтажных изменений.
-
Модальность звука
- API теперь поддерживает тип поля:
group
- API теперь поддерживает тип поля:
-
Модальность текста
- Поддержка API для типа поля:
group
- Поддержка API для типа поля:
-
Улучшения взаимодействия с пользователем
- Добавлена функциональность для скачивания и отправки конфигураций схем во время определения схемы.
- Усовершенствованные процессы создания меток файлов и разработки анализатора.
- Добавлены примеры кода для быстрой настройки.
Ноябрь 2024 г.
Приветствовать! Версия API Azure распознавания содержимого 2024-12-01-preview теперь доступна в общедоступной предварительной версии. Эта версия позволяет создать структурированное представление контента, адаптированного к определенным задачам из различных модальностей или форматов. Content Understanding использует определенную схему для извлечения содержимого, подходящего для обработки большими языковыми моделями и последующими приложениями.