Цены на понимание содержимого Azure в инструментах Foundry

В этой статье описывается модель ценообразования Azure Content Understanding in Foundry Tools с четкими примерами и разбивкой затрат. Узнайте, за что взимается плата и как оценить затраты на рабочую нагрузку.

Дополнительные сведения о ценах см. в разделе Azure Ценовая информация о содержимом.

Общие сведения о двух типах расходов

цены Azure Content Understanding основаны на двух основных категориях использования:

1. Плата за извлечение содержимого

Извлечение содержимого преобразует неструктурированные входные данные (документы, аудио, видео) в структурированный, доступный для поиска текст и содержимое. Эти выходные данные включают оптическое распознавание символов (OCR) для документов, синтез речи в текст для аудио и видео, обнаружение макета. Вы платите за единицу ввода, обработанную:

  • Документы: за 1,000 страниц
  • Аудио и видео: в минуту

2. Плата за создание функций

При использовании функций, работающих на базе искусственного интеллекта, которые вызывают большие языковые модели (LLMs), вы оплачиваете два типа расходов.

  • Затраты на контекстуализацию: подготовка контекста, генерация коэффициентов уверенности, обеспечение обоснования источника и форматирование выходных данных. Дополнительные сведения см. в разделе "Маркеры контекстуализации".
  • Генеративные затраты модели: Токен-основанные затраты на развертывание моделей Microsoft Foundry (LLM для генерации, эмбеддинги для примеров обучения). Content Understanding использует развертывание модели Foundry для всех запросов, связанных с генеративным ИИ. Вы не видите выставления счетов за использование токенов LLM или встраивание токенов в Content Understanding. Это использование отображается в развертывании модели Foundry. Дополнительные сведения см. в разделе "Плата за создание модели".

Генеративные функции: извлечение полей, анализ изображений, сегментация, классификация, обучение.

Уравнение затрат

Ваша общая стоимость запуска анализатора "Анализа содержания" соответствует следующей формуле:

Total Cost = Content Extraction + Contextualization Tokens + LLM Input Tokens + LLM Output Tokens + Embeddings Tokens

Если вы используете извлечение содержимого без использования генеративных возможностей, вы будете платить только за извлечение содержимого. При использовании генеративных функций применяются все соответствующие расходы.

Как оценить затраты

1. Тестирование с помощью репрезентативных файлов

Выполните небольшой анализ тестов с фактическими файлами и схемой. Чтобы увидеть фактическое потребление токенов, проверьте объект usage в ответе API анализаторов.

  "usage": {
    "documentPagesMinimal": 0, // Pages processed at the minimal level (i.e. txt, xlsx, html, and other digital file types)
    "documentPagesBasic": 0, // Pages processed at the basic level (i.e. read)
    "documentPagesStandard": 2, // Pages processed at the standard level (i.e. layout)
   
    "contextualizationToken": 2000,
    "tokens": {
      "gpt-4.1-input": 10400,
         "gpt-4.1-output": 360
    }
  }

2. Используйте калькулятор цен Azure

Найдите сведения о содержимом в калькуляторе цен Azure и настройте параметры:

  • Добавьте "Понимание содержимого" в этот калькулятор
  • Используйте результаты теста на шаге 1, чтобы вычислить среднее значение маркера на страницу или в минуту
  • Введите число токенов вместе с вашим регионом, типом файла, ожидаемым объемом и развертыванием модели

Калькулятор предоставляет точные прогнозы затрат для рабочей нагрузки.

Пример ценообразования: извлечение поля счета

Следуя подходу оценки, давайте рассмотрим конкретный пример вручную, чтобы продемонстрировать, как вычисляются затраты.

Сценарий. Вы обрабатываете счета для извлечения структурированных данных, таких как имя поставщика, номер счета, общая сумма и элементы строки. Выполняется обработка 1 000 страниц счетов с отключенной исходной привязкой и оценками достоверности.

Шаг 1. Тестирование с помощью репрезентативных файлов После тестирования репрезентативных файлов вы нашли следующее среднее использование маркеров на страницу:

  • Входные маркеры: 1 100 на страницу
  • Маркеры вывода: 60 на страницу
  • Контекстуализация: 1000 токенов на страницу (фиксированная ставка)

Для 1000 страниц общее количество страниц равно:

  • Общий объем входных маркеров: 1000 страниц × 1100 = 1100 000 токенов
  • Общий объем выходных маркеров: 1000 страниц × 60 = 60 000 маркеров
  • Всего маркеров контекстуализации: 1000 страниц × 1000 = 1000 000 маркеров

Шаг 2. Вычисление затрат вручную (вместо использования калькулятора цен) Использование глобального развертывания со следующими предположениями о ценах:

Предположения о ценах :

  • Извлечение содержимого: $5,00 за 1000 страниц
  • Контекстуализация: $1,00 за 1 млн токенов
  • Входные токены: $0,40 за 1 млн токенов
  • Стоимость токенов вывода: $1,60 за 1 миллион токенов
  • Внедрение: $0,02 за 1000 токенов. Вы не используете базу знаний с примерами обучения, поэтому плата за внедрение не применяется. Если вы добавляете помеченные примеры для повышения точности, система добавляет использование маркеров встраивания для встраивания текста из входных документов и маркеров ввода завершения для обработки примеров данных, добавленных в окно контекста.

Вычисление затрат:

  • Извлечение содержимого: 1000 страниц × $5,00 за 1000 страниц = $5,00
  • Контекстуализация: 1 000 000 токенов × $1,00 за 1 млн токенов = $1,00
  • Входные токены: 1 100 000 токенов × $0,40 за 1 млн токенов = $0,44
  • Выходные токены: 60 000 токенов × $1,60 за 1 миллион токенов = $0,10
  • Внедрение: не используется = $0,00
Total Cost = $5.00 + $1.00 + $0.44 + $0.10 + $0.00 = $6.54 per 1000 pages

Примечание

Эти цены предназначены только для иллюстрации и не предназначены для представления фактической стоимости. Проверьте Azure Ценообразование на Анализ Содержимого и Azure Ценообразование OpenAI для текущих ставок.

Подробные компоненты затрат

Извлечение содержимого

Извлечение содержимого является важным шагом для преобразования неструктурированных входных данных ( будь то документ, звук или видео) в стандартизированный, многократно используемый формат. Эта базовая обработка необходима для всех создаваемых функций и может использоваться автономно.

Цены на извлечение контента по модальности:

  • Документы: три трехуровневых счетчика (минимальный, базовый или стандартный) на основе сложности обработки
  • Звук: транскрибирование речи в текст (один стандартный счетчик, цена за минуту)
  • Видео: извлечение кадров, обнаружение снимков и транскрибирование речи в текст (один стандартный счетчик, цена за минуту)
  • Изображения: не доступно извлечение содержимого

Счетчики извлечения содержимого документа

За документы взимается плата в зависимости от типа обработки, выполняемой с помощью Content Understanding. Плата за анализ содержимого основана на фактической работе, выполненной на каждой странице, а не на выбранном анализаторе.

Минимальный метр: применяется к цифровым документам (DOCX, XLSX, PPTX, HTML, TXT, MSG, EML), где не требуется обработка OCR или макета. Этот счетчик является самым низким затратным вариантом для цифровых документов. Вы взимаете минимальную ставку независимо от используемого анализатора, даже если вы вызываете анализатор макета в цифровом документе, плата взимается только за минимальную обработку.

Базовый счетчик. Применяется, когда служба распознавания содержимого выполняет обработку OCR для извлечения текста из документов на основе изображений (отсканированные PDF-файлы, изображения, TIFFs) без анализа макета.

Стандартный счетчик: применяется при выполнении анализа макета, включая распознавание таблиц и обнаружение структурных элементов из документов на основе изображений (сканированные PDF-файлы, изображения, TIFFs).

В следующей таблице показано, какой счетчик применяется на основе типа файла и уровня анализа:

Тип файла Чтение (базовый уровень) Макет (стандартный)
На основе изображений (PDF, PNG, TIFF, JPG и т. д.) Базовый счетчик Стандартный счетчик
Цифровые форматы (DOCX, XLSX, HTML, TXT и т. д.) Минимальный метр Минимальный метр

Совет

Плата за метр зависит от фактически выполняемой обработки системой Content Understanding, а не от выбранного анализатора. Цифровые документы всегда используют минимальный счетчик, так как для них не требуется обработка OCR или макета.

Генеративные возможности

Создаваемые возможности службы "Распознавание содержимого" используют модели сгенерированного искусственного интеллекта для повышения качества выходных данных. В последней версии API [2025-11-01]можно выбрать созданную модель в зависимости от варианта использования.

При использовании любых генеративных возможностей Content Understanding использует развертывание моделей Foundry, предоставленное вами. Использование токенов для моделей завершения или встраивания осуществляется в этом развертывании.

Маркеры контекстуализации

Контекстуализация — это уровень обработки Content Understanding, который подготавливает контекст для создания моделей и после обработки их выходных данных в окончательные структурированные результаты.

Какие контекстуализации предоставляют:

  • Нормализация выходных данных и форматирование в структурированные схемы
  • Исходное основание, чтобы показать, откуда поступила информация
  • Вычисление коэффициента уверенности для надежности извлечения
  • Проектирование контекста для оптимизации использования и точности LLM

Когда с вас взимают плату: всякий раз, когда вы используете генеративные возможности (извлечение полей, анализ изображений, сегментация, категоризация, обучение).

Цены: фиксированная ставка на единицу содержимого

Маркеры контекстуализации вычисляются на единицу содержимого:

Единицы Маркеры контекстуализации Эффективная ценовая цена за единицу
На страницу 1000 маркеров контекстуализации $1 за 1000 страниц
За изображение 1000 маркеров контекстуализации $1 за 1000 изображений
За час аудио 100 000 маркеров контекстуализации $0,10 в час
За час видео 1 000 000 маркеров контекстуализации $1 в час

Предположим, $1,00 за 1 миллион токенов контекстуализации.

Плата за создание модели (LLM)

Оплата на основе токенов моделями Foundry, которые обеспечивают фактическое извлечение полей, анализ и другие генеративные возможности.

К входным маркерам относятся:

  • Извлеченный текст и расшифровки
  • Маркеры изображений (для визуального анализа)
  • Ваши определения схем
  • Системные запросы
  • Примеры обучения (при использовании базы знаний)

Выходные токены включают:

  • Значения полей и структурированные данные
  • Оценки достоверности и основы источников
  • Результаты анализа и описания

Оптимизация затрат: выбор небольших моделей или глобальных развертываний для значительной экономии.

Плата за внедрение

Плата за внедрение моделей на основе токенов, используемых при обучении пользовательских анализаторов с помеченными примерами для повышения точности.

  • При оплате: только при использовании функции обучения с помеченными данными
  • Модели: 'text-embedding-3-large', 'text-embedding-3-small' или 'text-embedding-ada-002'
  • Типичное использование: весь документ интегрирован. Использование может отличаться в зависимости от плотности текста, но около 1500 маркеров на страницу являются хорошей начальной оценкой.

Подробности о генеративных функциях

Существует несколько генеривных функций, каждая из которых имеет немного разные последствия для затрат.

Извлечение полей

Создает структурированные пары "ключ-значение" на основе определения схемы. Примерами являются отправитель/получатель счета, позиции счёта-фактуры или элементы рекламного видео, такие как слоган и внешний вид продукта.

Влияние на затраты: расходы изменяются в зависимости от сложности схемы и размера содержимого.

Анализ рисунков

Создает описательный текст для изображений, диаграмм и схем для поиска визуального содержимого в рабочих процессах RAG.

Влияние на затраты: маркеры LLM на изображение проанализированы — оба входных маркера для интерпретации изображений и выходных маркеров для описания. Использование зависит от размера и количества изображений, содержащихся в документе.

Сегментация

Делит документы или видео на логические разделы для целевой обработки и повышения эффективности.

Влияние на затраты: Стоимость выходных токенов для каждого созданного сегмента. При необходимости можно использовать анализаторы цепочки для дальнейшего анализа для каждого сегмента. При использовании цепочки требуется больше извлечения содержимого и генерации, что эквивалентно запуску цепных анализаторов независимо.

Категоризации

Назначает метки документам или сегментам для классификации и интеллектуальной маршрутизации в специализированные анализаторы.

Влияние на затраты: Затраты на LLM и контекстуализацию для классификации. Маршрутизация на другие анализаторы приводит к соответствующим расходам.

Обучение

Создает пользовательские анализаторы, используя помеченные примеры для улучшения точности в конкретной области.

Влияние на затраты: Внедрение использования токенов при добавлении помеченных данных, а также использование большего количества токенов LLM во время анализа в процессе получения и предоставления модели обучающих примеров.

База знаний

Улучшает пользовательские анализаторы с помощью размеченных обучающих примеров для повышения точности, специфичной для домена.

Влияние на затраты: модель внедрения используется для индексирования и извлечения примеров. Кроме того, токены LLM используются во время анализа, когда примеры обучения извлекаются и передаются модели.

Часто задаваемые вопросы

Когда взимается плата за использование LLM?

Плата за маркеры LLM взимается только при предоставлении анализатора развертывания Foundry и использовании генеративной функции в Content Understanding. Анализаторы, которые выполняют извлечение содержимого (например, prebuilt-read, prebuilt-layout или пользовательские анализаторы без каких-либо возможностей создания), не взимается плата за LLM.

Как узнать, какой счетчик извлечения содержимого применяется к моим документам?

Фактическое выполнение обработки определяет счетчик, а не анализатор, который вы выбираете:

  • Минимальный: цифровые документы (DOCX, XLSX, HTML, TXT и т. д.) всегда используют минимальное значение независимо от анализатора.
  • Базовый: документы на основе изображений с обработкой только OCR (анализатор чтения)
  • Стандартный: документы на основе изображений с анализом макета (анализатор макета)

Дополнительные сведения о счетчиках см. в разделе "Счетчики извлечения содержимого документа".

С меня взимается плата дважды за использование модели Foundry?

Нет. Content Understanding использует развертывания LLM, связанные с выполнением всех вызовов LLM и процессов встраивания. Вы оплачиваете осуществление этих развертываний. Вы платите Content Understanding за извлечение содержимого и контекстуализацию, а также Foundry за токены генеративной модели (токены ввода и вывода и эмбеддинги).

Сколько можно сэкономить с меньшими моделями?

Выбор модели -mini вместо стандартной может сократить затраты LLM до 80%. Глобальные развертывания обеспечивают дополнительную экономию. Затраты на извлечение содержимого и контекстуализацию остаются одинаковыми независимо от выбора модели.

Что увеличивает использование токенов?

Несколько функций умножают потребление маркеров:

  • Заземление источника и оценки уверенности: ~2x использование токенов
  • Режим извлечения: использование токенов ~1.5x
  • Примеры обучения: использование токенов ~2x
  • Сегментация/классификация: использование токенов ~2x

Взимается ли плата в случае неудачного выполнения запроса?

Понимание содержимого не взимает плату за извлечение или контекстуализацию содержимого, если запрос завершается ошибкой (например, ошибкой 400). Если запрос модели завершения Foundry был успешно выполнен до сбоя, то плата за использование этой модели взимается в соответствии с политикой выставления счетов Foundry.

Советы по оптимизации затрат

  • Начните с мини-моделей. Мини-модели обеспечивают значительную экономию для большинства задач извлечения
  • Используйте глобальные развертывания, когда это допускает расположение данных и соответствие требованиям
  • Включение расширенных функций выборочно - Используйте исходные данные и оценки уверенности только при необходимости
  • Тестирование репрезентативных файлов перед масштабированием для понимания фактического потребления токенов
  • Осуществляйте регулярный мониторинг через портал Azure для выявления возможностей оптимизации.

Дополнительные примеры ценообразования

Ниже приведены подробные примеры того, как работает цена в разных сценариях:

Пример 1. Обработка документов для рабочих процессов RAG

Сценарий: Вам необходимо извлечь содержимое из документов для решения Retrieval-Augmented Generation (RAG). Вы используете prebuilt-documentSearch для извлечения текста, макета и описания рисунков.

Входные данные:

  • 1000 страниц
  • Модель: глобальное развертывание GPT-4.1
  • Регион: восточная часть США

Разбивка цен:

  1. Извлечение содержимого: 1000 страниц

    • Стоимость: (1000 / 1000) × $ 5,00 = $ 5,00
  2. Анализ рисунков:

    Предположим, что два рисунка на одной странице. Это стоит около 1000 входных и 200 выходных токенов за рисунок.

    • Входные маркеры: 2000 цифр × 1000 токенов/изображения = 2 000 000 маркеров
    • Стоимость: (2000 000 / 1000 000) × $ 2,00 = $ 4,00
    • Выходные токены: 2000 страниц × 200 токенов/страница = 400 000 токенов
    • Стоимость: (400 000 / 1000 000) × $ 8,00 = $ 3,2
  3. Контекстуализация: 1000 страниц × 1000 токенов/page = 1000 000 токенов

    • Стоимость: (1 000 000 / 1 000 000) × $1,00 = $1,00

Общая оценка стоимости: $5,00 + $4 + $3,2 + $ 1,00 = $13,20

Примечание

Эти цены предназначены только для иллюстрации и не предназначены для представления фактической стоимости. Проверьте цены на Azure Content Understanding и цены на Azure OpenAI для актуальных ставок.

Пример 2. Обработка счетов с извлечением полей

Сценарий: вы автоматизаете обработку счетов, используя prebuilt-invoice для извлечения структурированных данных (номер счета, дата, поставщик, итог, элементы строки).

Входные данные:

  • 1000 страниц
  • Модель: GPT-4.1-mini для глобального распространения (с оптимизацией затрат)
  • Функции: режим извлечения + оценка источника + оценки достоверности
  • Регион: восточная часть США

Разбивка цен:

  1. Извлечение содержимого: 1000 страниц

    • Стоимость: (1000 / 1000) × $ 5,00 = $ 5,00
  2. Извлечение полей: с включенной оценкой источника и доверием, расход токенов увеличивается приблизительно в 2 раза на страницу.

    • Базовые маркеры ввода: 1000 страниц × 5200 токенов/страница = 5 200 000 токенов
    • Стоимость: (5200 000 / 1000 000) × $ 0,40 = $ 2,08
    • Базовые выходные токены: 1000 страниц × 180 токенов/страница = 180 000 токенов
    • Стоимость: (180 000 / 1000 000) × $ 1,60 = $ 0,29
  3. Контекстуализация: 1000 страниц × 1000 токенов/page = 1000 000 токенов

    • Стоимость: (1 000 000 / 1 000 000) × $1,00 = $ 1,00

Общая оценка стоимости: $5,00 + $2,08 + $0,29 + $ 1,00 = $8,37

Примечание

Использование стандартного глобального развертывания GPT-4.1 вместо мини увеличит затраты на извлечение данных примерно в 5 раз, что увеличит общую сумму приблизительно до $33.

Примечание

Эти цены предназначены только для иллюстрации и не предназначены для представления фактической стоимости. Проверьте текущие тарифы на Цены на понимание содержимого Azure и Цены Azure OpenAI

Пример 3. Анализ содержимого видео с помощью извлечения полей на уровне сегмента

Сценарий. Вы извлекаете структурированное представление видеосодержимого для приложения RAG. Для извлечения структурированных данных на сегмент видео можно использовать prebuilt-videoSearch. Сегменты — это короткие клипы в среднем 15–30 секунд, что приводит к множеству сегментов вывода с одним полем сводки на сегмент.

Входные данные:

  • 60 минут (1 час) видео
  • Модель: глобальное развертывание GPT-4.1
  • Регион: восточная часть США

Предположения:

  • Входные токены: 7500 токенов в минуту (на основе примеров кадров, транскрибирования, запросов схемы и метаподсказок)
  • Генерация токенов: 900 токенов в минуту (при условии автоматической сегментации 10–20 коротких структурированных полей на сегмент)
  • Контекстуализация: 1000 000 токенов в час видео

Разбивка цен:

  1. Извлечение содержимого: 60 минут

    • Стоимость: 60 минут × $ 1/час = $1,00
  2. Извлечение полей:

    • Входные токены: 60 минут × 7500 токенов/минуту = 450 000 токенов
    • Стоимость: (450 000 / 1000 000) × $ 2,00 = $ 0,90
    • Выходные токены: 60 минут × 900 токенов/минуту = 54000 токенов
    • Стоимость: (54 000 / 1000 000) × $ 8,00 = $ 0,43
  3. Контекстуализация: 1 000 000 токенов в час

    • Стоимость: (1 000 000 / 1 000 000) × $1,00 = $1,00

Общая оценка стоимости: $1,00 + $0,90 + $0,43 + $ 1,00 = $3,33

Примечание

Фактические затраты зависят от особенностей входных и выходных данных. Эта прозрачная модель выставления счетов на основе использования гарантирует, что вы оплачиваете только то, что вы используете.

Примечание

Эти цены предназначены только для иллюстрации и не предназначены для представления фактической стоимости. Проверьте цены за понимание контента Azure и цены за Azure OpenAI для текущих цен

Пример 4. Обработка записей аудиоцентра вызовов

Сценарий: Вы анализируете записи call-центра, используя prebuilt-callCenter для создания транскриптов, диаризации говорящих, анализа тональности и сводок.

Входные данные:

  • 60 минут звука
  • Модель: глобальное развертывание GPT-4.1-mini
  • Регион: восточная часть США

Разбивка цен:

  1. Извлечение содержимого: 60 минут

    • Стоимость: 60 минут × $ 0,36/минуты = $0,36
  2. Извлечение полей:

    • Токены ввода: 60 минут × 604 токенов/минут = 36,240 токенов.
    • Стоимость: (36,240 / 1000 000) × $ 0,40 = $0,01
    • Выходные токены: 60 минут × 19 токенов/минуту = 1140 токенов
    • Стоимость: (1,140 / 1000 000) × $ 1,60 = $ 0,00
  3. Контекстуализация: 60 минут × 1667 токенов/минут = 100 020 токенов

    • Стоимость: (100 020 / 1000 000) × $ 1,00 = $ 0,10

Общая оценка стоимости: $0,36 + $0,01 + $0,00 + $0,10 = $0,47

Примечание

Эти цены предназначены только для иллюстрации и не предназначены для представления фактической стоимости. Проверьте цены Azure для Понимания контента и цены Azure OpenAI для получения текущих ставок.

Пример 5. Обработка изображений с подписями

Сценарий. Вы создаете описательные подписи для образов продуктов с помощью prebuilt-imageSearch.

Входные данные:

  • 1000 изображений
  • Модель: глобальное развертывание GPT-4.1
  • Регион: восточная часть США

Разбивка цен:

  1. Извлечение содержимого: плата за изображения не взимается

    • Стоимость: $0,00
  2. Извлечение полей:

    • Входные маркеры: 1 000 изображений × 1 043 токенов/изображение = 1 043 000 токенов
    • Стоимость: (1043 000 / 1000 000) × $ 2,00 = $ 2,09
    • Выходные токены: 1000 изображений × 170 токенов/изображение = 170 000 токенов
    • Стоимость: (170 000 / 1000 000) × $ 8,00 = $ 1,36
  3. Контекстуализация: 1000 изображений × 1000 токенов / изображение = 1 000 000 токенов

    • Стоимость: (1,000,000 / 1,000,000) × $1.00 = $1,00

Общая оценка стоимости: $0,00 + $2,09 + $1,36 + $ 1,00 = $4,45

Примечание

Эти цены предназначены только для иллюстрации и не предназначены для представления фактической стоимости. Проверьте стоимость услуг Azure Content Understanding и стоимость услуг Azure OpenAI для получения актуальных ставок.

Дальнейшие действия