Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
В этой статье содержится краткий справочник и подробное описание квот и ограничений для Azure OpenAI.
Область квоты
Квоты и ограничения не применяются на уровне арендатора. Вместо этого максимальный уровень ограничений квоты ограничен на уровне подписки Azure.
Управление квотами на уровне подписки
Important
Управление квотами на уровне подписки в Microsoft Foundry началось после 7 мая 2026 г.
Начиная с Realtime Translate и Realtime Whisper, а вскоре и для всех моделей, в Foundry квота для развертываний отслеживается на уровне подписки, а не для каждого ресурса или региона. Этот подход обеспечивает согласованность и прогнозируемость управления квотами между развертываниями, так как все ресурсы и регионы в подписке используют один и тот же пул квот.
Это изменение объединяет квоту в общие пулы:
- Global Standard: Развертывания одной и той же модели и версии совместно используют один общий пул квот во всех регионах подписки.
- Data Zone Standard: развертывания одной и той же модели и версии используют общий пул квот в каждой зоне данных (например, США или ЕС).
Чтобы узнать больше о распределении квот на уровне подписки, см. Квоты и ограничения Microsoft Foundry Models.
Уровни квот
Microsoft внедряет уровни квот для улучшения возможностей модели Foundry и снижения трения по мере масштабирования рабочих нагрузок. Квоты теперь увеличиваются автоматически с использованием, что помогает избежать ошибок ограничения скорости, а также создания более справедливой среды для всех пользователей. Доступны семь уровней: бесплатный уровень и уровни 1–6 — с уровнем 6, предлагающим самые высокие квоты. Первоначальный назначенный уровень клиента основан на текущем использовании этой модели и их текущей связи с Microsoft, например состояние Соглашения Enterprise (EA или MCA-E).
Что изменится для меня?
Таким образом, ранее Foundry предлагала только уровни квот По умолчанию и Enterprise для типа оплаты по мере использования, с большим разрывом между уровнями и более длительным процессом запроса увеличения квоты. При использовании уровней квот всем пользователям назначается уровень с квотами, равными или выше их предыдущих уровней. Все ранее утвержденные увеличение квоты сохраняются и не будут сокращены. По мере роста использования Foundry автоматически увеличивает квоты путем перемещения пользователей на более высокие уровни, а дополнительная квота по-прежнему может быть запрошена через форму квоты.
Как клиент автоматически перемещается с одного уровня на другой, например какие критерии изменения уровня?
Автоматическое обновление уровней в основном зависит от тенденций потребления клиентов в моделях Foundry с течением времени. Если использование клиента увеличивается таким образом, что текущий уровень квот ограничивает возможность использования моделей Foundry, система автоматически обновляет клиента до следующего уровня выше. Система также рассматривает отношения клиента с Microsoft. Клиентам с корпоративными связями (включая EA и MCA-E) с Microsoft назначаются более высокие уровни квот. Кроме того, Microsoft также рассматривает журнал платежей клиента, чтобы определить право на автоматическое обновление.
Можно ли отказаться от автоматического обновления?
Да, вы можете отказаться от автоматического обновления, чтобы оставаться на текущем уровне независимо от изменений в потреблении. Некоторые клиенты используют квоту для управления выставлением счетов. Использование квоты для управления выставлением счетов не соответствует рекомендациям Azure, но если ваша система настроена таким образом, возможно, вы не захотите нарушать её работу. Дополнительные сведения об управлении выставлением счетов и рекомендациях см. в статье "Управление затратами".
Чтобы отказаться, можно задать следующий флаг NoAutoUpgrade:
curl -X PATCH \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers/default?api-version=2025-10-01-preview" \
-H "Authorization: Bearer <YOUR_ACCESS_TOKEN>" \
-H "Content-Type: application/json" \
-d '{
"properties": {
"tierUpgradePolicy": "NoAutoUpgrade"
}
}'
Примечание
Функция отказа является предварительной версией и может быть подвержена изменению или удалению в будущем.
Можно ли запросить дополнительную квоту?
Да, используя форму запроса квоты , можно всегда запрашивать больше квоты. Если запрос утвержден, текущий уровень останется прежним, но с большей квотой.
Как проверить уровень квоты подписки?
В настоящее время можно проверить текущий уровень квоты с помощью control plane API.
curl -X GET \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers?api-version=2025-10-01-preview" \
-H "Authorization: Bearer $(az account get-access-token --resource https://management.azure.com --query accessToken -o tsv)" \
-H "Content-Type: application/json"
Справочник по уровню квот
Все версии gpt-chat-latest используют одно и то же ограничение TPM для соответствующего уровня, указанное для каждого уровня. Версии 2026-06-24, и 2026-05-052026-05-28 используют 10 RPM на 1000 TPM. Версия 2026-08-062 использует 1 RPM на 1000 TPM, поэтому таблицы перечисляют версии отдельно.
Уровень 1
| Имя модели | Тип развертывания | Запросы в минуту (RPM) | Токены в минуту (TPM) |
|---|---|---|---|
| codex-mini | GlobalStandard | 1,000 | 1,000,000 |
| предварительный просмотр использования компьютера | GlobalStandard | 4,500 | 450,000 |
| gpt-4.1 | Стандарт DataZone | 300 | 300,000 |
| gpt-4.1 | GlobalStandard | 1,000 | 1,000,000 |
| gpt-4.1-mini | Стандарт DataZone | 2 000 | 2,000,000 |
| gpt-4.1-mini | GlobalStandard | 5,000 | 5,000,000 |
| gpt-4.1-mini | Стандартный | 6,000 | 6,000,000 |
| gpt-4.1-nano | Стандарт DataZone | 2 000 | 2,000,000 |
| gpt-4.1-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-4o | Стандарт DataZone | 300 / 10 сек. | 300,000 |
| gpt-4o-audio-preview | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-4o-mini | Стандарт DataZone | 10 000 | 1,000,000 |
| gpt-4o-mini | GlobalStandard | 20,000 | 2,000,000 |
| gpt-4o-mini-аудио-превью | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-4o-mini-realtime-preview | GlobalStandard | 36 | 6,000 |
| gpt-4o-режим-реального-времени-просмотр | GlobalStandard | 36 | 6,000 |
| gpt-5 | Стандарт DataZone | 3,000 | 300,000 |
| gpt-5 | GlobalStandard | 10 000 | 1,000,000 |
| gpt-5-chat | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-codex | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-mini | Стандарт DataZone | 300 | 300,000 |
| gpt-5-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-nano | Стандарт DataZone | 2 000 | 2,000,000 |
| gpt-5-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-5-pro | GlobalStandard | 1,600 | 160,000 |
| gpt-5.1 | Стандарт DataZone | 3,000 | 300,000 |
| gpt-5.1 | GlobalStandard | 10 000 | 1,000,000 |
| gpt-5.1 | Стандартный | 3,000 | 300,000 |
| gpt-5.1-chat | GlobalStandard | 10 000 | 1,000,000 |
| gpt-5.1-codex | Стандарт DataZone | 3,000 | 300,000 |
| gpt-5.1-codex | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.1-codex-max | GlobalStandard | 10 000 | 1,000,000 |
| gpt-5.1-codex-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.2 | Стандарт DataZone | 3,000 | 300,000 |
| gpt-5.2 | GlobalStandard | 10 000 | 1,000,000 |
| gpt-5.2-chat | GlobalStandard | 10 000 | 1,000,000 |
| gpt-5.3-chat | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.2-codex | GlobalStandard | 10 000 | 1,000,000 |
| gpt-5.3-codex | GlobalStandard | 10 000 | 1,000,000 |
| gpt-5.4 | Стандарт DataZone | 300 | 300,000 |
| gpt-5.4 | GlobalStandard | 10 000 | 1,000,000 |
| gpt-5.4-pro | GlobalStandard | 160 | 160,000 |
| gpt-5.4-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.4-nano | Стандарт DataZone | 2 000 | 2,000,000 |
| gpt-5.4-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-5.5 | Стандарт DataZone | 333 | 333,000 |
| gpt-5.5 | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-luna | Стандарт DataZone | 333 | 333,000 |
| gpt-5.6-luna | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-sol | Стандарт DataZone | 333 | 333,000 |
| gpt-5.6-sol | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-terra | Стандарт DataZone | 333 | 333,000 |
| gpt-5.6-terra | GlobalStandard | 1,000 | 1,000,000 |
| gpt-chat-latest1 | GlobalStandard | 10 000 | 1,000,000 |
| gpt-chat-latest2 | GlobalStandard | 1,000 | 1,000,000 |
| gpt-audio | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-image-1 | GlobalStandard | 9 | - |
| gpt-image-1-mini | GlobalStandard | 12 | - |
| gpt-image-1.5 | Стандарт DataZone | 3 | - |
| gpt-image-1.5 | GlobalStandard | 9 | - |
| gpt-image-2 | Стандарт DataZone | 2 | - |
| gpt-image-2 | GlobalStandard | 6 | - |
| gpt-realtime | GlobalStandard | 200 | 100,000 |
| model-router | Стандарт DataZone | 300 | 300,000 |
| model-router | GlobalStandard | 1,000 | 1,000,000 |
| o1 | Стандарт DataZone | 100 | 600,000 |
| o1 | GlobalStandard | 500 | 3,000,000 |
| o3 | Стандарт DataZone | 300 | 300,000 |
| o3 | GlobalStandard | 1,000 | 1,000,000 |
| o3-глубокое-исследование | GlobalStandard | 3,000 | 3,000,000 |
| o3-mini | Стандарт DataZone | 200 | 2,000,000 |
| o3-mini | GlobalStandard | 500 | 5,000,000 |
| o3-pro | GlobalStandard | 160 | 1,600,000 |
| o4-mini | Стандарт DataZone | 300 / 10 сек. | 300,000 |
| o4-mini | GlobalStandard | 1,000 | 1,000,000 |
| text-embedding-3-large | Стандарт DataZone | 1,000 | 1,000,000 |
| text-embedding-3-large | GlobalStandard | 1000 / 10 сек | 1,000,000 |
| text-embedding-3-small | Стандарт DataZone | 1,000 | 1,000,000 |
| text-embedding-3-small | GlobalStandard | 1000 / 10 сек | 1,000,000 |
Справочник по квотам и ограничениям
В следующем разделе представлено краткое руководство по квотам по умолчанию и ограничениям, которые применяются к Azure OpenAI:
| Имя ограничения | Предел значения |
|---|---|
| Ресурсы Azure OpenAI для каждой подписки Azure | 30. |
| Ограничения квоты GPT-image-1 по умолчанию | 9 запросов в минуту |
| Предельные ограничения по квоте GPT-image-1-mini | 12 запросов в минуту |
| Ограничения квоты GPT-image-1.5 по умолчанию | 9 запросов в минуту |
| Ограничения квоты GPT-image-2 по умолчанию | 9 запросов в минуту |
| Ограничения квоты Sora по умолчанию | 60 запросов в минуту. |
| Лимиты квоты Sora 2 по умолчанию | 2 запроса на задание1 в минуту |
| Стандартные ограничения квоты API преобразования аудио в текст | 3 запроса в минуту. |
| Максимальное количество токенов на один запрос | Зависит от модели. Дополнительные сведения см. в разделе модели Azure OpenAI. |
| Максимальное число стандартных развертываний на ресурс | 32. |
| Максимальное количество развертываний точно настроенных моделей | 10. |
| Общее количество задач обучения на каждую единицу ресурса | 100. |
| Максимальное количество одновременно выполняемых заданий обучения на ресурсе | Стандартный и глобальный учебный курс: 3; Обучение разработчика: 5 |
| Максимальное количество обучающих заданий в очереди | 20. |
| Максимальное количество файлов на ресурс (настройка) | 100. |
| Общий размер всех файлов по ресурсу (для тонкой настройки) | 1 ГБ. |
| Максимальное время выполнения задания обучения (при превышении задание будет завершено с ошибкой) | 720 часов. |
Максимальный размер задания обучения (tokens in training file) x (# of epochs) |
2 миллиарда. |
| Максимальный размер всех файлов на загрузку (Azure OpenAI на ваших данных) | 16 МБ. |
Максимальное количество входных данных в массиве с /embeddings |
2,048. |
Максимальное количество токенов в одном запросе /embeddings (суммарно по всем входным данным) |
300,000. |
Максимальное количество /chat/completions сообщений |
2,048. |
Максимальное количество /chat/completions функций |
128. |
Максимальное количество /chat/completions инструментов |
128. |
| Максимальное количество подготовленных единиц пропускной способности на развертывание | 100,000. |
| Максимальное количество файлов на помощника или потока | 10 000 при использовании API или портала Microsoft Foundry. |
| Максимальный размер файла для помощников и тонкой настройки | 512 МБ через API 200 МБ через портал Foundry. |
| Максимальное количество запросов на отправку файлов на ресурс | 30 запросов в секунду. |
| Максимальный размер всех отправленных файлов для помощников | 200 ГБ. |
| Ограничение токенов помощников | 2 000 000 токенов. |
GPT-4o и GPT-4.1 максимальное количество изображений на запрос (количество изображений в массиве сообщений или журнале бесед) |
50. |
GPT-4 vision-preview и GPT-4 turbo-2024-04-09 максимальные токены по умолчанию |
16. max_tokens Увеличьте значение параметра, чтобы избежать усеченных ответов.
GPT-4o максимальное количество токенов по умолчанию — 4,096. |
| Максимальное количество пользовательских заголовков в запросах API2 | 10. |
| Ограничение символов сообщения | 1,048,576. |
| Размер сообщения для звуковых файлов | 20 МБ. |
1 Квота Sora 2 RPM учитывает только видеозапросы. Другие типы запросов не ограничены скоростью.
2 Наши текущие API-интерфейсы позволяют использовать до 10 пользовательских заголовков, которые передаются через конвейер и возвращаются. Некоторые клиенты теперь превышают это число заголовков, что приводит к ошибкам HTTP 431. Единственное решение для этой ошибки — уменьшить объем заголовка. В будущих версиях API мы не будем передавать кастомные заголовки. Мы рекомендуем клиентам не зависеть от пользовательских заголовков в архитектурах будущих систем.
Примечание
Ограничения квоты могут быть изменены.
Ограничения на пакетные процессы
| Имя ограничения | Предел значения |
|---|---|
| Максимальное количество входных файлов в пакете (без срока действия) | 500 |
| Максимальное количество входных файлов в пакете (срок действия задан) | 10 000 |
| Максимальный размер входного файла | 200 МБ |
| Максимальный размер входного файла - Использование собственного хранилища (BYOS) | 1 ГБ |
| Максимальное количество запросов на файл | 100,000 |
Примечание
Задайте срок действия входных файлов, чтобы увеличить ограничение ресурсов и управлять сохраненными файлами. Ограничения для пакетных входных файлов не распространяются на выходные файлы, такие как result.jsonl и error.jsonl. Чтобы избежать ограничений Files API на входные файлы, используйте Batch с Хранилище BLOB-объектов Azure.
Квота пакетной обработки
Предел квоты пакета представлен в таблице. Значения квот для глобального пакета представлены с точки зрения закрепленных маркеров. При отправке файла для пакетной обработки число маркеров в файле учитывается. До тех пор, пока пакетное задание не достигнет конечного состояния, эти маркеры засчитываются в ваш общий лимит поставленных маркеров.
Глобальная партия
| Модель | Корпоративное решение и MCA-E | По умолчанию | Ежемесячные подписки на основе кредитной карты | Подписки MSDN | Azure для учащихся, бесплатные пробные версии |
|---|---|---|---|---|---|
gpt-4.1 |
5B | 200 МБ | 50 млн | 90K | N/A |
gpt-4.1 mini |
15B | 1B | 50 млн | 90K | N/A |
gpt-4.1-nano |
15B | 1B | 50 млн | 90K | N/A |
gpt-4o |
5B | 200 МБ | 50 млн | 90K | N/A |
gpt-4o-mini |
15B | 1B | 50 млн | 90K | N/A |
gpt-4-turbo |
300 млн | 80M | 40M | 90K | N/A |
gpt-4 |
150 млн | 30 млн | 5M | 100K | N/A |
o3-mini |
15B | 1B | 50 млн | 90K | N/A |
o4-mini |
15B | 1B | 50 млн | 90K | N/A |
gpt-5 |
5B | 200 МБ | 50 млн | 90K | N/A |
gpt-5.1 |
5B | 200 МБ | 50 млн | 90K | N/A |
gpt-5.2 |
5B | 200 МБ | 50 млн | N/A | N/A |
gpt-5.4 |
5B | 200 МБ | 50 млн | N/A | N/A |
gpt-5.4-mini |
5B | 200 МБ | 50 млн | N/A | N/A |
gpt-5.4-nano |
5B | 200 МБ | 50 млн | N/A | N/A |
gpt-5.5 |
5B | 200 МБ | 50 млн | 90K | N/A |
B = миллиард | M = миллион | K = тысяча
Пакет зоны данных
| Модель | Корпоративное решение и MCA-E | По умолчанию | Ежемесячные подписки на основе кредитной карты | Подписки MSDN | Azure для учащихся, бесплатные пробные версии |
|---|---|---|---|---|---|
gpt-4.1 |
500M | 30 млн | 30 млн | 90K | N/A |
gpt-4.1-mini |
1,5 млрд | 100 млн | 50 млн | 90K | N/A |
gpt-4o |
500M | 30 млн | 30 млн | 90K | N/A |
gpt-4o-mini |
1,5 млрд | 100 млн | 50 млн | 90K | N/A |
o3-mini |
1,5 млрд | 100 млн | 50 млн | 90K | N/A |
gpt-5 |
5B | 200 МБ | 50 млн | 90K | N/A |
gpt-5.1 |
5B | 200 МБ | 50 млн | 90K | N/A |
gpt-5.4 |
5B | 200 МБ | 50 млн | N/A | N/A |
gpt-5.4-mini |
5B | 200 МБ | 50 млн | N/A | N/A |
gpt-5.5 |
5B | 200 МБ | 50 млн | 90K | N/A |
gpt-oss
| Модель | Токены в минуту (TPM) | Запросы в минуту (RPM) |
|---|---|---|
gpt-oss-120b |
5 М | 5 км |
Уровни использования
Развертывания по глобальному стандарту используют глобальную инфраструктуру Azure. Они динамически направляют трафик клиентов в центр обработки данных с наилучшей доступностью для запросов на анализ данных клиента. Аналогичным образом развертывания Data Zone Standard позволяют использовать глобальную инфраструктуру Azure для динамического маршрутизации трафика в центр обработки данных в пределах определенной Microsoft зоны данных с оптимальной доступностью для каждого запроса. Эта практика обеспечивает более согласованную задержку для клиентов с низким до среднего уровня трафика. Клиенты с высоким уровнем устойчивого использования могут видеть большую вариативность в задержке ответа.
Уровни использования Azure OpenAI предназначены для обеспечения стабильной производительности для большинства клиентов при низком и среднем уровне трафика. Каждый уровень использования определяет максимальную пропускную способность (токены в минуту) с прогнозируемой задержкой. Когда использование остается на назначенном уровне, задержка остается стабильной, а время отклика — постоянным.
Что произойдет, если вы превышаете уровень использования?
- Если пропускная способность запроса превышает уровень использования (особенно в периоды высокого спроса), задержка ответа может значительно увеличиться.
- Задержка может отличаться и в некоторых случаях может быть более чем в два раза выше, чем при работе в пределах вашего уровня использования.
- Эта изменчивость наиболее заметна для клиентов с высоким уровнем устойчивого использования или с переменными всплесками трафика.
Рекомендуемые действия при превышении уровня использования
Если вы столкнулись с 429 ошибками или заметили повышенную изменчивость задержки, выполните следующие действия.
- Запросить увеличение квоты: посетите портал Azure, чтобы запросить более высокую квоту для подписки.
- Рассмотрите возможность перехода на тариф "Премиум" (PTU): для рабочих нагрузок с критичной задержкой или с большим объемом данных, обновите до выделенных единиц пропускной способности (PTU). PTU предоставляет выделенные ресурсы, гарантированную емкость и предсказуемую задержку, даже при масштабировании. Это лучший выбор для критически важных приложений, требующих согласованной производительности.
- Мониторинг использования: регулярно просматривайте метрики использования на портале Azure, чтобы убедиться, что вы работаете в пределах уровня. При необходимости настройте рабочую нагрузку или стратегию развертывания.
Вы можете получать ответы 429 (Too Many Requests), даже если метрики использования токенов кажутся ниже вашей квоты. Объяснение того, почему это происходит, см. в статье Почему вы можете видеть ошибки 429, даже когда показатели использования токенов не превышают квоту.
Ограничение использования определяет уровень использования, выше которого клиенты могут видеть большую дисперсию в задержке ответа. Потребление клиента задаётся для каждой модели. Это общее количество токенов, потребляемых во всех развертываниях во всех подписках во всех регионах для данного тенанта.
Примечание
Уровни использования применяются только к типам развертывания Standard, Data Zone Standard и Global Standard. Уровни использования не применяются к глобальной пакетной обработке и предоставленным развертываниям пропускной способности.
Глобальный стандарт, стандарт зоны данных и стандарт
| Модель | Уровни использования в месяц |
|---|---|
gpt-5 |
32 млрд токенов |
gpt-5-mini |
160 миллиардов токенов |
gpt-5-nano |
800 миллиардов токенов |
gpt-5-chat |
32 млрд токенов |
gpt-4
+
gpt-4-32k (все версии) |
6 миллиардов токенов |
gpt-4o |
12 миллиардов токенов |
gpt-4o-mini |
85 миллиардов токенов |
o3-mini |
50 миллиардов токенов |
o1 |
4 млрд токенов |
o4-mini |
50 миллиардов токенов |
o3 |
5 миллиардов токенов |
gpt-4.1 |
30 миллиардов токенов |
gpt-4.1-mini |
150 миллиардов токенов |
gpt-4.1-nano |
550 миллиардов токенов |
gpt-5.1 |
86 миллиардов токенов |
gpt-5.1-codex |
86 миллиардов токенов |
gpt-5.2 |
60 миллиардов токенов |
gpt-5.3-codex |
60 миллиардов токенов |
gpt-5.4 |
50 миллиардов токенов |
gpt-5.4-mini |
165 миллиардов токенов |
gpt-5.4-nano |
605 миллиардов токенов |
gpt-5.5 |
25 миллиардов токенов |
gpt-5.6-sol |
25 миллиардов токенов |
Общие рекомендации для того, чтобы оставаться в пределах ограничений по частоте запросов
Чтобы свести к минимуму проблемы, связанные с ограничениями скорости, рекомендуется использовать следующие методы:
- Реализуйте логику повторных попыток в приложении.
- Избегайте резких изменений в рабочей нагрузке. Постепенно увеличивайте рабочую нагрузку.
- Тестирование различных шаблонов увеличения нагрузки.
- Увеличьте квоту, назначенную развертыванию. При необходимости переместите квоту из другого развертывания.
Подробные рекомендации, примеры кода для повторных попыток с экспоненциальной задержкой и руководство по устранению неполадок, связанных с ошибкой 429, см. в разделе Управление квотой Azure OpenAI в Microsoft Foundry Models.
Запрос на увеличение квоты
Отправьте форму запроса на увеличение квоты, чтобы запросить увеличение квоты для моделей Foundry, продаваемых Azure, моделей Azure OpenAI и моделей Anthropic. За исключением моделей Anthropic, модели от партнеров и сообщества не поддерживают увеличение квоты.
Запросы на увеличение квот обрабатываются в том порядке, в который они получены, и приоритет передает клиентам, которые активно используют существующее выделение квот. Запросы, которые не соответствуют этому условию, могут быть отклонены.
Ограничения емкости региональной квоты
Доступность квоты можно просмотреть по регионам для подписки на портале Foundry.
Сведения о программной проверке квоты и емкости см. в руководстве по управлению квотами программным способом. В этом разделе рассматриваются два взаимодополняющих REST API: API Usages для проверки потребления относительно лимитов и API Model Capacities для проверки доступной емкости для развертывания по моделям и регионам.
Примечание
В настоящее время и портал Foundry, и API емкости возвращают информацию о квотах и емкости для моделей, которые выведены из эксплуатации и больше не доступны для новых развертываний.
Связанное содержимое
- Узнайте, как управлять квотой для ваших развертываний OpenAI Azure.
- Узнайте больше об основополагающих моделях, которые используют Azure OpenAI.