Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
На этой странице описывается приоритетная оплата за токен для API Foundation Model с оплатой за токен, включая сведения о том, как она работает и как отправлять приоритетные запросы.
Что такое приоритет оплаты за токен?
Приоритетная оплата за токен, также известная как приоритетный режим, — это функция оплаты за токен для приложений реального времени, чувствительных к задержкам. При отправке запроса с параметром service_tier, установленным в значение "priority", Azure Databricks обрабатывает этот запрос с приоритетом перед стандартным трафиком best-effort с оплатой за токен для той же модели. Это обеспечивает более согласованную доступность в периоды высокого трафика.
Приоритет оплаты за токен является согласием на запрос, поэтому вы можете отправлять приоритет и стандартные запросы в ту же модель. Это не требует обязательств по резервированию мощности и оплачивается по более высокой ставке за токен, чем стандартные запросы с оплатой за токен.
Databricks рекомендует режим приоритета при:
- Вам нужны более стабильные производительность и доступность, чем при стандартной модели оплаты за токен, но вы еще не готовы брать на себя обязательства по выделенной мощности.
- Вашим приложениям, работающим в производственной среде, требуется более высокий уровень доступности.
Поддерживаемые модели
Следующие модели оплаты за токены поддерживают режим приоритета. Чтобы отправить запрос приоритета, используйте имя конечной точки модели с заданным параметром service_tier"priority".
Important
Приоритет оплаты за токен доступен для моделей OpenAI и Google Gemini через службы ADI, предоставляемые Databricks. Чтобы получить доступ к этим моделям партнеров в среде Azure Databricks, ознакомьтесь со службами ADI.
Модели с открытым кодом
| Provider | Model | Имя конечной точки | Notes |
|---|---|---|---|
| Alibaba Cloud | Qwen3.5 122B A10B | databricks-qwen35-122b-a10b |
|
Как работает приоритетная оплата за токен
Прежде чем использовать приоритет оплаты за токен, рассмотрите следующее поведение:
- Согласованность производительности и доступности. Приоритетная оплата за токен предназначена для поддержания стабильной доступности при высокой нагрузке. Это не гарантирует определенное время до получения первого токена или целевое значение сквозной задержки. Приоритетные запросы ориентированы на более высокую доступность, чем стандартные запросы с оплатой за токен. Azure Databricks определяет доступность на уровне в качестве количества успешных запросов, разделенных на общее количество разрешенных запросов на этом уровне.
- Максимальное количество усилий. Режим приоритета не резервируется и не имеет обязательств по емкости.
- Переход на стандартную оплату за токен. Если приоритетная ёмкость полностью распределена, запросы обрабатываются в рамках стандартной модели доступности с оплатой за токен и оплачиваются по стандартным тарифам модели оплаты за токен.
- Надбавка за токен. Запросы приоритета выставляются по более высокой ставке на токен, чем стандартные запросы оплаты за токен.
Приоритет оплаты за токен по сравнению с подготовленной пропускной способностью
Приоритетная оплата за токен и выделенная пропускная способность обе ориентированы на производственные рабочие нагрузки, но предполагают разные компромиссы:
| Соображение | Приоритет оплаты за токен | Предоставленная пропускная способность |
|---|---|---|
| Capacity | Лучшие усилия, общий доступ. | Выделенная, зарезервированная емкость. |
| Обязательства | Нет. Включается для каждого запроса. | Требуется подготовленная конечная точка. |
| Availability | Более стабильная, чем стандартная модель оплаты за токен при высокой нагрузке. | Прогнозируемая, основанная на зарезервированной емкости. |
| Billing | За токен, по более высокой цене, чем при стандартной оплате за токен. | На основе выделенных единиц модели. |
Отправка запроса приоритета
Чтобы использовать режим приоритета, задайте для параметра service_tier значение "priority" отдельно для каждого запроса. В следующем примере используется клиент OpenAI:
from databricks_openai import DatabricksOpenAI
client = DatabricksOpenAI()
response = client.chat.completions.create(
model="databricks-model-name",
messages=[
{
"role": "user",
"content": "What is a mixture of experts model?",
}
],
max_tokens=256,
service_tier="priority",
)
Сведения о синтаксисе параметров см. в справочнике по REST API базовых моделей, а дополнительные варианты запросов — в разделе Использование базовых моделей.
Ограничения емкости
Каждый кластер поддерживает максимальное общее количество токенов в минуту для всех арендаторов суммарно. Azure Databricks задает ограничение для каждого клиента во время подключения, чтобы один клиент не может использовать всю емкость кластера. Если для вашей рабочей нагрузки требуется больше ресурсов, чем допускает лимит для тенанта, обратитесь к команде Databricks, отвечающей за вашу учетную запись.
Дополнительные сведения об ограничениях API базовых моделей см. в разделе Ограничения и квоты API базовых моделей.