Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Благодаря интеграции с Fireworks AI клиенты Microsoft Foundry могут:
- Экспериментируйте с последними моделями с открытым исходным кодом еще до того, как они станут доступны напрямую из Azure.
- Импорт и развертывание пользовательских весов моделей (принесите собственную модель или BYOM) на инфраструктуру Fireworks, поддерживающую GPU и работающую по требованию. Дополнительные сведения см. в разделе Импорт настраиваемых моделей на Microsoft Foundry с Fireworks.
- Масштабирование с помощью предоставленной пропускной способности.
Все эти возможности доступны непосредственно в проекте Foundry, с встроенными возможностями управления от Azure, контроля доступа и управления проектами.
Необходимые условия
Подписка Azure. Если у вас нет учетной записи, создайте бесплатную учетную запись.
Удостоверение Azure с ролью владельца подписки или участника подписки, чтобы включить эту функцию.
Для развертывания моделей вам потребуется роль владельца Foundry в проекте Foundry . Дополнительные сведения см. в разделе встроенные роли Azure.
Важно
Недавно были переименованы роли RBAC в Foundry. Foundry User, Foundry Owner, Foundry Account Owner и Foundry Project Manager ранее назывались пользователь Azure AI, владелец Azure AI, владелец учетной записи Azure AI и руководитель проекта Azure AI. Пока новое название внедряется, в некоторых местах вы всё ещё можете видеть прежние названия. Идентификаторы ролей и основные разрешения не меняются из-за переименования.
Доступность региона
Развертывания моделей типов "Data Zone Standard" и "Data Zone Provisioned" через Fireworks в Foundry доступны в следующих регионах Azure:
- Восток США (eastus)
- Восток США 2 (eastus2)
- Центральная часть США (центральная часть США)
- Северный Центральный США (northcentralus)
- Запад США (westus)
- Запад США 3 (westus3)
Развертывания базовых и пользовательских моделей с глобальной выделенной пропускной способностью доступны во всех глобальных регионах Azure, кроме облачных сред Azure для государственных организаций. Все модели каталога, поддерживающие глобальную выделенную пропускную способность, также поддерживают выделенную пропускную способность для зоны данных.
Включите Fireworks на Foundry
Важно
Fireworks on Foundry в настоящее время исключены из обязательств по Границе данных ЕС.
FedRAMP не сертифицирован для Fireworks на Foundry. Если вашей организации требуется FedRAMP, прежде чем использовать, обратитесь к своему чиновнику авторизации, чтобы определить, разрешено ли использование Fireworks в Foundry.
Стандарт безопасности данных индустрии платежных карт (PCI DSS) не применим к Fireworks в Foundry. Не следует использовать Fireworks в Foundry для хранения, обработки или передачи данных об оплате и данных о держателе карты.
Хотя Fireworks on Foundry общедоступен, администратор должен включить службу в подписке Azure. Портал функций предварительной версии Azure позволяет клиентам включить службу, выполнив следующие действия.
Войдите на портал Azure.
В поле поиска введите подписки и выберите Подписки.
Выберите ссылку с названием вашей подписки.
В меню слева в разделе "Параметры" выберите пункт "Предварительный просмотр функций".
Найдите и выберите функцию Fireworks.EnableDeploy preview.
Просмотрите условия, указанные в описании и разделео конфиденциальности данных в этой документации.
Если вы не согласны с условиями, нажмите кнопку "Закрыть " и не продолжайте работу. В противном случае нажмите кнопку "Зарегистрировать".
Нажмите ОК. Экран предварительного просмотра функций обновляется и отображается состояние функции предварительного просмотра. Для включения функции в вашей подписке может потребоваться до 30 минут.
Совет
Чтобы проверить регистрацию, обновите страницу функций предварительной версии и убедитесь, что в столбце Состояние указано Зарегистрировано для функции Fireworks on Foundry.
Развертывание моделей Fireworks на портале Foundry
После включения функции можно выполнить развертывание моделей Fireworks из каталога моделей Foundry. Выполните следующие действия, чтобы получить активную конечную точку для завершения сеанса чата. Просмотрите доступные модели в разделе "Доступные модели каталога " или импортируйте собственную пользовательскую модель.
На домашней странице портала выберите "Обнаружить " в правой верхней части навигации.
В левой области выберите "Модели" , чтобы открыть каталог моделей.
Выберите нужную модель Fireworks, чтобы просмотреть сведения на странице модели:
На странице модели выберите "Развернуть". Дополнительные сведения о параметрах развертывания см. в разделе "Развертывание моделей Foundry" на портале.
В окне развертывания настройте следующие параметры:
- Имя развертывания: сохраните имя по умолчанию или введите пользовательское имя для идентификации развертывания.
- План токенов: выберите Оплата за токен —> Datazone Standard или Выделенная пропускная способность —> Datazone или Global. Дополнительные сведения см. в разделе "Типы развертывания".
- Параметры версии модели: выберите версию модели для развертывания.
- Лимит токенов в минуту: Установите настраиваемый лимит токенов в минуту для управления затратами и контроля использования. Значение по умолчанию основано на типичном профиле производительности и стоимости модели.
- Guardrails: выберите конфигурацию DefaultV2 или Default Guardrails. Модели используют ограничитель Microsoft.DefaultV2, если не указано другое. Дополнительные сведения см. в разделе "Использование ограничивающих средств для установки границ выходных данных модели".
Выберите Развернуть. Процесс развертывания может занять до 30 минут.
После завершения развертывания используйте указанную конечную точку и ключ для отправки запросов вывода в модель. Чтобы быстро протестировать развертывание, используйте детскую площадку в проекте Foundry.
Совет
Чтобы проверить развертывание, перейдите на страницу "Развертывания " проекта и убедитесь, что состояние развертывания отображается успешно.
Повысьте коэффициент попаданий в кэш промптов
Кэширование запросов повторно использует обработку запросов, использующих один и тот же префикс запроса. Чтобы повысить коэффициент попаданий в кэш запросов, задайте стабильный идентификатор для каждого пользователя или сеанса и используйте одно и то же значение повторно для связанных запросов. Используйте один из следующих вариантов:
-
x-session-affinityЗадайте заголовок HTTP. -
userЗадайте параметр запроса. -
prompt_cache_keyЗадайте параметр запроса. Этот параметр имеет приоритетuserпри наличии обоих.
Дополнительные сведения см. в разделе "Кэширование запросов " в документации по ИИ Fireworks.
Доступные модели каталога
Следующие модели Fireworks доступны в каталоге моделей Foundry. В столбце Поддерживаемые предложения PTU включены как глобальная подготовленная пропускная способность, так и подготовленная пропускная способность для зоны данных.
| Поставщик моделей | Имя модели | Идентификатор модели | Тип | Поддерживаемые предложения | Описание |
|---|---|---|---|---|---|
| DeepSeek | DeepSeek V3.1 | FW-DeepSeek-V3.1 |
Завершение чата | PTU | Языковая модель MoE с контекстным окном 163K и поддержкой вызова функций для чат-приложений и сценариев работы с инструментами. |
| DeepSeek | DeepSeek V3.2 | FW-DeepSeek-V3.2 |
Завершение чата | PTU | Модель MoE, ориентированная на эффективный вывод и производительность агента. |
| DeepSeek | DeepSeek V4 Flash | FW-DeepSeek-V4-Flash |
Завершение чата | PTU | Облегчённая модель MoE, оптимизированная для быстрых и экономичных рассуждений и написания кода при контекстном окне в 1 млн токенов. |
| DeepSeek | DeepSeek V4 Flash 0731 | FW-DeepSeek-V4-Flash-0731 |
Завершение чата | Оплата за токен и PTU | Обновлена модель DeepSeek V4 Flash с расширенными возможностями агента, спекулятивным декодированием и контекстом 1M. |
| DeepSeek | DeepSeek V4 Pro | FW-DeepSeek-V4-Pro |
Завершение чата | Оплата за токен и PTU | Флагманская модель MoE 1.6T для передовых задач рассуждения, программирования и агентных нагрузок с длинным контекстом. |
| Gemma 4 26B A4B IT | FW-Gemma-4-26B-A4B-IT |
Завершение чата | PTU | Мультимодальная модель MoE, настроенная на выполнение инструкций, с поддержкой ввода изображений, вызова функций и контекста 256K. | |
| Gemma 4 31B IT | FW-Gemma-4-31B-IT |
Завершение чата | PTU | Мультимодальная плотная модель, дообученная на инструкциях, с поддержкой ввода изображений, вызова функций и контекста 256K. | |
| Мета | Llama 3.1 8B Инструкция | FW-Llama-v3.1-8B-Instruct |
Завершение чата | PTU | Многоязычная модель, дообученная на инструкциях и оптимизированная для диалоговых задач. |
| Minimax | MiniMax-M2.5 | FW-MiniMax-M2.5 |
Завершение чата | PTU | MoE-модель для программирования, агентного использования инструментов, поиска и офисных рабочих процессов. |
| Minimax | MiniMax-M3 | FW-MiniMax-M3 |
Завершение чата | Оплата за токен и PTU | Многомодальная модель MoE с контекстным окном 512K для программирования и длительных агентных задач. |
| Мистраль ИИ | Ministral 3 3B Instruct 2512 | FW-Ministral-3-3B-Instruct-2512 |
Завершение чата | PTU | Компактные трехмерные модели с плотной инструкцией, настроенной с помощью входных данных зрения и контекста 256K. |
| Moonshot AI | Кими K2 Инструкция 0905 | FW-Kimi-K2-Instruct-0905 |
Завершение чата | PTU | Модель инструкций MoE с 1T-параметром с контекстом 262K, улучшенным кодом и использованием инструментов. |
| Moonshot AI | Кими K2 Thinking | FW-Kimi-K2-Thinking |
Завершение чата | PTU | Рассуждающая MoE-модель для агентов, пошагово использующих инструменты, с контекстным окном 262K. |
| Moonshot AI | Кими K2.5 | FW-Kimi-K2.5 |
Завершение чата | PTU | Мультимодальная агентная модель MoE с управлением рассуждением, использованием инструментов и контекстным окном 262K. |
| Moonshot AI | Кими K2.6 | FW-Kimi-K2.6 |
Завершение чата | Оплата за токен и PTU | Мультимодальная агентная модель с открытым исходным кодом для долгосрочного программирования и оркестрации задач. |
| Moonshot AI | Код Kimi K2.7 | FW-Kimi-K2.7-Code |
Завершение чата | Оплата за токен и PTU | Агентная мультимодальная модель, ориентированная на программирование, для долгосрочных рабочих процессов разработки программного обеспечения. |
| Moonshot AI | Кими K3 | FW-Kimi-K3 |
Завершение чата | Оплата за токен | Многомодальная модель moE 2.8T с собственным визуальным пониманием и контекстом 1M. |
| NVIDIA | NVIDIA Nemotron 3 Super 120B A12B BF16 | FW-Nemotron-3-Super-120B-A12B-BF16 |
Завершение чата | PTU | Гибридная модель LatentMoE с 120 млрд параметров для агентных рабочих процессов, рассуждений с длинным контекстом и использования инструментов. |
| NVIDIA | NVIDIA Nemotron 3 Ultra NVFP4 | FW-Nemotron-3-Ultra-NVFP4 |
Завершение чата | Оплата за токен и PTU | Модель рассуждений Nemotron с контекстным окном 262K для агентных рабочих нагрузок и задач с длинным контекстом. |
| NVIDIA | NVIDIA Nemotron Lightning 3.5 30B A3B | FW-Nemotron-Lightning-3.5-30B-A3B |
Завершение чата | Оплата за токен и PTU | Гибридная модель Mamba-Transformer MoE с настраиваемым режимом рассуждения и контекстным окном 262K. |
| OpenAI | OpenAI gpt-oss-120b | FW-GPT-OSS-120B |
Завершение чата | PTU | Модель MoE с открытыми весами для логических рассуждений, агентных задач и сценариев использования разработчиками. |
| OpenAI | OpenAI gpt-oss-20b | FW-GPT-OSS-20B |
Завершение чата | PTU | Модель с открытыми весами для логических рассуждений и задач разработчиков с контекстным окном 131K. |
| PaddlePaddle | PaddleOCR VL 1.6 | FW-PaddleOCR-VL-1.6 |
Завершение чата | PTU | Компактная модель визуального распознавания для синтаксического анализа документов, включая OCR, таблицы, формулы и диаграммы. |
| Qwen | Qwen3 14B | FW-Qwen3-14B |
Завершение чата | PTU | Плотная модель Qwen с вызовами функций и контекстом 40,9K. |
| Qwen | Qwen3 32B | FW-Qwen3-32B |
Завершение чата | PTU | Плотная модель Qwen 32B для анализа, программирования и диалоговых задач. |
| Qwen | Qwen3.5 4B | FW-Qwen3.5-4B |
Завершение чата | PTU | Компактная модель Qwen с контекстным окном 262K. |
| Qwen | Qwen3.5 9B | FW-Qwen3.5-9B |
Завершение чата | PTU | Компактная плотная модель Qwen с контекстом 262K. |
| Qwen | Qwen3.5 27B | FW-Qwen3.5-27B |
Завершение чата | PTU | Плотная модель 27B Qwen с контекстом 262K. |
| Qwen | Qwen3.5 35B A3B | FW-Qwen3.5-35B-A3B |
Завершение чата | PTU | Модель 35B-parameter MoE Qwen с контекстом 262K. |
| Qwen | Qwen3.5 122B A10B | FW-Qwen3.5-122B-A10B |
Завершение чата | PTU | Модель 122B-параметра MoE Qwen с входными данными изображения и контекстом 262K. |
| Qwen | Qwen3.5 397B A17B | FW-Qwen3.5-397B-A17B |
Завершение чата | PTU | Модель 396B-parameter MoE Qwen с входными данными изображения и контекстом 262K. |
| Qwen | Qwen3.6 27B | FW-Qwen3.6-27B |
Завершение чата | PTU | Плотная модель Qwen с 27 млрд параметров, поддержкой ввода изображений, вызова функций и контекстным окном 262K. |
| Qwen | Qwen3.6 35B A3B | FW-Qwen3.6-35B-A3B |
Завершение чата | PTU | Модель 35B-parameter MoE Qwen с контекстом 262K. |
| Лаборатория Thinking Machines | Намёк | FW-Inkling |
Завершение чата | Оплата за токен и PTU | Модель MoE с многомодальными параметрами 975B с текстом, изображением и звуковым вводом и контекстом 1M. |
| Z.ai | GLM-4.7 | FW-GLM-4.7 |
Завершение чата | PTU | MoE-модель с 352 млрд параметров для программирования, логических рассуждений и агентных рабочих процессов. |
| Z.ai | GLM-5 | FW-GLM-5 |
Завершение чата | PTU | Модель MoE для сложной системной инженерии и долгосрочных агентных задач. |
| Z.ai | GLM-5.1 | FW-GLM-5.1 |
Завершение чата | PTU | MoE-модель для агентной разработки, программирования и долгосрочных задач. |
| Z.ai | GLM-5.2 | FW-GLM-5.2 |
Завершение чата | Оплата за токен и PTU | Модель MoE с контекстным окном в 1 млн токенов и возможностями написания кода с разными уровнями усилий для задач с длинным горизонтом планирования. |
| Z.ai | GLM-5.2 Fast | FW-GLM-5.2-Fast |
Завершение чата | Оплата за токен и PTU | Высокопроизводительный вариант GLM-5.2, оптимизированный для чувствительных к задержкам задач программирования и агентных рабочих нагрузок. |
| Z.ai | GLM-5.3 | FW-GLM-5.3 |
Завершение чата | Оплата за токен | Преемник GLM-5.2 с улучшенными возможностями написания сложного кода и повышенной производительностью при выполнении долгосрочных задач. |
Все модели каталога поддерживают API OpenAI/v1 для API завершения чата и пакет SDK Foundry и конечную точку для доступа к API ответов.
Важно
Предложение с оплатой за токен не рекомендуется использовать для FW-GPT-OSS-120B, , FW-DeepSeek-V3.2, FW-Kimi-K2.5, FW-GLM-5и FW-GLM-5.1FW-MiniMax-M2.5. Подготовленная пропускная способность (PTU) остается доступной для всех шести моделей.
Для моделей Fireworks в рамках стандартных предложений инференса (Per-Token) действует 15-дневный срок предварительного уведомления до вывода модели из эксплуатации. Спланируйте развертывания соответствующим образом и отслеживайте уведомления о предстоящих датах выхода на пенсию.
Пользовательские модели (принести собственную модель)
Помимо моделей из каталога, Fireworks в "Foundry" поддерживает импорт и развертывание собственных пользовательских весов моделей. Эта возможность BYOM позволяет запускать собственные или точно настроенные модели с открытыми параметрами в экосистеме Foundry, в то время как оптимизированное облако Fireworks обеспечивает вывод.
Поддерживаемые архитектуры моделей
Пользовательские модели должны основываться на одной из следующих поддерживаемых архитектур:
- Кими (K2, K2.5, K2.6)
- GLM (4.7, 4.8)
- OpenAI (gpt-oss-120b)
- Qwen (qwen3.5-9B, qwen3.5-35B-A3B, qwen3.5-112B-A10B, qwen3.5-397B)
Ограничения
- Ориентированный на CLI рабочий процесс. В процессе импорта используется Azure Developer CLI (). Портал Foundry поддерживает регистрацию, просмотр и развертывание моделей после отправки.
- В настоящее время рабочие процессы агентов Fireworks и конструктора агентов не поддерживаются.
Пошаговые инструкции см. в разделе "Импорт пользовательских моделей" в Foundry.
Конфиденциальность данных
При использовании Fireworks в Foundry данные совместно используются между Microsoft и Fireworks AI, а также применяются различные правила соответствия и обработки данных. Дополнительные сведения см. ниже. Клиенты несут ответственность за оценку целесообразности обмена данными между Microsoft и Fireworks в контексте соблюдения требований их организаций.
Fireworks on Foundry в настоящее время исключены из обязательств по Границе данных ЕС.
FedRAMP не сертифицирован для Fireworks на Foundry. Если вашей организации требуется FedRAMP, прежде чем использовать, обратитесь к своему чиновнику авторизации, чтобы определить, разрешено ли использование Fireworks в Foundry.
Стандарт безопасности данных индустрии платежных карт (PCI DSS) не применим к Fireworks в Foundry. Не следует использовать Fireworks в Foundry для хранения, обработки или передачи данных об оплате и данных о держателе карты.
Примечание по прозрачности
Fireworks on Foundry позволяет клиентам развертывать и управлять сторонними и открытыми моделями ИИ с помощью служб платформы Foundry Microsoft.
- Microsoft не разрабатывает, не обучает, не дополняет и не оценивает характеристики безопасности, защищенности или ответственного использования ИИ моделей, развернутых через платформу Fireworks в Foundry.
- Microsoft не представляет никаких представлений о поведении, производительности или профиле риска этих моделей.
- Клиенты несут ответственность за оценку пригодности любой модели для их предполагаемого использования, включая выполнение любых необходимых операций безопасности, соответствия требованиям и оценки ответственного ИИ, прежде чем развертывать модели в рабочих или клиентских приложениях.
Foundry предоставляет инструменты и лучшие практики для проведения собственных оценок рисков и безопасности моделей.
Часто задаваемые вопросы
Доступен ли Fireworks on Foundry в Azure для правительства США?
Нет, в настоящее время служба Fireworks on Foundry недоступна для пользователей облака Azure для государственных организаций.
Как получить квоту для развертываний модели Fireworks?
Используйте форму запроса квоты, чтобы запросить увеличение квоты для Fireworks на Foundry.
У меня есть учетная запись Fireworks AI. Можно ли использовать существующие развертывания Fireworks?
Нет, вам нужно создать новые развертывания в Foundry. Если вы хотите изменить потребление на Azure, обратитесь к группе учетной записи Fireworks, чтобы помочь.
Можно ли развернуть модели на основе LoRA или адаптера?
Поддержка LoRA доступна в общедоступной предварительной версии. Дополнительные сведения см. в разделе импорта настраиваемых режимов Fireworks .
Как импортировать и развернуть пользовательскую модель?
Импорт пользовательской модели использует рабочий процесс с приоритетом использования интерфейса командной строки с Azure Developer CLI. Пошаговые инструкции см. в разделе "Импорт пользовательских моделей" в Foundry.
Как выставляется счет за Fireworks в Foundry?
Модели Fireworks, развернутые с помощью Foundry, поддерживают как оплату за токен так и предоставленную пропускную способность.
Как отключить Fireworks в проекте Foundry?
Фейерверки можно отключить на уровне подписки Azure. Выполните следующие шаги, чтобы отключить предварительные функции в вашей подписке Azure.
Как использовать API ответов?
API ответов поддерживается через API проектов Foundry и пакет SDK. Убедитесь, что клиент настроен на использование конечной точки API вашего проекта, или используйте Foundry SDK.
Устранение неполадок Fireworks в Foundry
Используйте следующие инструкции, чтобы устранить распространенные проблемы с Fireworks в Foundry.
| Проблема | Разрешение |
|---|---|
| Предварительная регистрация остается в состоянии "В процессе регистрации" | Регистрация может занять до 30 минут. Обновите страницу функций предварительного просмотра , чтобы проверить текущее состояние. Если состояние не изменится через 30 минут, попробуйте отменить регистрацию и повторно зарегистрировать функцию. |
| Модели Fireworks не отображаются в каталоге моделей | Убедитесь, что состояние функции предпросмотра указано как Зарегистрировано для вашей подписки. Убедитесь, что вы работаете в поддерживаемом регионе. |
| Сбой развертывания с ошибкой квоты | Используйте форму запроса квоты , чтобы запросить добавленную емкость для Fireworks в Foundry. |
| "Запрещено" или запрещен доступ во время развертывания | Убедитесь, что ваше удостоверение имеет роль Azure AI разработчик или более высокую роль в проекте Foundry. Для развертывания недостаточно только ролей уровня подписки. |
| Конечная точка модели возвращает ошибки после развертывания | Убедитесь, что состояние развертывания отображается успешно на странице развертываний проекта. Убедитесь, что вы используете правильный URI целевого объекта и ключ из сведений о развертывании. |
Дополнительные сведения см. в разделе часто задаваемых вопросов .
Связанное содержимое
- Импорт пользовательских моделей в Foundry
- Развертывание моделей Foundry на портале
- Модели Foundry от сообщества и партнеров
- Общие сведения о каталоге моделей Foundry
- Типы развертывания
- Основные понятия подготовленной пропускной способности
- встроенные роли Azure
- Функции предварительной версии Azure
- Центр доверия Fireworks AI