Модели Фейерверк в Microsoft Foundry

Благодаря интеграции с Fireworks AI клиенты Microsoft Foundry могут:

Все эти возможности доступны непосредственно в проекте Foundry, с встроенными возможностями управления от Azure, контроля доступа и управления проектами.

Необходимые условия

  • Подписка Azure. Если у вас нет учетной записи, создайте бесплатную учетную запись.

  • Ресурс Foundry с проектом Foundry.

  • Удостоверение Azure с ролью владельца подписки или участника подписки, чтобы включить эту функцию.

  • Для развертывания моделей вам потребуется роль владельца Foundry в проекте Foundry . Дополнительные сведения см. в разделе встроенные роли Azure.

    Важно

    Недавно были переименованы роли RBAC в Foundry. Foundry User, Foundry Owner, Foundry Account Owner и Foundry Project Manager ранее назывались пользователь Azure AI, владелец Azure AI, владелец учетной записи Azure AI и руководитель проекта Azure AI. Пока новое название внедряется, в некоторых местах вы всё ещё можете видеть прежние названия. Идентификаторы ролей и основные разрешения не меняются из-за переименования.

Доступность региона

Развертывания моделей типов "Data Zone Standard" и "Data Zone Provisioned" через Fireworks в Foundry доступны в следующих регионах Azure:

  • Восток США (eastus)
  • Восток США 2 (eastus2)
  • Центральная часть США (центральная часть США)
  • Северный Центральный США (northcentralus)
  • Запад США (westus)
  • Запад США 3 (westus3)

Развертывания базовых и пользовательских моделей с глобальной выделенной пропускной способностью доступны во всех глобальных регионах Azure, кроме облачных сред Azure для государственных организаций. Все модели каталога, поддерживающие глобальную выделенную пропускную способность, также поддерживают выделенную пропускную способность для зоны данных.

Включите Fireworks на Foundry

Важно

Fireworks on Foundry в настоящее время исключены из обязательств по Границе данных ЕС.

FedRAMP не сертифицирован для Fireworks на Foundry. Если вашей организации требуется FedRAMP, прежде чем использовать, обратитесь к своему чиновнику авторизации, чтобы определить, разрешено ли использование Fireworks в Foundry.

Стандарт безопасности данных индустрии платежных карт (PCI DSS) не применим к Fireworks в Foundry. Не следует использовать Fireworks в Foundry для хранения, обработки или передачи данных об оплате и данных о держателе карты.

Хотя Fireworks on Foundry общедоступен, администратор должен включить службу в подписке Azure. Портал функций предварительной версии Azure позволяет клиентам включить службу, выполнив следующие действия.

  1. Войдите на портал Azure.

  2. В поле поиска введите подписки и выберите Подписки.

  3. Выберите ссылку с названием вашей подписки.

  4. В меню слева в разделе "Параметры" выберите пункт "Предварительный просмотр функций".

  5. Найдите и выберите функцию Fireworks.EnableDeploy preview.

  6. Просмотрите условия, указанные в описании и разделео конфиденциальности данных в этой документации.

  7. Если вы не согласны с условиями, нажмите кнопку "Закрыть " и не продолжайте работу. В противном случае нажмите кнопку "Зарегистрировать".

  8. Нажмите ОК. Экран предварительного просмотра функций обновляется и отображается состояние функции предварительного просмотра. Для включения функции в вашей подписке может потребоваться до 30 минут.

    Совет

    Чтобы проверить регистрацию, обновите страницу функций предварительной версии и убедитесь, что в столбце Состояние указано Зарегистрировано для функции Fireworks on Foundry.

    Скриншот настройки функций предварительного просмотра на портале Azure.

Развертывание моделей Fireworks на портале Foundry

После включения функции можно выполнить развертывание моделей Fireworks из каталога моделей Foundry. Выполните следующие действия, чтобы получить активную конечную точку для завершения сеанса чата. Просмотрите доступные модели в разделе "Доступные модели каталога " или импортируйте собственную пользовательскую модель.

  1. На домашней странице портала выберите "Обнаружить " в правой верхней части навигации.

  2. В левой области выберите "Модели" , чтобы открыть каталог моделей.

  3. Выберите нужную модель Fireworks, чтобы просмотреть сведения на странице модели:

    Снимок экрана: домашняя страница моделей Foundry с доступными моделями Fireworks.

  4. На странице модели выберите "Развернуть". Дополнительные сведения о параметрах развертывания см. в разделе "Развертывание моделей Foundry" на портале.

  5. В окне развертывания настройте следующие параметры:

    • Имя развертывания: сохраните имя по умолчанию или введите пользовательское имя для идентификации развертывания.
    • План токенов: выберите Оплата за токен —> Datazone Standard или Выделенная пропускная способность —> Datazone или Global. Дополнительные сведения см. в разделе "Типы развертывания".
    • Параметры версии модели: выберите версию модели для развертывания.
    • Лимит токенов в минуту: Установите настраиваемый лимит токенов в минуту для управления затратами и контроля использования. Значение по умолчанию основано на типичном профиле производительности и стоимости модели.
    • Guardrails: выберите конфигурацию DefaultV2 или Default Guardrails. Модели используют ограничитель Microsoft.DefaultV2, если не указано другое. Дополнительные сведения см. в разделе "Использование ограничивающих средств для установки границ выходных данных модели".
  6. Выберите Развернуть. Процесс развертывания может занять до 30 минут.

  7. После завершения развертывания используйте указанную конечную точку и ключ для отправки запросов вывода в модель. Чтобы быстро протестировать развертывание, используйте детскую площадку в проекте Foundry.

    Совет

    Чтобы проверить развертывание, перейдите на страницу "Развертывания " проекта и убедитесь, что состояние развертывания отображается успешно.

Повысьте коэффициент попаданий в кэш промптов

Кэширование запросов повторно использует обработку запросов, использующих один и тот же префикс запроса. Чтобы повысить коэффициент попаданий в кэш запросов, задайте стабильный идентификатор для каждого пользователя или сеанса и используйте одно и то же значение повторно для связанных запросов. Используйте один из следующих вариантов:

  • x-session-affinity Задайте заголовок HTTP.
  • user Задайте параметр запроса.
  • prompt_cache_key Задайте параметр запроса. Этот параметр имеет приоритет user при наличии обоих.

Дополнительные сведения см. в разделе "Кэширование запросов " в документации по ИИ Fireworks.

Доступные модели каталога

Следующие модели Fireworks доступны в каталоге моделей Foundry. В столбце Поддерживаемые предложения PTU включены как глобальная подготовленная пропускная способность, так и подготовленная пропускная способность для зоны данных.

Поставщик моделей Имя модели Идентификатор модели Тип Поддерживаемые предложения Описание
DeepSeek DeepSeek V3.1 FW-DeepSeek-V3.1 Завершение чата PTU Языковая модель MoE с контекстным окном 163K и поддержкой вызова функций для чат-приложений и сценариев работы с инструментами.
DeepSeek DeepSeek V3.2 FW-DeepSeek-V3.2 Завершение чата PTU Модель MoE, ориентированная на эффективный вывод и производительность агента.
DeepSeek DeepSeek V4 Flash FW-DeepSeek-V4-Flash Завершение чата PTU Облегчённая модель MoE, оптимизированная для быстрых и экономичных рассуждений и написания кода при контекстном окне в 1 млн токенов.
DeepSeek DeepSeek V4 Flash 0731 FW-DeepSeek-V4-Flash-0731 Завершение чата Оплата за токен и PTU Обновлена модель DeepSeek V4 Flash с расширенными возможностями агента, спекулятивным декодированием и контекстом 1M.
DeepSeek DeepSeek V4 Pro FW-DeepSeek-V4-Pro Завершение чата Оплата за токен и PTU Флагманская модель MoE 1.6T для передовых задач рассуждения, программирования и агентных нагрузок с длинным контекстом.
Google Gemma 4 26B A4B IT FW-Gemma-4-26B-A4B-IT Завершение чата PTU Мультимодальная модель MoE, настроенная на выполнение инструкций, с поддержкой ввода изображений, вызова функций и контекста 256K.
Google Gemma 4 31B IT FW-Gemma-4-31B-IT Завершение чата PTU Мультимодальная плотная модель, дообученная на инструкциях, с поддержкой ввода изображений, вызова функций и контекста 256K.
Мета Llama 3.1 8B Инструкция FW-Llama-v3.1-8B-Instruct Завершение чата PTU Многоязычная модель, дообученная на инструкциях и оптимизированная для диалоговых задач.
Minimax MiniMax-M2.5 FW-MiniMax-M2.5 Завершение чата PTU MoE-модель для программирования, агентного использования инструментов, поиска и офисных рабочих процессов.
Minimax MiniMax-M3 FW-MiniMax-M3 Завершение чата Оплата за токен и PTU Многомодальная модель MoE с контекстным окном 512K для программирования и длительных агентных задач.
Мистраль ИИ Ministral 3 3B Instruct 2512 FW-Ministral-3-3B-Instruct-2512 Завершение чата PTU Компактные трехмерные модели с плотной инструкцией, настроенной с помощью входных данных зрения и контекста 256K.
Moonshot AI Кими K2 Инструкция 0905 FW-Kimi-K2-Instruct-0905 Завершение чата PTU Модель инструкций MoE с 1T-параметром с контекстом 262K, улучшенным кодом и использованием инструментов.
Moonshot AI Кими K2 Thinking FW-Kimi-K2-Thinking Завершение чата PTU Рассуждающая MoE-модель для агентов, пошагово использующих инструменты, с контекстным окном 262K.
Moonshot AI Кими K2.5 FW-Kimi-K2.5 Завершение чата PTU Мультимодальная агентная модель MoE с управлением рассуждением, использованием инструментов и контекстным окном 262K.
Moonshot AI Кими K2.6 FW-Kimi-K2.6 Завершение чата Оплата за токен и PTU Мультимодальная агентная модель с открытым исходным кодом для долгосрочного программирования и оркестрации задач.
Moonshot AI Код Kimi K2.7 FW-Kimi-K2.7-Code Завершение чата Оплата за токен и PTU Агентная мультимодальная модель, ориентированная на программирование, для долгосрочных рабочих процессов разработки программного обеспечения.
Moonshot AI Кими K3 FW-Kimi-K3 Завершение чата Оплата за токен Многомодальная модель moE 2.8T с собственным визуальным пониманием и контекстом 1M.
NVIDIA NVIDIA Nemotron 3 Super 120B A12B BF16 FW-Nemotron-3-Super-120B-A12B-BF16 Завершение чата PTU Гибридная модель LatentMoE с 120 млрд параметров для агентных рабочих процессов, рассуждений с длинным контекстом и использования инструментов.
NVIDIA NVIDIA Nemotron 3 Ultra NVFP4 FW-Nemotron-3-Ultra-NVFP4 Завершение чата Оплата за токен и PTU Модель рассуждений Nemotron с контекстным окном 262K для агентных рабочих нагрузок и задач с длинным контекстом.
NVIDIA NVIDIA Nemotron Lightning 3.5 30B A3B FW-Nemotron-Lightning-3.5-30B-A3B Завершение чата Оплата за токен и PTU Гибридная модель Mamba-Transformer MoE с настраиваемым режимом рассуждения и контекстным окном 262K.
OpenAI OpenAI gpt-oss-120b FW-GPT-OSS-120B Завершение чата PTU Модель MoE с открытыми весами для логических рассуждений, агентных задач и сценариев использования разработчиками.
OpenAI OpenAI gpt-oss-20b FW-GPT-OSS-20B Завершение чата PTU Модель с открытыми весами для логических рассуждений и задач разработчиков с контекстным окном 131K.
PaddlePaddle PaddleOCR VL 1.6 FW-PaddleOCR-VL-1.6 Завершение чата PTU Компактная модель визуального распознавания для синтаксического анализа документов, включая OCR, таблицы, формулы и диаграммы.
Qwen Qwen3 14B FW-Qwen3-14B Завершение чата PTU Плотная модель Qwen с вызовами функций и контекстом 40,9K.
Qwen Qwen3 32B FW-Qwen3-32B Завершение чата PTU Плотная модель Qwen 32B для анализа, программирования и диалоговых задач.
Qwen Qwen3.5 4B FW-Qwen3.5-4B Завершение чата PTU Компактная модель Qwen с контекстным окном 262K.
Qwen Qwen3.5 9B FW-Qwen3.5-9B Завершение чата PTU Компактная плотная модель Qwen с контекстом 262K.
Qwen Qwen3.5 27B FW-Qwen3.5-27B Завершение чата PTU Плотная модель 27B Qwen с контекстом 262K.
Qwen Qwen3.5 35B A3B FW-Qwen3.5-35B-A3B Завершение чата PTU Модель 35B-parameter MoE Qwen с контекстом 262K.
Qwen Qwen3.5 122B A10B FW-Qwen3.5-122B-A10B Завершение чата PTU Модель 122B-параметра MoE Qwen с входными данными изображения и контекстом 262K.
Qwen Qwen3.5 397B A17B FW-Qwen3.5-397B-A17B Завершение чата PTU Модель 396B-parameter MoE Qwen с входными данными изображения и контекстом 262K.
Qwen Qwen3.6 27B FW-Qwen3.6-27B Завершение чата PTU Плотная модель Qwen с 27 млрд параметров, поддержкой ввода изображений, вызова функций и контекстным окном 262K.
Qwen Qwen3.6 35B A3B FW-Qwen3.6-35B-A3B Завершение чата PTU Модель 35B-parameter MoE Qwen с контекстом 262K.
Лаборатория Thinking Machines Намёк FW-Inkling Завершение чата Оплата за токен и PTU Модель MoE с многомодальными параметрами 975B с текстом, изображением и звуковым вводом и контекстом 1M.
Z.ai GLM-4.7 FW-GLM-4.7 Завершение чата PTU MoE-модель с 352 млрд параметров для программирования, логических рассуждений и агентных рабочих процессов.
Z.ai GLM-5 FW-GLM-5 Завершение чата PTU Модель MoE для сложной системной инженерии и долгосрочных агентных задач.
Z.ai GLM-5.1 FW-GLM-5.1 Завершение чата PTU MoE-модель для агентной разработки, программирования и долгосрочных задач.
Z.ai GLM-5.2 FW-GLM-5.2 Завершение чата Оплата за токен и PTU Модель MoE с контекстным окном в 1 млн токенов и возможностями написания кода с разными уровнями усилий для задач с длинным горизонтом планирования.
Z.ai GLM-5.2 Fast FW-GLM-5.2-Fast Завершение чата Оплата за токен и PTU Высокопроизводительный вариант GLM-5.2, оптимизированный для чувствительных к задержкам задач программирования и агентных рабочих нагрузок.
Z.ai GLM-5.3 FW-GLM-5.3 Завершение чата Оплата за токен Преемник GLM-5.2 с улучшенными возможностями написания сложного кода и повышенной производительностью при выполнении долгосрочных задач.

Все модели каталога поддерживают API OpenAI/v1 для API завершения чата и пакет SDK Foundry и конечную точку для доступа к API ответов.

Важно

Предложение с оплатой за токен не рекомендуется использовать для FW-GPT-OSS-120B, , FW-DeepSeek-V3.2, FW-Kimi-K2.5, FW-GLM-5и FW-GLM-5.1FW-MiniMax-M2.5. Подготовленная пропускная способность (PTU) остается доступной для всех шести моделей.

Для моделей Fireworks в рамках стандартных предложений инференса (Per-Token) действует 15-дневный срок предварительного уведомления до вывода модели из эксплуатации. Спланируйте развертывания соответствующим образом и отслеживайте уведомления о предстоящих датах выхода на пенсию.

Пользовательские модели (принести собственную модель)

Помимо моделей из каталога, Fireworks в "Foundry" поддерживает импорт и развертывание собственных пользовательских весов моделей. Эта возможность BYOM позволяет запускать собственные или точно настроенные модели с открытыми параметрами в экосистеме Foundry, в то время как оптимизированное облако Fireworks обеспечивает вывод.

Поддерживаемые архитектуры моделей

Пользовательские модели должны основываться на одной из следующих поддерживаемых архитектур:

  • Кими (K2, K2.5, K2.6)
  • GLM (4.7, 4.8)
  • OpenAI (gpt-oss-120b)
  • Qwen (qwen3.5-9B, qwen3.5-35B-A3B, qwen3.5-112B-A10B, qwen3.5-397B)

Ограничения

  • Ориентированный на CLI рабочий процесс. В процессе импорта используется Azure Developer CLI (). Портал Foundry поддерживает регистрацию, просмотр и развертывание моделей после отправки.
  • В настоящее время рабочие процессы агентов Fireworks и конструктора агентов не поддерживаются.

Пошаговые инструкции см. в разделе "Импорт пользовательских моделей" в Foundry.

Конфиденциальность данных

При использовании Fireworks в Foundry данные совместно используются между Microsoft и Fireworks AI, а также применяются различные правила соответствия и обработки данных. Дополнительные сведения см. ниже. Клиенты несут ответственность за оценку целесообразности обмена данными между Microsoft и Fireworks в контексте соблюдения требований их организаций.

  • Fireworks on Foundry в настоящее время исключены из обязательств по Границе данных ЕС.

  • FedRAMP не сертифицирован для Fireworks на Foundry. Если вашей организации требуется FedRAMP, прежде чем использовать, обратитесь к своему чиновнику авторизации, чтобы определить, разрешено ли использование Fireworks в Foundry.

  • Стандарт безопасности данных индустрии платежных карт (PCI DSS) не применим к Fireworks в Foundry. Не следует использовать Fireworks в Foundry для хранения, обработки или передачи данных об оплате и данных о держателе карты.

Примечание по прозрачности

Fireworks on Foundry позволяет клиентам развертывать и управлять сторонними и открытыми моделями ИИ с помощью служб платформы Foundry Microsoft.

  • Microsoft не разрабатывает, не обучает, не дополняет и не оценивает характеристики безопасности, защищенности или ответственного использования ИИ моделей, развернутых через платформу Fireworks в Foundry.
  • Microsoft не представляет никаких представлений о поведении, производительности или профиле риска этих моделей.
  • Клиенты несут ответственность за оценку пригодности любой модели для их предполагаемого использования, включая выполнение любых необходимых операций безопасности, соответствия требованиям и оценки ответственного ИИ, прежде чем развертывать модели в рабочих или клиентских приложениях.

Foundry предоставляет инструменты и лучшие практики для проведения собственных оценок рисков и безопасности моделей.

Часто задаваемые вопросы

Доступен ли Fireworks on Foundry в Azure для правительства США?

Нет, в настоящее время служба Fireworks on Foundry недоступна для пользователей облака Azure для государственных организаций.

Как получить квоту для развертываний модели Fireworks?

Используйте форму запроса квоты, чтобы запросить увеличение квоты для Fireworks на Foundry.

У меня есть учетная запись Fireworks AI. Можно ли использовать существующие развертывания Fireworks?

Нет, вам нужно создать новые развертывания в Foundry. Если вы хотите изменить потребление на Azure, обратитесь к группе учетной записи Fireworks, чтобы помочь.

Можно ли развернуть модели на основе LoRA или адаптера?

Поддержка LoRA доступна в общедоступной предварительной версии. Дополнительные сведения см. в разделе импорта настраиваемых режимов Fireworks .

Как импортировать и развернуть пользовательскую модель?

Импорт пользовательской модели использует рабочий процесс с приоритетом использования интерфейса командной строки с Azure Developer CLI. Пошаговые инструкции см. в разделе "Импорт пользовательских моделей" в Foundry.

Как выставляется счет за Fireworks в Foundry?

Модели Fireworks, развернутые с помощью Foundry, поддерживают как оплату за токен так и предоставленную пропускную способность.

Как отключить Fireworks в проекте Foundry?

Фейерверки можно отключить на уровне подписки Azure. Выполните следующие шаги, чтобы отключить предварительные функции в вашей подписке Azure.

Как использовать API ответов?

API ответов поддерживается через API проектов Foundry и пакет SDK. Убедитесь, что клиент настроен на использование конечной точки API вашего проекта, или используйте Foundry SDK.

Устранение неполадок Fireworks в Foundry

Используйте следующие инструкции, чтобы устранить распространенные проблемы с Fireworks в Foundry.

Проблема Разрешение
Предварительная регистрация остается в состоянии "В процессе регистрации" Регистрация может занять до 30 минут. Обновите страницу функций предварительного просмотра , чтобы проверить текущее состояние. Если состояние не изменится через 30 минут, попробуйте отменить регистрацию и повторно зарегистрировать функцию.
Модели Fireworks не отображаются в каталоге моделей Убедитесь, что состояние функции предпросмотра указано как Зарегистрировано для вашей подписки. Убедитесь, что вы работаете в поддерживаемом регионе.
Сбой развертывания с ошибкой квоты Используйте форму запроса квоты , чтобы запросить добавленную емкость для Fireworks в Foundry.
"Запрещено" или запрещен доступ во время развертывания Убедитесь, что ваше удостоверение имеет роль Azure AI разработчик или более высокую роль в проекте Foundry. Для развертывания недостаточно только ролей уровня подписки.
Конечная точка модели возвращает ошибки после развертывания Убедитесь, что состояние развертывания отображается успешно на странице развертываний проекта. Убедитесь, что вы используете правильный URI целевого объекта и ключ из сведений о развертывании.

Дополнительные сведения см. в разделе часто задаваемых вопросов .