Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Управляемая Azure система Lustre в сочетании с Хранилище BLOB-объектов Azure предоставляет многоуровневую архитектуру контрольных точек, предназначенную для крупномасштабных рабочих нагрузок обучения ИИ. Этот сценарий использует Управляемая Azure система Lustre в качестве высокопроизводительного слоя-ускорителя с высокой пропускной способностью, совместимого с POSIX и расположенного близко к вычислительным ресурсам GPU, а Хранилище BLOB-объектов Azure — в качестве надежного и экономичного основного слоя хранения для долгосрочного хранения контрольных точек.
В этой статье описывается, когда следует использовать многоуровневую контрольную точку, как работает архитектура и какую производительность можно ожидать.
Когда следует использовать этот сценарий
Рассмотрим многоуровневую контрольную точку с Управляемая Azure система Lustre, если рабочая нагрузка соответствует одному или нескольким из следующих условий:
- Вы обучаете большие базовые модели (например, LLM в десятках до сотен миллиардов параметров), которые создают большие, частые контрольные точки.
- Необходимо свести к минимуму время записи контрольных точек, чтобы сократить циклы простоя GPU во время обучения.
- Требуется устойчивое, долгосрочное хранение контрольных точек для восстановления или воспроизведения экспериментов.
- Вы хотите отделить производительность записи контрольных точек от хранилища объектов, разделив уровень ускорения и основной уровень хранения.
- Вы запускаете распределенное обучение в кластерах GPU (например, Azure виртуальных машинах серии ND), для которых требуется общая файловая система POSIX.
Architecture
Архитектура многоуровневой контрольной точки использует возможности иерархического управления хранилищами (HSM) Управляемая Azure система Lustre для создания двухуровневой структуры:
- Уровень акселератора — Управляемая Azure система Lustre: высокопроизводительная параллельная файловая система, совместимая с POSIX, подключенная непосредственно на вычислительных узлах GPU. Контрольные точки записываются на полную подготовленную пропускную способность файловой системы (например, 64 ГБ/с на уровне AMLFS 500 с емкостью 128 ТиБ).
- Основной уровень хранения — Хранилище BLOB-объектов Azure: устойчивое, масштабируемое и оптимизированное для затрат хранилище объектов для архивации контрольных точек и долгосрочного хранения.
Контрольные точки обучения записываются из узлов GPU в Управляемая Azure система Lustre через собственный клиент Lustre. Завершенные контрольные точки затем асинхронно реплицируются в Хранилище BLOB-объектов Azure с помощью функции автоматического экспорта интеграции Управляемая Azure система Lustre с Хранилище BLOB-объектов Azure.
┌─────────────────────────────────────────────────────────────────────────┐
│ Training Compute Cluster │
└─────────────────────────────┬───────────────────────────────────────────┘
│ Write checkpoints at full AMLFS bandwidth
▼
┌─────────────────────────────────────────────────────────────────────────┐
│ Azure Managed Lustre (AMLFS) │
│ │
│ /lustrefs/checkpoints/modelA/ │
│ ├── global_epoch1_step1/ │
│ ├── global_epoch1_step2/ │
│ └── global_epoch1_stepN/ │
└─────────────────────────────┬───────────────────────────────────────────┘
│ Asynchronous HSM archive (auto-export)
▼
┌─────────────────────────────────────────────────────────────────────────┐
│ Azure Blob Storage │
│ │
│ - Recovery │
│ - Long-term retention │
│ - Cost-optimized archive │
└─────────────────────────────────────────────────────────────────────────┘
Принцип работы потока данных
- Запись контрольных точек. Платформа обучения ИИ записывает контрольные точки непосредственно в Управляемая Azure система Lustre через интерфейс POSIX. Записи используют полную подготовленную пропускную способность файловой системы, минимизируя время остановки GPU.
- Локальная устойчивость — Управляемая Azure система Lustre обеспечивает устойчивость локально избыточного хранилища (LRS). После фиксации контрольной точки в файловой системе она сохраняется независимо от жизненного цикла вычислительных узлов GPU.
- Асинхронный архив — функция автоматического экспорта BLOB-объектов AMLFS непрерывно и автоматически передает завершенные контрольные точки в Хранилище BLOB-объектов Azure без вмешательства пользователя. Архивация отделяется от цикла обучения, поэтому она не влияет на пропускную способность записи в GPU.
- Восстановление — архивные контрольные точки можно по запросу повторно загрузить обратно в Управляемая Azure система Lustre с помощью заданий на импорт.
Note
Вы можете в любой момент включить автоэкспорт для файловой системы Управляемая Azure система Lustre через портал Azure или Azure CLI. Дополнительные сведения см. в разделе "Экспорт данных с помощью заданий автоматического экспорта".
Управление емкостью файловой системы
Используйте удаление на основе хранения для управления емкостью уровня акселератора. Реализуйте настраиваемую политику удаления, которая удаляет устаревшие контрольные точки из Управляемая Azure система Lustre на основе возраста, номера шага или эпохи модели.
Важно
В текущей интеграции Управляемая Azure система Lustre с Хранилище BLOB-объектов Azure удаления, переименования и перемещения, которые вы выполняете на стороне AMLFS, не отражаются в учетной записи Хранилище BLOB-объектов Azure. Запланируйте стратегию хранения и именования соответствующим образом. Это поведение может измениться в будущих выпусках и будет задокументировано как критическое изменение.
Перезапуск из контрольной точки
Храните данные последней контрольной точки и метаданные на Управляемая Azure система Lustre. Эта конфигурация обеспечивает самый быстрый путь перезапуска и сокращает время восстановления для крупных заданий обучения ИИ.
При удалении файлов контрольных точек из Управляемая Azure система Lustre используйте задание импорта (с портала Azure или Azure CLI), чтобы восстановить архивные контрольные точки из Хранилище BLOB-объектов Azure обратно в файловую систему. Дополнительные сведения см. в разделе "Импорт данных с помощью заданий импорта вручную".
Производительность записи контрольных точек
Запись контрольных точек с GPU-узлов в Управляемая Azure система Lustre выполняется на полной выделенной пропускной способности файловой системы. Например, на уровне AMLFS 500 с 128 ТиБ емкости файловая система обеспечивает примерно 64 ГБ/с пропускной способности записи. Таким образом, чекпойнт объёмом ~912 ГиБ (что характерно для шага обучения LLAMA 3 70B) записывается в слой Accelerator примерно за 15 секунд. Это позволяет свести к минимуму время простоя GPU во время обучения и сделать задержку сохранения контрольной точки независимой от более медленной асинхронной архивации в Хранилище BLOB-объектов Azure.
По умолчанию перемещение данных между Управляемая Azure система Lustre и Хранилище BLOB-объектов Azure настроено на доставку примерно 7,5 ГБ/с в соответствии с ограничением входящего трафика по умолчанию для учетной записи Хранилище BLOB-объектов Azure. Если для рабочей нагрузки требуется более высокая устойчивая пропускная способность архива, откройте запрос в службу поддержки для изучения параметров.