Копирование данных из Azure Data Lake Storage 1-го поколения в 2-е поколение с помощью Фабрика данных Azure

ПРИМЕНИМО К: Фабрика данных Azure Azure Synapse Analytics

Совет

Data Factory в Microsoft Fabric — это следующее поколение Фабрика данных Azure с более простой архитектурой, встроенным ИИ и новыми функциями. Если вы не знакомы с интеграцией данных, начните с Fabric Data Factory. Существующие рабочие нагрузки ADF могут обновляться до Fabric для доступа к новым возможностям в области обработки и анализа данных, аналитики в режиме реального времени и отчетов.

Azure Data Lake Storage 2-го поколения — это набор возможностей, предназначенных для аналитики больших данных, встроенной в хранилище BLOB-объектов Azure. С его помощью можно работать с данными с использованием парадигмы файловой системы или хранилища объектов.

Если в настоящее время используется Azure Data Lake Storage 1-го поколения, можно оценить Azure Data Lake Storage 2-го поколения путем копирования данных из Data Lake Storage 1-го поколения в 2-го поколения с помощью Фабрика данных Azure.

Фабрика данных Azure — это полностью управляемая облачная служба интеграции данных. Эту службу можно использовать для заполнения озера данными из богатого набора локальных и облачных хранилищ данных и экономии времени при создании аналитических решений. Список поддерживаемых соединителей см. в таблице Поддерживаемые хранилища данных.

Фабрика данных Azure предлагает решение для горизонтального масштабирования, управляемого перемещения данных. Архитектура фабрики данных является масштабируемой, поэтому она может принимать данные с высокой пропускной способностью. Дополнительные сведения см. в разделе производительность операции копирования.

В этой статье показано, как с помощью средства копирования данных фабрики данных скопировать данные из Azure Data Lake Storage 1-го поколения в Azure Data Lake Storage 2-го поколения. Чтобы копировать данные из других типов хранилищ, необходимо выполнить аналогичные шаги.

Требования

  • Подписка Azure. Если у вас нет подписки Azure, создайте учетную запись free перед началом работы.
  • Учетная запись Azure Data Lake Storage 1-го поколения с данными.
  • Учетная запись служба хранилища Azure с включенной функцией Data Lake Storage 2-го поколения. Если у вас нет учетной записи хранения, создайте учетную запись.

Создание фабрики данных

  1. Если вы еще не создали фабрику данных, следуйте шагам в разделе Быстрый старт: создание фабрики данных с помощью портала Azure и Фабрика данных Azure Studio. После создания перейдите к фабрике данных на портале Azure.

    Главная страница для Фабрика данных Azure с плиткой Open Фабрика данных Azure Studio.

  2. Выберите Open на плитке Open Фабрика данных Azure Studio, чтобы запустить приложение интеграции данных на отдельной вкладке.

Загрузка данных в Azure Data Lake Storage 2-го поколения

  1. На домашней странице выберите команду Загрузить, чтобы запустить средство копирования данных.

    Снимок экрана: домашняя страница ADF

  2. На странице Свойства в разделе Тип задачи выберите Встроенная задача копирования. Затем в разделе Периодичность или расписание задач выберите Запустить сейчас один раз, после чего щелкните Далее.

  3. На странице Исходное хранилище данных нажмите кнопку + Создать новое подключение.

  4. Выберите Azure Data Lake Storage 1-го поколения из коллекции соединителей и выберите Continue.

    Скриншот, показывающий страницу выбора подключения Azure Data Lake Storage 1-го поколения.

  5. На странице New connection (Azure Data Lake Storage 1-го поколения) выполните следующие действия:

    1. Выберите Data Lake Storage 1-го поколения для имени учетной записи и укажите или проверьте Tenant.
    2. Выберите Проверить подключение для проверки настроек. Затем выберите Создать.

    Внимание

    В этой инструкции вы используете управляемое удостоверение для ресурсов Azure для аутентификации в Azure Data Lake Storage 1-го поколения. Чтобы предоставить управляемому удостоверению соответствующие разрешения в Azure Data Lake Storage 1-го поколения, следуйте инструкциям .

    Screenshot, показывающий конфигурацию подключения Azure Data Lake Storage 1-го поколения.

  6. На странице Исходное хранилище данных выполните следующие действия:

    1. Выберите только что созданное подключение в разделе Подключение.
    2. В разделе Файл или папка перейдите к папке и файлу, которые необходимо скопировать. Выберите папку или файл и нажмите кнопку ОК.
    3. Задайте поведение копирования, выбрав параметры Рекурсивное копирование и Двоичное копирование. Выберите Далее.

    Снимок экрана: страница

  7. На странице Destination data store выберите + Новое подключение>Azure Data Lake Storage 2-го поколения>Continue.

    Скриншот страницы выбора подключения Azure Data Lake Storage 2-го поколения.

  8. На странице подключения New (Azure Data Lake Storage 2-го поколения) выполните следующие действия:

    1. Выберите учетную запись с поддержкой Data Lake Storage 2-го поколения в раскрывающемся списке название учетной записи хранения.
    2. Выберите Создать, чтобы создать подключение.

    Снимок экрана, показывающий конфигурацию подключения Azure Data Lake Storage 2-го поколения.

  9. На странице Целевое хранилище данных выполните следующие действия:

    1. Выберите только что созданное подключение в блоке Подключение.
    2. В разделе Путь к папке введите copyfromadlsgen1 в качестве имени папки с выходными данными, а затем выберите Далее. Фабрика данных создает соответствующую файловую систему и вложенные папки Azure Data Lake Storage 2-го поколения, если они не существуют, в процессе копирования.

    Снимок экрана: страница

  10. На странице Параметры укажите CopyFromADLSGen1ToGen2 в поле Имя задачи и выберите Далее, чтобы использовать настройки по умолчанию.

  11. Просмотрите параметры на странице Сводка, затем нажмите кнопку Далее.

    Снимок экрана: страница сводки.

  12. На странице Deployment (Развертывание) нажмите кнопку Monitor (Отслеживать), чтобы отслеживать конвейер.

    Снимок экрана: страница развертывания.

  13. Обратите внимание, что слева автоматически выбирается вкладка Мониторинг. В столбце Имя конвейера содержатся ссылки для просмотра сведений о выполнении действий и повторного запуска конвейера.

    Снимок экрана: страница запусков мониторингового конвейера.

  14. Чтобы просмотреть запуски активностей, связанные с запуском конвейера, выберите ссылку в столбце Имя конвейера. В этом конвейере есть только одно действие (задача копирования), поэтому вы увидите только одну запись. Чтобы вернуться к представлению "Запуски конвейера", в меню навигации вверху выберите ссылку Все запуски конвейеров. Щелкните Обновить, чтобы обновить список.

    Снимок экрана: страница выполнения действий мониторинга.

  15. Чтобы отслеживать сведения о выполнении каждого действия копирования, выберите ссылку Сведения (изображение очков) в столбце Имя действия в представлении мониторинга действия. Вы можете отслеживать такие сведения, как объем данных, копируемых из источника в приемник, скорость передачи данных, шаги выполнения с соответствующей продолжительностью и используемые параметры конфигурации.

    Снимок экрана с деталями выполнения действия.

  16. Убедитесь, что данные копируются в учетную запись Azure Data Lake Storage 2-го поколения.

Лучшие практики

Чтобы оценить обновление от Azure Data Lake Storage 1-го поколения до Azure Data Lake Storage 2-го поколения в целом, см. статью Upgrade решения аналитики больших данных от Azure Data Lake Storage 1-го поколения до Azure Data Lake Storage 2-го поколения. В следующих разделах приведены рекомендации по использованию фабрики данных для обновления данных с Data Lake Storage 1-го поколения до Data Lake Storage 2-го поколения.

Перенос исходных моментальных снимков

Производительность

ADF предлагает бессерверную архитектуру, которая обеспечивает параллелизм на разных уровнях, что позволяет разработчикам строить конвейеры для полного использования пропускной способности вашей сети, а также IOPS и пропускной способности хранилища, чтобы максимизировать пропускную способность передачи данных в вашей среде.

Клиенты успешно переносили петабайты данных, состоящие из сотен миллионов файлов из Data Lake Storage 1-го поколения в 2-го поколения, с устойчивой пропускной способностью 2 ГБИТ/с и выше.

Вы можете достичь большей скорости перемещения данных, применяя различные уровни параллелизма:

  • Одно действие копирования может использовать масштабируемые вычислительные ресурсы: при использовании Azure Integration Runtime можно указать до 256 единиц интеграции данных data integration units (DIUs) для каждого действия копирования в бессерверном режиме; при использовании локального Integration Runtime, вы можете вручную увеличить мощность компьютера или расширить до нескольких компьютеров (до 4 узлов), и одно действие копирования будет разбивать свой набор файлов по всем узлам.
  • Одно действие копирования считывает данные из хранилища данных и записывает их в него с помощью нескольких потоков.
  • Поток управления Azure Data Factory может запускать несколько операций копирования параллельно, например, используя цикл For Each.

Секции данных

Если общий размер данных в Data Lake Storage 1-го поколения меньше 10 ТБ и количество файлов меньше 1 миллиона, можно скопировать все данные в одном действии копирования. Если требуется скопировать данные большего объема или обеспечить гибкое управление переносом данных в пакетах и выполнение каждого из них в течение определенного промежутка времени, разбейте данные на разделы. Разбивка данных на разделы, кроме всего прочего, уменьшает риск возникновения любой непредвиденной проблемы.

Способ разбиения файлов заключается в использовании name range- listAfter/listBefore в свойстве действия копирования. Каждое действие копирования можно настроить для копирования одной секции одновременно, чтобы несколько действий копирования могли копировать данные из одной учетной записи Data Lake Storage 1-го поколения одновременно.

Ограничение скорости

Рекомендуется провести тестовый POC по производительности с использованием репрезентативного образца набора данных, чтобы можно было определить подходящий размер раздела.

  1. Начните с одного раздела и одного процесса копирования с интеграционных единиц данных по умолчанию. Для параметра параллельного копирования предлагается всегда выбирать вариант Пусто (по умолчанию). Если пропускная способность копирования вам не подходит, для поиска и устранения узких мест производительности воспользуйтесь инструкциями по настройке производительности.

  2. Постепенно увеличивайте количество единиц интеграции данных, пока не будет достигнуто ограничение пропускной способности и скорости ввода-вывода сети или хранилищ данных либо максимальное количество единиц интеграции данных (256), разрешенное для одного действия копирования.

  3. Если вы максимизировали производительность одного действия копирования, но еще не вышли на максимальную пропускную способность своей среды, можно параллельно выполнять несколько действий копирования.

Если при мониторинге действий копирования возникает много ошибок регулирования, это означает, что достигнуто ограничение по емкости для учетной записи хранения. ADF будет автоматически повторно предпринимать попытки для устранения каждой ошибки регулирования, чтобы исключить потерю данных, но слишком большое число попыток может ухудшить пропускную способность копирования. В таком случае рекомендуется уменьшить количество действий копирования, выполняемых одновременно, чтобы избежать значительных ошибок регулирования. Если данные копируются с помощью одного действия копирования, рекомендуется уменьшить количество DIU.

Миграция дельта-данных

Вы можете использовать несколько подходов для загрузки только новых или обновленных файлов из Data Lake Storage 1-го поколения:

  • Загрузка новых или обновленных файлов по папкам или именам файлов, разбитым по времени. Например, /2019/05/13*.
  • Загрузка новых или обновленных файлов по параметру LastModifiedDate. Если вы копируете большие объемы файлов, сначала разделите данные на секции, чтобы избежать низкой пропускной способности копирования, обусловленной единым действием из-за сканирования всей учетной записи Data Lake Storage 1-го поколения в процессе выявления новых файлов.
  • Выявление новых или обновленных файлов с помощью любого стороннего средства или решения. Затем передайте имя файла или папки конвейеру Фабрики данных с помощью параметра, таблицы или файла.

Правильная частота выполнения добавочной нагрузки зависит от общего количества файлов в Azure Data Lake Storage 1-го поколения и тома новых или обновленных файлов, которые будут загружаться каждый раз.

Безопасность сети

По умолчанию ADF передает данные из Azure Data Lake Storage 1-го поколения в 2-е поколение с использованием зашифрованного подключения по протоколу HTTPS. HTTPS обеспечивает шифрование данных при передаче и предотвращает прослушивание трафика и атаки типа "злоумышленник в середине".

Кроме того, если вы не хотите, чтобы данные передавались через общедоступный Интернет, вы можете повысить уровень безопасности, передавая данные через частную сеть.

Сохранение списков управления доступом (Access Control Lists, ACL)

Если вы хотите реплицировать списки управления доступом вместе с файлами данных при обновлении с Data Lake Storage 1-го поколения до Data Lake Storage 2-го поколения, см. статью Preserve ACL из Data Lake Storage 1-го поколения.

Устойчивость

Фабрика данных Azure имеет встроенный механизм повтора в рамках одного действия копирования, позволяющий справляться с определенным количеством временных сбоев в хранилищах данных или в базовой сети. Если переносится более 10 ТБ данных, рекомендуется секционировать данные, чтобы уменьшить риск непредвиденных проблем.

Вы также можете включить отказоустойчивость в действии копирования, чтобы пропустить предварительно определенные ошибки. Вы также можете включить проверку согласованности данных в действии копирования, чтобы гарантировать, что данные не только успешно копируются из исходного в целевое хранилище, но и согласованы между ними.

Разрешения

В Data Factory соединитель Data Lake Storage 1-го поколения поддерживает учетную запись службы и управляемую идентичность для аутентификации ресурсов Azure. Соединитель Data Lake Storage 2-го поколения поддерживает ключ учетной записи, служебный принципал и управляемое удостоверение для аутентификации в Azure. Чтобы Data Factory могла перемещаться и копировать все файлы или списки управления доступом (ACL), необходимо предоставить учетной записи достаточные разрешения для доступа, чтения или записи всех файлов и задания списков управления доступом, если вы решите это делать. Вы должны предоставить учетной записи роль супер-пользователя или владельца во время миграции и удалить повышенные разрешения после завершения миграции.