Репликация и синхронизация данных мейнфрейма с Azure

Azure Data Factory
Azure Databricks
Microsoft Fabric

Идеи решения

В этой статье описывается идея решения. Это руководство может быть использовано облачным архитектором для визуализации основных компонентов типичной реализации этой архитектуры. Используйте эту статью в качестве отправной точки для разработки хорошо спроектированного решения, которое соответствует конкретным требованиям рабочей нагрузки.

В этой статье объясняется, как реплицировать и синхронизировать данные с Azure во время модернизации мейнфрейма. В нем описываются технические аспекты этой идеи решения, такие как хранилища данных, инструменты и службы. Системы мейнфреймов и систем среднего уровня регулярно обновляют локальные базы данных приложений. Чтобы обеспечить согласованность, это решение синхронизирует последние данные с базами данных Azure.

Архитектура

Схема, показывющая данные реплицирования и синхронизации мейнфреймов для Azure архитектуры.

Схема, показывающая поток данных из источников Db2 через конвейеры Фабрика данных Azure в службы хранения данных, аналитики и бизнес-аналитики в Azure. На схеме есть одна область для локальных компонентов и одна область для Azure компонентов. В локальной среде есть два блока. В одном поле содержатся базы данных, такие как Db2 zOS и Db2 LUW. Стрелка из этих баз данных указывает на второе поле, в котором перечислены средства интеграции. Стрелки указывают от каждого средства интеграции к компоненту в разделе Azure. Локальная среда выполнения интеграции указывает на динамическое поле конвейера, которое содержит один родительский конвейер и три дочерних конвейера. От этих конвейеров к блоку хранилища данных, аналитики и business intelligence (BI) ведёт стрелка. Это поле содержит службы Azure, такие как База данных SQL Azure, Azure Cosmos DB и Хранилище BLOB-объектов Azure. Пунктирные двунаправленные стрелки соединяют динамический путь конвейера с Azure Data Lake Storage 2-го поколения и Azure Databricks. Стрелки направлены от локальных SQL Server Integration Services (SSIS) и средств сторонних производителей к блоку хранения данных, аналитики и бизнес-аналитики. Средство интеграции локального шлюза данных указывает на поток данных в Fabric Data Factory. От этого конвейера стрелка ведёт к хранилищу данных, аналитике и блоку BI.

Скачайте файл Visio для этой архитектуры.

Рабочий процесс

Следующий рабочий процесс соответствует предыдущей схеме:

  1. Динамические конвейеры Фабрика данных Azure оркестрируют действия, включая извлечение и загрузку данных. Вы можете запланировать действия конвейера, запустить их вручную или активировать автоматически.

    Конвейеры группируют действия, выполняющие задачи. Чтобы извлечь данные, Фабрика данных Azure динамически создает один конвейер для каждой локальной таблицы. Затем вы можете использовать массовую параллельную реализацию при репликации данных в Azure. Настройте уровень репликации на основе ваших требований.

    • Полная репликация. Реплицируйте всю базу данных и измените типы данных и поля в целевой базе данных Azure.

    • Частичная, разностная или добавочная репликация. Используйте столбцы-маркеры в исходных таблицах для синхронизации обновлённых строк с базами данных Azure. Эти столбцы содержат либо непрерывно увеличивающийся ключ, либо метку времени, указывающую на последнее обновление таблицы.

    Фабрика данных Azure также использует конвейеры для следующих задач преобразования:

    • Преобразование типов данных

    • Манипулирование данными

    • Форматирование данных

    • Деривация столбца

    • Преобразование данных в плоскую структуру

    • Сортировка данных

    • Фильтрация данных

  2. Локальные базы данных, такие как Db2 zOS, Db2 для i и Db2 LUW, хранят данные приложения.

  3. Локальная среда выполнения интеграции (IR) предоставляет среду, которую фабрика данных Azure использует для выполнения и диспетчеризации действий.

  4. Azure Data Lake Storage 2-го поколения и хранилище BLOB-объектов Azure подготавливают данные. Этот шаг может потребоваться для преобразования и слияния данных из нескольких источников.

  5. Для подготовки данных Фабрика данных Azure использует Azure Databricks, пользовательские действия и потоки данных конвейера для быстрого и эффективного преобразования данных.

  6. Фабрика данных Azure загружает данные в следующие реляционные и нереляционные базы данных Azure:

    • Azure SQL

    • База данных Azure для PostgreSQL

    • Azure Cosmos DB (облачная база данных)

    • Azure Data Lake Storage

    • База данных Azure для MySQL

  7. Службы SQL Server Integration Services (SSIS) извлекают, преобразуют и загружают данные.

  8. Локальный шлюз данных — это локальное клиентское приложение Windows, которое выступает в качестве моста между локальными источниками данных и службами Azure.

  9. Конвейер данных Microsoft Fabric — это логическая группировка действий, которые выполняют прием данных из Db2 в Azure хранилище и базы данных.

  10. Если для решения требуется репликация практически в режиме реального времени, можно использовать средства, отличные от Microsoft.

Если эти средства не могут получить доступ к локальным базам данных Db2, извлеките данные и создайте пользовательский процесс миграции для загрузки извлеченных файлов в целевые базы данных.

Компоненты

В этом разделе описаны другие средства, которые можно использовать во время модернизации данных, синхронизации данных и интеграции данных.

Интеграторы данных

  • Фабрике данных Azure — это гибридная служба интеграции данных. Это полностью управляемое бессерверное решение можно использовать для создания, планирования и оркестрации рабочих процессов извлечения, преобразования и загрузки (ETL), а также рабочих процессов извлечения, загрузки и преобразования (ELT).

  • Fabric — это платформа корпоративной аналитики, которая ускоряет анализ данных в области проектирования данных, хранения данных, интеграции данных, аналитики в режиме реального времени и бизнес-аналитики. Fabric — это программное обеспечение как услуга (SaaS), использующее централизованное хранилище в OneLake. Fabric объединяет следующие технологии и службы:

    • Технологии SQL для хранения корпоративных данных доступны с помощью Fabric Data Warehouse, который является управляемым хранилищем транзакций, использующим открытый разностный формат.

    • Крупномасштабная обработка данных и машинное обучение доступны благодаря Fabric Data Engineering, который включает встроенные средства Apache Spark.

    • Аналитика, близкая к реальному времени, доступна при использовании Fabric Real-Time Intelligence, которая включает eventhouse и потоки событий.

    • Рабочие процессы ETL и ELT доступны с помощью фабрики данных Fabric, которая включает конвейеры, поток данных 2-го поколения и ряд соединителей с поддержкой гибридного и локального шлюза.

    Fabric имеет собственные интеграции с Power BI и службами Azure, такими как Azure Cosmos DB и Машинное обучение Azure.

  • SSIS — это платформа для создания корпоративных решений по интеграции и преобразованию данных. Используйте службы SSIS для управления, репликации, очистки и анализа данных.

  • Azure Databricks — это платформа аналитики данных на основе распределенной системы обработки с открытым кодом Spark. Azure Databricks оптимизирован для облачной платформы Azure. В рабочем процессе аналитики Azure Databricks считывает данные из нескольких источников и использует Spark для предоставления аналитических сведений.

Хранилище данных

  • База данных SQL Azure — это полностью управляемая облачная платформа как услуга (PaaS). База данных SQL предоставляет автоматизированные функции, на основе ИИ, которые оптимизируют производительность и устойчивость. Параметры бессерверных вычислений и гипермасштабируемого хранения автоматически масштабируют ресурсы по требованию.

  • Управляемый экземпляр SQL Azure — это полностью управляемая, интеллектуальная и масштабируемая облачная служба баз данных, которая поддерживает совместимость ядра SQL Server. Используйте Управляемый экземпляр SQL для модернизации существующих приложений в большом масштабе.

  • SQL Server on Azure Virtual Machines повторно размещает рабочие нагрузки, совместимые с кодом, SQL Server в облаке. SQL Server on Azure Virtual Machines объединяет производительность, безопасность и аналитику SQL Server с гибкостью и гибридным подключением Azure. Чтобы перенести существующие приложения или создать новые приложения, используйте SQL Server on Azure Virtual Machines.

  • База данных Azure для PostgreSQL — это полностью управляемая служба реляционных баз данных на основе выпуска сообщества ядра СУБД PostgreSQL с открытым исходным кодом. База данных Azure для PostgreSQL предоставляет масштабируемые функции инноваций приложений.

  • Azure Cosmos DB — это глобально распределенная база данных с несколькими моделями . Используйте Azure Cosmos DB, чтобы обеспечить эластичное и независимое масштабирование пропускной способности и хранилища в нескольких географических регионах.

  • Data Lake Storage — это репозиторий хранилища, содержащий большие объемы собственных и необработанных данных. Хранилища озера данных оптимизированы для масштабирования до терабайтов и петабайт данных. Данные обычно берутся из нескольких разнородных источников и могут быть структурированы, полуструктурированными или неструктурированными. Data Lake Storage 2-го поколения сочетает в себе возможности Data Lake Storage 1-го поколения с хранилищем BLOB-объектов. Data Lake Storage 2-го поколения обеспечивает семантику файловой системы, безопасность на уровне файлов и масштабирование. Оно также предоставляет многоуровневое хранилище, высокий уровень доступности, а также возможности аварийного восстановления хранилища Blob.

  • База данных Azure для MySQL — это полностью управляемая служба реляционной базы данных на основе выпуска сообщества ядра СУБД MySQL с открытым исходным кодом.

Другие инструменты

Alternatives

В этой архитектуре показаны параметры и целевые объекты базы данных Azure для репликации и синхронизации данных мейнфрейма. Вы также можете реплицировать и синхронизировать их со следующими целевыми объектами Azure SQL:

  • Управляемый экземпляр SQL — это полностью управляемая облачная служба базы данных. Управляемый экземпляр SQL совместим с подсистемой SQL Server. Используйте Управляемый экземпляр SQL для модернизации приложений в масштабе.

  • SQL Server on Azure Virtual Machines повторно размещает рабочие нагрузки SQL Server в облаке без изменений кода. SQL Server on Azure Virtual Machines объединяет производительность, безопасность и аналитику SQL Server с гибкостью и гибридным подключением Azure. Чтобы перенести существующие приложения или создать новые приложения, используйте SQL Server on Azure Virtual Machines.

Сведения о сценарии

Доступность и целостность данных важны для мейнфрейма и модернизации среднего уровня. Стратегии первого использования данных помогают сохранить данные нетронутыми и доступными во время миграции на Azure. Чтобы предотвратить нарушения во время модернизации, может потребоваться быстро реплицировать данные или синхронизировать локальные данные с Azure базами данных.

Это решение охватывает следующее:

  • Извлечение. Подключитесь к базе данных-источнику и извлеките данные из нее.

  • Преобразование, в том числе:

    • Промежуточное хранение: Временно хранить данные в исходном формате и подготавливать их к преобразованию.

    • Подготовка. Преобразование и управление данными с помощью правил сопоставления, которые соответствуют требованиям целевой базы данных.

  • Загрузка. Вставка данных в целевую базу данных.

Потенциальные варианты использования

Используйте это решение в следующих сценариях репликации и синхронизации данных:

  • Архитектуры сегрегации ответственности команд, которые используют Azure для обслуживания всех каналов запроса

  • Среды, предназначенные для тестирования локально развернутых приложений и параллельно развернутых повторно размещенных или переработанных приложений

  • Локальные системы, использующие тесно связанные приложения, требующие поэтапной исправления или модернизации

Recommendations

Следующие рекомендации можно применить к большинству сценариев. Следуйте этим рекомендациям, если они не противоречат особым требованиям для вашего случая.

Если вы используете Фабрика данных Azure для извлечения данных, настройте производительность действия копирования. Если вы используете Fabric Data Factory для извлечения данных, настройте параллелизм, размер пакета и настройки соединителя, чтобы оптимизировать производительность конвейера. Дополнительные сведения см. в обзоре конвейера и обзоре соединителя.

Соавторы

Корпорация Майкрософт поддерживает эту статью. Следующие авторы написали эту статью.

Основной автор:

Чтобы увидеть непубличные профили в LinkedIn, войдите в LinkedIn.

Дальнейшие шаги