Руководство по принятию решений Microsoft Fabric. Выбор стратегии интеграции данных

В Microsoft Fabric есть полный набор средств для эффективной обработки данных и аналитических рабочих нагрузок. С таким количеством доступных вариантов, включая пакетную, конвейерную и потоковую передачу в режиме реального времени, это может быть сложно выбрать подходящее средство для конкретных потребностей. Это руководство по принятию решений предоставляет стратегию, которая поможет вам выбрать правильную стратегию.

Снимок экрана: схема рабочего процесса интеграции данных с столбцами для перемещения данных, оркестрации и преобразования.

Чтобы выбрать подходящую службу интеграции данных в Microsoft Fabric, рассмотрите следующие вопросы:

  • Какова ваша основная цель? Вы хотите принимать данные, преобразовывать их, реплицировать, управлять перемещением данных или выполнять потоковую передачу данных в режиме реального времени?

  • Какой уровень технического навыка? Предпочитаете ли вы решения без кода или с низким кодом, или вы комфортно работаете с кодом?

  • С какой рабочей нагрузкой данных вы работаете? Это пакет, массовая, добавочная, непрерывная потоковая передача или почти в режиме реального времени?

  • Какой тип преобразования данных требуется? Вы делаете световые преобразования или сложные?

Список поддерживаемых соединителей в задании копирования, действии копирования и потока данных 2-го поколения см. в обзоре соединителя. Список поддерживаемых источников eventstream см. в списке источников.

Стратегии перемещения данных

Зеркальное отражение Копирование задания Действие копирования (конвейер) Потоки событий
Вариант использования Репликация данных Прием данных и репликация Прием данных Прием и обработка потоковых данных
Флагманские сценарии Синхронизация практически в режиме реального времени с настройкой по ключу. Replication Добавочное копирование и репликация (водяной знак + собственный CDC), Data Lake / Storage Data Migration, Medallion Ingestion, Out-of-the-box multi-table copy. Data Lake / Storage Data Migration, Medallion Ingestion, Добавочное копирование с помощью выражений конвейера и таблиц управления (только для водяного знака) Инкрементальная обработка, управляемая событиями, и приложения ИИ в режиме реального времени
Источник 6+ соединителей 50+ соединителей 50+ соединителей 25+ источники
Назначение Зеркальная база данных (сохраненная как таблица Delta только для чтения в Fabric OneLake) 40+ соединителей 40+ соединителей 4+ направления
Тип входящих данных Почти в режиме реального времени Пакетная или добавочная копия (на основе водяного знака и запись измененных данных) / почти в режиме реального времени Пакетная или массовая или ручная добавочная копия на основе водяного знака Потоковая передача данных в режиме реального времени, снятие изменений данных/потоки данных
Персона Бизнес-аналитик, администратор базы данных Бизнес-аналитик, интегратор данных, инженер данных Интегратор данных, бизнес-аналитик, инженер данных Инженер данных и интегратор, аналитик данных
Набор навыков None ETL, SQL ETL, SQL ETL, SQL, KQL
Уровень программирования Нет кода Нет кода / низкий код Нет кода / низкий код Нет кода / низкий код
Поддержка преобразования None Low Low Средний (stream analytics)

Дополнительные сведения см. в стратегии перемещения данных.

Стратегии оркестрации

Трубопровод Задание Apache Airflow
Вариант использования Оркестрация низкого кода Оркестрация на основе кода
Флагманские сценарии Логическое группирование нескольких действий для выполнения задачи. Разработка Code-Centric Python
Источник Все совместимые источники Fabric (в зависимости от выбранных действий конвейера) 100+ соединителей
Назначение Все совместимые источники Fabric (в зависимости от выбранных действий конвейера) 100+ соединителей
Тип входящих данных Все типы Все типы
Персона Интегратор данных, бизнес-аналитик, инженер данных Пользователи Apache Airflow
Набор навыков ETL, SQL, Spark (Scala, Py, SQL, R) Питон
Уровень программирования Нет кода / низкий код Code-first
Поддержка преобразования None None

Стратегии преобразования

Ноутбуков Поток данных 2-го поколения Потоки событий
Вариант использования Подготовка и преобразование данных в коде Подготовка и преобразование данных без кода Преобразование без кода / Stream Analytics на основе SQL
Флагманские сценарии Сложные преобразования Преобразование и профилирование Потоковая обработка и аналитика
Источник 100+ Библиотеки Spark 170+ встроенные соединители + настраиваемый пакет SDK 25+ источники
Назначение 100+ Библиотеки Spark 7+ соединителей 4+ направления
Тип входящих данных Все типы Все типы Все типы включительно. JSON, AVRO, CSV, XML, TXT и т. д.
Персона Специалист по обработке и анализу данных, разработчик Инженер данных, интегратор данных, бизнес-аналитик Инженер данных и аналитик
Набор навыков Spark (Scala, Py, SQL, R) ETL, M, SQL SQL, KQL
Уровень программирования Code-first Нет кода / низкий код Нет кода / низкий код
Поддержка преобразования High Высокий (400+ действий) Средний

Сценарии

Ознакомьтесь с этими сценариями, чтобы выбрать стратегию интеграции данных, используемую в Microsoft Fabric.

Сценарий 1

Ханна является администратором базы данных для компании финансовых услуг. Она управляет несколькими критически важными базами данных SQL Server, которые управляют торговыми приложениями организации. Бизнесу требуется практически доступ к данным транзакций в режиме реального времени для анализа нормативных данных и анализа рисков. Однако Ханна должна избежать влияния на производительность производственных систем.

Задача Ханны заключается в предоставлении команд аналитики с данными up-to-date, не создавая дополнительную нагрузку на операционные базы данных. Она не хочет создавать сложные конвейеры ETL или управлять процессами перемещения данных. Объемы данных являются существенными, и бизнесу требуются данные, доступные для анализа в течение нескольких минут транзакций, происходящих в исходных системах.

Ханна проверяет параметры и выбирает зеркальное отображение в качестве идеального решения. С помощью зеркального отображения она может настроить репликацию данных практически в режиме реального времени из ее баз данных SQL Server в Microsoft Fabric с минимальной конфигурацией. Зеркальные данные становятся доступными в OneLake в виде таблиц Delta, что позволяет анализировать внизу, не влияя на производительность исходной системы. Зеркальное отображение обеспечивает необходимую ей настройку, автоматически управляя сложностью репликации данных, обеспечивая непрерывность бизнес-процессов.

Сценарий 2

Чарли является аналитиком данных в розничной компании. Он отвечает за консолидацию данных о продажах из нескольких региональных баз данных в центральное хранилище данных. Компания работает в разных часовых поясах, а база данных каждого региона использует запись измененных данных (CDC) для отслеживания операций инвентаризации и продаж. Чарли нуждается в решении, которое может обрабатывать начальную полную нагрузку исторических данных, а затем переключаться на добавочные обновления на основе CDC.

Чарли хочет, чтобы подход, управляемый мастером, который позволяет выбрать несколько таблиц из различных региональных экземпляров SQL Server, выполнить начальную массовую миграцию, а затем автоматически поддерживать данные up-to-date через добавочные нагрузки на основе CDC. Решение должно обрабатывать как вставки, так и обновления, а также объединять изменения в место назначения без вмешательства вручную.

Чарли оценивает варианты и выбирает Копировать задание в качестве его предпочтительного подхода. Задание копирования предоставляет необходимую ему возможность выбора нескольких таблиц, поддерживает и добавочное копирование на основе водяного знака, и предлагает интуитивно понятный интерфейс мастера. Встроенные функции позволяют настроить весь процесс репликации данных без написания кода, а автоматическое обнаружение таблиц с поддержкой CDC упрощает процесс установки.

Сценарий 3

Рукмина является инженером по обработке данных в производственной компании. Она должна перенести большие объемы исторических производственных данных из локальной базы данных Oracle в новое хранилище Fabric. Миграция включает копирование сотен таблиц с миллионами записей, и она должна реализовать архитектуру медальона с бронзовыми, серебряными и золотыми слоями. Rukmina имеет опыт работы с SQL, но предпочитает решения с низким кодом, когда это возможно.

Для проекта требуется скопировать необработанные данные на бронзовый слой, а затем применить упрощенные преобразования, такие как преобразования типов данных и сопоставление столбцов, как данные перемещаются через уровни медальона. Rukmina необходимо убедиться, что решение может эффективно обрабатывать большие объемы данных и может выполняться постепенно для текущих операций. Заинтересованным лицам требуется решение, которое может масштабироваться от гигабайтов до петабайт данных по мере роста бизнеса.

Rukmina проверяет доступные параметры и выбирает действие копирования в конвейерах. Этот подход дает ей интерфейс перетаскивания, который она предпочитает, обеспечивая масштабируемость, необходимую для больших объемов данных. Действие копирования поддерживает 50+ соединителей, которые она нуждается в различных исходных системах, и платформа конвейера позволяет ей оркестрировать перемещение между уровнями медальона. С помощью действия копирования она может реализовать как исторические, так и добавочные шаблоны обновления данных, сохраняя производительность, необходимую для операций масштабирования петабайтов.

Сценарий 4

Джулиан является бизнес-аналитиком с сильными навыками SQL. Он должен управлять сложным рабочим процессом обработки данных, который включает несколько шагов: извлечение данных из различных систем, выполнение проверок качества данных, преобразование, загрузка данных в несколько назначений и отправка уведомлений заинтересованным лицам. Рабочий процесс должен выполняться по расписанию и обрабатывать зависимости между различными действиями.

Организация Джулиана использует сочетание служб Azure и локальных систем, а рабочий процесс требует как перемещения данных, так и логики оркестрации. Он должен координировать действия, такие как выполнение хранимых процедур, вызов веб-API, перемещение файлов и выполнение других конвейеров. Хотя Джулиан комфортно с SQL и базовым сценарием, он предпочитает визуальный подход с низким кодом для создания и поддержания этих сложных рабочих процессов.

Джулиан оценивает параметры и выбирает Конвейеры в качестве оптимального соответствия его требованиям. Конвейеры предоставляют визуальный холст и действия перетаскивания, необходимые для создания сложных рабочих процессов оркестрации. Решение поддерживает логическую группирование действий, управление зависимостями и возможности планирования. С 50+ соединителями и различными типами действий (копирование, поиск, хранимая процедура, веб-сайт и т. д.), конвейеры обеспечивают ему гибкость для координации различных задач при сохранении подхода с низким кодом, который он предпочитает.

Сценарий 5

Даршан является специалистом по обработке и анализу данных с обширным опытом Python. Он должен создавать и поддерживать сложные рабочие процессы обработки данных, которые интегрируют модели машинного обучения, пользовательские алгоритмы и различные внешние API. Команда по обработке и анализу данных в своей организации предпочитает подходы к коду и хочет использовать существующий опыт Python, включая пользовательские библиотеки и расширенные шаблоны оркестрации.

Darshan требует решения, которое поддерживает ациклические графы на основе Python (DAG), может обрабатывать сложные зависимости между задачами и интегрировать с существующими процессами DevOps команды. Рабочие процессы включают прием данных из нескольких источников, инженерии функций, обучения моделей, пакетной оценки и пользовательской бизнес-логики, требующей гибкости полного программирования Python. Команда оценивает экосистему Apache Airflow и хочет поддерживать совместимость с существующими рабочими процессами.

Даршан проверяет параметры и выбирает Apache Airflow Jobs в качестве идеального решения. Этот подход к коду позволяет своей команде использовать свой опыт Python при создании сложных рабочих процессов обработки данных. Apache Airflow Jobs предоставляет оркестрацию на основе DAG, с которыми они знакомы, поддерживают 100+ соединителей через экосистему Airflow и позволяют реализовать пользовательскую бизнес-логику с помощью Python. Подход к управляемой службе устраняет проблемы инфраструктуры, сохраняя гибкость и мощность Apache Airflow.

Сценарий 6

Рене является специалистом по обработке и анализу данных в исследовательском университете. Она должна выполнять сложные задачи анализа и преобразования данных в больших наборах данных, хранящихся в нескольких форматах и источниках. Ее работа включает статистический анализ, разработку моделей машинного обучения и пользовательские алгоритмы обработки данных, требующие полной мощности распределенных вычислений.

Рене работает со структурированными и неструктурированными данными, включая CSV-файлы, документы JSON, файлы Parquet и потоки в режиме реального времени. Для ее анализа требуются сложные преобразования, такие как соединения между несколькими большими наборами данных, агрегатами, статистическими вычислениями и пользовательскими алгоритмами, реализованными в Python и Scala. Она нуждается в гибкости для интерактивной работы во время этапов исследования и последующей эксплуатации кода для рабочих нагрузок.

Рене оценивает свои параметры и выбирает записные книжки в качестве основного инструмента. Записные книжки предоставляют среду, в которой она нуждается в коде, с полным доступом к распределенным вычислительным возможностям Spark. Она может работать с сотнями библиотек Spark, реализовывать сложные преобразования с помощью нескольких языков (Python, Scala, SQL, R) и использовать интерактивную среду разработки для изучения данных. Интерфейс записной книжки позволяет ей объединять код, визуализации и документацию, предоставляя высокопроизводительные вычислительные ресурсы, необходимые для ее крупномасштабных требований к обработке данных.

Сценарий 7

Ако является бизнес-аналитиком в организации здравоохранения. Она должна интегрировать данные из нескольких источников, включая базы данных, веб-службы и файловые системы для создания чистых, готовых к бизнесу наборов данных. Ako имеет широкий опыт работы с Power Query в Excel и Power BI, и она предпочитает визуальные интерфейсы без кода для задач подготовки данных.

Обязанности Ако включают очистку данных здравоохранения, применение бизнес-правил, проверку качества данных и создание стандартных наборов данных, которые действуют в нормативных системах отчетности. К источникам данных относятся системы управления пациентами, информационные системы лаборатории и внешние службы API. Она должна выполнять сложные преобразования, такие как профилирование данных, дублирование, стандартизация медицинских кодов и создание вычисляемых полей на основе бизнес-логики.

Ako проверяет доступные варианты и выбирает поток данных 2-го поколения в качестве предпочтительного решения. Поток данных 2-го поколения предоставляет знакомый интерфейс Power Query, который она знает из других средств Майкрософт, обеспечивая повышенную производительность и возможности. Благодаря встроенным соединителям 170+ она может подключаться ко всем своим разнообразным источникам данных, применять функции преобразования 300+ через визуальный интерфейс и использовать средства профилирования данных для обеспечения качества данных. Подход без кода позволяет ей сосредоточиться на бизнес-логике, а не на технических деталях реализации.

Сценарий 8

Эш является менеджером по продуктам в телекоммуникационной компании. Ее команда должна отслеживать метрики поддержки клиентов, такие как тома вызовов, время ожидания и производительность агента в режиме реального времени, чтобы обеспечить соблюдение соглашений об уровне обслуживания (SLA). Данные приходят из нескольких операционных систем, включая CRM, журналы центра обработки вызовов и базы данных назначения агента.

Ash хочет создать панели мониторинга в режиме реального времени и активировать автоматизированные рабочие процессы при нарушении пороговых значений (например, когда время ожидания превышает ограничения SLA). Она также хочет избежать строительства сложных конвейеров ETL или управления инфраструктурой.

Эш оценивает параметры и выбирает потоки событий Fabric. С помощью Eventstreams она может получать данные из нескольких источников с помощью потоковых коннекторов, применять легковесные преобразования и перенаправлять события в пункты назначения, такие как Eventhouse и Активатор данных. Она настраивает оповещения и панели мониторинга, которые обновляются в секундах, что позволяет своей команде быстро реагировать на операционные проблемы.

Потоки событий Fabric и интеллектуальная обработка данных в реальном времени обеспечивают низкую задержку и низкокодовую возможность, необходимую Ash для создания приложений, основанных на событиях, без нарушения существующих систем.

Начало работы

Теперь, когда вы понимаете, какую службу следует использовать, можно приступить к созданию решений для интеграции данных в Microsoft Fabric.