Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
В Microsoft Fabric есть полный набор средств для эффективной обработки данных и аналитических рабочих нагрузок. С таким количеством доступных вариантов, включая пакетную, конвейерную и потоковую передачу в режиме реального времени, это может быть сложно выбрать подходящее средство для конкретных потребностей. Это руководство по принятию решений предоставляет стратегию, которая поможет вам выбрать правильную стратегию.
Чтобы выбрать подходящую службу интеграции данных в Microsoft Fabric, рассмотрите следующие вопросы:
Какова ваша основная цель? Вы хотите принимать данные, преобразовывать их, реплицировать, управлять перемещением данных или выполнять потоковую передачу данных в режиме реального времени?
Какой уровень технического навыка? Предпочитаете ли вы решения без кода или с низким кодом, или вы комфортно работаете с кодом?
С какой рабочей нагрузкой данных вы работаете? Это пакет, массовая, добавочная, непрерывная потоковая передача или почти в режиме реального времени?
Какой тип преобразования данных требуется? Вы делаете световые преобразования или сложные?
Список поддерживаемых соединителей в задании копирования, действии копирования и потока данных 2-го поколения см. в обзоре соединителя. Список поддерживаемых источников eventstream см. в списке источников.
Стратегии перемещения данных
| Зеркальное отражение | Копирование задания | Действие копирования (конвейер) | Потоки событий | |
|---|---|---|---|---|
| Вариант использования | Репликация данных | Прием данных и репликация | Прием данных | Прием и обработка потоковых данных |
| Флагманские сценарии | Синхронизация практически в режиме реального времени с настройкой по ключу. Replication | Добавочное копирование и репликация (водяной знак + собственный CDC), Data Lake / Storage Data Migration, Medallion Ingestion, Out-of-the-box multi-table copy. | Data Lake / Storage Data Migration, Medallion Ingestion, Добавочное копирование с помощью выражений конвейера и таблиц управления (только для водяного знака) | Инкрементальная обработка, управляемая событиями, и приложения ИИ в режиме реального времени |
| Источник | 6+ соединителей | 50+ соединителей | 50+ соединителей | 25+ источники |
| Назначение | Зеркальная база данных (сохраненная как таблица Delta только для чтения в Fabric OneLake) | 40+ соединителей | 40+ соединителей | 4+ направления |
| Тип входящих данных | Почти в режиме реального времени | Пакетная или добавочная копия (на основе водяного знака и запись измененных данных) / почти в режиме реального времени | Пакетная или массовая или ручная добавочная копия на основе водяного знака | Потоковая передача данных в режиме реального времени, снятие изменений данных/потоки данных |
| Персона | Бизнес-аналитик, администратор базы данных | Бизнес-аналитик, интегратор данных, инженер данных | Интегратор данных, бизнес-аналитик, инженер данных | Инженер данных и интегратор, аналитик данных |
| Набор навыков | None | ETL, SQL | ETL, SQL | ETL, SQL, KQL |
| Уровень программирования | Нет кода | Нет кода / низкий код | Нет кода / низкий код | Нет кода / низкий код |
| Поддержка преобразования | None | Low | Low | Средний (stream analytics) |
Дополнительные сведения см. в стратегии перемещения данных.
Стратегии оркестрации
| Трубопровод | Задание Apache Airflow | |
|---|---|---|
| Вариант использования | Оркестрация низкого кода | Оркестрация на основе кода |
| Флагманские сценарии | Логическое группирование нескольких действий для выполнения задачи. | Разработка Code-Centric Python |
| Источник | Все совместимые источники Fabric (в зависимости от выбранных действий конвейера) | 100+ соединителей |
| Назначение | Все совместимые источники Fabric (в зависимости от выбранных действий конвейера) | 100+ соединителей |
| Тип входящих данных | Все типы | Все типы |
| Персона | Интегратор данных, бизнес-аналитик, инженер данных | Пользователи Apache Airflow |
| Набор навыков | ETL, SQL, Spark (Scala, Py, SQL, R) | Питон |
| Уровень программирования | Нет кода / низкий код | Code-first |
| Поддержка преобразования | None | None |
Стратегии преобразования
| Ноутбуков | Поток данных 2-го поколения | Потоки событий | |
|---|---|---|---|
| Вариант использования | Подготовка и преобразование данных в коде | Подготовка и преобразование данных без кода | Преобразование без кода / Stream Analytics на основе SQL |
| Флагманские сценарии | Сложные преобразования | Преобразование и профилирование | Потоковая обработка и аналитика |
| Источник | 100+ Библиотеки Spark | 170+ встроенные соединители + настраиваемый пакет SDK | 25+ источники |
| Назначение | 100+ Библиотеки Spark | 7+ соединителей | 4+ направления |
| Тип входящих данных | Все типы | Все типы | Все типы включительно. JSON, AVRO, CSV, XML, TXT и т. д. |
| Персона | Специалист по обработке и анализу данных, разработчик | Инженер данных, интегратор данных, бизнес-аналитик | Инженер данных и аналитик |
| Набор навыков | Spark (Scala, Py, SQL, R) | ETL, M, SQL | SQL, KQL |
| Уровень программирования | Code-first | Нет кода / низкий код | Нет кода / низкий код |
| Поддержка преобразования | High | Высокий (400+ действий) | Средний |
Сценарии
Ознакомьтесь с этими сценариями, чтобы выбрать стратегию интеграции данных, используемую в Microsoft Fabric.
Сценарий 1
Ханна является администратором базы данных для компании финансовых услуг. Она управляет несколькими критически важными базами данных SQL Server, которые управляют торговыми приложениями организации. Бизнесу требуется практически доступ к данным транзакций в режиме реального времени для анализа нормативных данных и анализа рисков. Однако Ханна должна избежать влияния на производительность производственных систем.
Задача Ханны заключается в предоставлении команд аналитики с данными up-to-date, не создавая дополнительную нагрузку на операционные базы данных. Она не хочет создавать сложные конвейеры ETL или управлять процессами перемещения данных. Объемы данных являются существенными, и бизнесу требуются данные, доступные для анализа в течение нескольких минут транзакций, происходящих в исходных системах.
Ханна проверяет параметры и выбирает зеркальное отображение в качестве идеального решения. С помощью зеркального отображения она может настроить репликацию данных практически в режиме реального времени из ее баз данных SQL Server в Microsoft Fabric с минимальной конфигурацией. Зеркальные данные становятся доступными в OneLake в виде таблиц Delta, что позволяет анализировать внизу, не влияя на производительность исходной системы. Зеркальное отображение обеспечивает необходимую ей настройку, автоматически управляя сложностью репликации данных, обеспечивая непрерывность бизнес-процессов.
Сценарий 2
Чарли является аналитиком данных в розничной компании. Он отвечает за консолидацию данных о продажах из нескольких региональных баз данных в центральное хранилище данных. Компания работает в разных часовых поясах, а база данных каждого региона использует запись измененных данных (CDC) для отслеживания операций инвентаризации и продаж. Чарли нуждается в решении, которое может обрабатывать начальную полную нагрузку исторических данных, а затем переключаться на добавочные обновления на основе CDC.
Чарли хочет, чтобы подход, управляемый мастером, который позволяет выбрать несколько таблиц из различных региональных экземпляров SQL Server, выполнить начальную массовую миграцию, а затем автоматически поддерживать данные up-to-date через добавочные нагрузки на основе CDC. Решение должно обрабатывать как вставки, так и обновления, а также объединять изменения в место назначения без вмешательства вручную.
Чарли оценивает варианты и выбирает Копировать задание в качестве его предпочтительного подхода. Задание копирования предоставляет необходимую ему возможность выбора нескольких таблиц, поддерживает и добавочное копирование на основе водяного знака, и предлагает интуитивно понятный интерфейс мастера. Встроенные функции позволяют настроить весь процесс репликации данных без написания кода, а автоматическое обнаружение таблиц с поддержкой CDC упрощает процесс установки.
Сценарий 3
Рукмина является инженером по обработке данных в производственной компании. Она должна перенести большие объемы исторических производственных данных из локальной базы данных Oracle в новое хранилище Fabric. Миграция включает копирование сотен таблиц с миллионами записей, и она должна реализовать архитектуру медальона с бронзовыми, серебряными и золотыми слоями. Rukmina имеет опыт работы с SQL, но предпочитает решения с низким кодом, когда это возможно.
Для проекта требуется скопировать необработанные данные на бронзовый слой, а затем применить упрощенные преобразования, такие как преобразования типов данных и сопоставление столбцов, как данные перемещаются через уровни медальона. Rukmina необходимо убедиться, что решение может эффективно обрабатывать большие объемы данных и может выполняться постепенно для текущих операций. Заинтересованным лицам требуется решение, которое может масштабироваться от гигабайтов до петабайт данных по мере роста бизнеса.
Rukmina проверяет доступные параметры и выбирает действие копирования в конвейерах. Этот подход дает ей интерфейс перетаскивания, который она предпочитает, обеспечивая масштабируемость, необходимую для больших объемов данных. Действие копирования поддерживает 50+ соединителей, которые она нуждается в различных исходных системах, и платформа конвейера позволяет ей оркестрировать перемещение между уровнями медальона. С помощью действия копирования она может реализовать как исторические, так и добавочные шаблоны обновления данных, сохраняя производительность, необходимую для операций масштабирования петабайтов.
Сценарий 4
Джулиан является бизнес-аналитиком с сильными навыками SQL. Он должен управлять сложным рабочим процессом обработки данных, который включает несколько шагов: извлечение данных из различных систем, выполнение проверок качества данных, преобразование, загрузка данных в несколько назначений и отправка уведомлений заинтересованным лицам. Рабочий процесс должен выполняться по расписанию и обрабатывать зависимости между различными действиями.
Организация Джулиана использует сочетание служб Azure и локальных систем, а рабочий процесс требует как перемещения данных, так и логики оркестрации. Он должен координировать действия, такие как выполнение хранимых процедур, вызов веб-API, перемещение файлов и выполнение других конвейеров. Хотя Джулиан комфортно с SQL и базовым сценарием, он предпочитает визуальный подход с низким кодом для создания и поддержания этих сложных рабочих процессов.
Джулиан оценивает параметры и выбирает Конвейеры в качестве оптимального соответствия его требованиям. Конвейеры предоставляют визуальный холст и действия перетаскивания, необходимые для создания сложных рабочих процессов оркестрации. Решение поддерживает логическую группирование действий, управление зависимостями и возможности планирования. С 50+ соединителями и различными типами действий (копирование, поиск, хранимая процедура, веб-сайт и т. д.), конвейеры обеспечивают ему гибкость для координации различных задач при сохранении подхода с низким кодом, который он предпочитает.
Сценарий 5
Даршан является специалистом по обработке и анализу данных с обширным опытом Python. Он должен создавать и поддерживать сложные рабочие процессы обработки данных, которые интегрируют модели машинного обучения, пользовательские алгоритмы и различные внешние API. Команда по обработке и анализу данных в своей организации предпочитает подходы к коду и хочет использовать существующий опыт Python, включая пользовательские библиотеки и расширенные шаблоны оркестрации.
Darshan требует решения, которое поддерживает ациклические графы на основе Python (DAG), может обрабатывать сложные зависимости между задачами и интегрировать с существующими процессами DevOps команды. Рабочие процессы включают прием данных из нескольких источников, инженерии функций, обучения моделей, пакетной оценки и пользовательской бизнес-логики, требующей гибкости полного программирования Python. Команда оценивает экосистему Apache Airflow и хочет поддерживать совместимость с существующими рабочими процессами.
Даршан проверяет параметры и выбирает Apache Airflow Jobs в качестве идеального решения. Этот подход к коду позволяет своей команде использовать свой опыт Python при создании сложных рабочих процессов обработки данных. Apache Airflow Jobs предоставляет оркестрацию на основе DAG, с которыми они знакомы, поддерживают 100+ соединителей через экосистему Airflow и позволяют реализовать пользовательскую бизнес-логику с помощью Python. Подход к управляемой службе устраняет проблемы инфраструктуры, сохраняя гибкость и мощность Apache Airflow.
Сценарий 6
Рене является специалистом по обработке и анализу данных в исследовательском университете. Она должна выполнять сложные задачи анализа и преобразования данных в больших наборах данных, хранящихся в нескольких форматах и источниках. Ее работа включает статистический анализ, разработку моделей машинного обучения и пользовательские алгоритмы обработки данных, требующие полной мощности распределенных вычислений.
Рене работает со структурированными и неструктурированными данными, включая CSV-файлы, документы JSON, файлы Parquet и потоки в режиме реального времени. Для ее анализа требуются сложные преобразования, такие как соединения между несколькими большими наборами данных, агрегатами, статистическими вычислениями и пользовательскими алгоритмами, реализованными в Python и Scala. Она нуждается в гибкости для интерактивной работы во время этапов исследования и последующей эксплуатации кода для рабочих нагрузок.
Рене оценивает свои параметры и выбирает записные книжки в качестве основного инструмента. Записные книжки предоставляют среду, в которой она нуждается в коде, с полным доступом к распределенным вычислительным возможностям Spark. Она может работать с сотнями библиотек Spark, реализовывать сложные преобразования с помощью нескольких языков (Python, Scala, SQL, R) и использовать интерактивную среду разработки для изучения данных. Интерфейс записной книжки позволяет ей объединять код, визуализации и документацию, предоставляя высокопроизводительные вычислительные ресурсы, необходимые для ее крупномасштабных требований к обработке данных.
Сценарий 7
Ако является бизнес-аналитиком в организации здравоохранения. Она должна интегрировать данные из нескольких источников, включая базы данных, веб-службы и файловые системы для создания чистых, готовых к бизнесу наборов данных. Ako имеет широкий опыт работы с Power Query в Excel и Power BI, и она предпочитает визуальные интерфейсы без кода для задач подготовки данных.
Обязанности Ако включают очистку данных здравоохранения, применение бизнес-правил, проверку качества данных и создание стандартных наборов данных, которые действуют в нормативных системах отчетности. К источникам данных относятся системы управления пациентами, информационные системы лаборатории и внешние службы API. Она должна выполнять сложные преобразования, такие как профилирование данных, дублирование, стандартизация медицинских кодов и создание вычисляемых полей на основе бизнес-логики.
Ako проверяет доступные варианты и выбирает поток данных 2-го поколения в качестве предпочтительного решения. Поток данных 2-го поколения предоставляет знакомый интерфейс Power Query, который она знает из других средств Майкрософт, обеспечивая повышенную производительность и возможности. Благодаря встроенным соединителям 170+ она может подключаться ко всем своим разнообразным источникам данных, применять функции преобразования 300+ через визуальный интерфейс и использовать средства профилирования данных для обеспечения качества данных. Подход без кода позволяет ей сосредоточиться на бизнес-логике, а не на технических деталях реализации.
Сценарий 8
Эш является менеджером по продуктам в телекоммуникационной компании. Ее команда должна отслеживать метрики поддержки клиентов, такие как тома вызовов, время ожидания и производительность агента в режиме реального времени, чтобы обеспечить соблюдение соглашений об уровне обслуживания (SLA). Данные приходят из нескольких операционных систем, включая CRM, журналы центра обработки вызовов и базы данных назначения агента.
Ash хочет создать панели мониторинга в режиме реального времени и активировать автоматизированные рабочие процессы при нарушении пороговых значений (например, когда время ожидания превышает ограничения SLA). Она также хочет избежать строительства сложных конвейеров ETL или управления инфраструктурой.
Эш оценивает параметры и выбирает потоки событий Fabric. С помощью Eventstreams она может получать данные из нескольких источников с помощью потоковых коннекторов, применять легковесные преобразования и перенаправлять события в пункты назначения, такие как Eventhouse и Активатор данных. Она настраивает оповещения и панели мониторинга, которые обновляются в секундах, что позволяет своей команде быстро реагировать на операционные проблемы.
Потоки событий Fabric и интеллектуальная обработка данных в реальном времени обеспечивают низкую задержку и низкокодовую возможность, необходимую Ash для создания приложений, основанных на событиях, без нарушения существующих систем.
Начало работы
Теперь, когда вы понимаете, какую службу следует использовать, можно приступить к созданию решений для интеграции данных в Microsoft Fabric.