Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Фабрика данных в Microsoft Fabric помогает решить одну из самых сложных задач бизнеса: превратить разбросанные данные в полезные аналитические сведения.
Данные вашей организации находятся в различных местах: базы данных, файлы, облачные службы и устаревшие системы. Такое разнообразие затрудняет получение полной картины вашего бизнеса. Фабрика данных подключается к более чем 170 источникам данных, включая многооблачные среды и гибридные настройки с локальными шлюзами. Это помогает перемещать и преобразовывать данные в масштабируемом масштабе, превращая их в форматы, которые хорошо работают для аналитики и принятия решений.
Схема фабрики данных в Microsoft Fabric, которая показывает выбор соединителей, связанных с средствами аналитики и разработки данных в Fabric с помощью перемещения данных, оркестрации и преобразования. Все это основано на Fabric OneLake, и весь стек пронизан технологиями на базе искусственного интеллекта.
Будь вы бизнес-пользователем, создающим свою первую стратегию аналитики данных, или разработчиком, создающим сложные рабочие потоки, вы найдёте подходящие инструменты, чтобы:
- Объединение данных
- Очистите это
- Подготовьте данные для анализа в вашем Lakehouse или хранилище данных.
- Автоматизация рабочих процессов данных
Что такое интеграция данных?
Интеграция данных — это процесс объединения стратегических данных, чтобы получить доступ к ним и проанализировать их. Это ключевая часть любого бизнеса, который хочет принимать решения на основе данных.
Существует множество способов интеграции данных, но одна из наиболее распространенных стратегий — ETL. ETL обозначает извлечение, преобразование, загрузку. Он принимает информацию из многих различных источников, преобразует его в формат, который можно проанализировать, и загружает его в общую систему назначения для анализа или создания отчетов. При реализации процесса ETL на платформе данных вашего бизнеса он улучшает согласованность данных, качество и доступность.
Вот что делает каждый этап:
- Извлечение: считывает данные из источников и перемещает их в центральное место хранения. Источники могут быть базами данных, файлами, API, веб-сайтами и многое другое.
- Преобразование: очистка, обогащение и преобразование данных в формат, который легко анализировать. Например, может потребоваться сравнить данные о продажах из базы данных SQL с сканированными историческими документами о продажах. После извлечения данных необходимо преобразовать данные из каждого источника, чтобы он был в одном формате, проверять повреждения или дубликаты и объединять данные в один набор данных.
- Загрузка: записывает преобразованные данные в целевую систему, например хранилище данных или озеро данных. Целевая система — это место, где можно выполнять запросы и отчеты о данных.
ETL или ELT?
Когда вы работаете с данными, важно то, как вы перемещаете и трансформируете, и у каждой организации свои потребности. Например, рассмотрим ETL (Extract, Transform, Load) и ELT (Extract, Load, Transform). У каждого метода есть свои сильные стороны, в зависимости от ваших потребностей в производительности, масштабируемости и стоимости.
ETL: перед загрузкой данных в место назначения преобразуйте данные. Этот метод хорошо работает, когда нужно очищать, стандартизировать или обогащать данные по мере их перемещения. Например, используйте Dataflow Gen2 в Data Factory, чтобы выполнять преобразования в большом масштабе перед загрузкой данных в хранилище данных или Lakehouse.
ELT: сначала загружайте необработанные данные, а затем преобразуйте их там, где они хранятся. Этот подход использует возможности аналитических движков, таких как OneLake от Fabric, ноутбуки Spark или средства на основе SQL. ELT хорошо подходит для обработки больших наборов данных с помощью современных облачных вычислений.
Фабрика данных Fabric поддерживает оба. Вы можете:
- Создание классических конвейеров ETL для немедленного обеспечения качества и готовности данных
- Использование рабочих процессов ELT для использования интегрированных вычислений и хранилища для крупномасштабных преобразований
- Объединение обоих подходов в одном решении для гибкости
Фабрика данных — это мощное решение для интеграции данных
Фабрика данных подключается к данным, перемещает его, преобразует его и управляет задачами перемещения и преобразования данных из одного места. Вы решаете, какую стратегию лучше всего подходит для вашего бизнеса, и фабрика данных предоставляет средства для его выполнения.
Подключитесь к данным: локально, в облаке или в мультиоблачных средах Data Factory подключается к вашим источникам данных и пунктам назначения. Он поддерживает широкий спектр источников данных, включая базы данных, озера данных, файловые системы, API и многое другое. Полный список поддерживаемых источников данных и назначений см. в доступных соединителях .
Перемещение данных. Фабрика данных предоставляет несколько методов перемещения данных из источника в место назначения или простого доступа к существующим данным в зависимости от ваших потребностей.
- Задание копирования — предпочтительное решение для упрощенного перемещения данных с собственной поддержкой нескольких стилей доставки, включая массовую копию, добавочную копию и репликацию записи измененных данных (CDC). Он также предлагает гибкость для работы с широким спектром сценариев — от множества источников до разных направлений — всё это благодаря интуитивно понятному и удобному в использовании опыту.
- Копирование - Перемещает данные из одного места в другое в любом масштабе, с возможностью обширной настройки и поддержкой широкого спектра источников и приемников, а также возможностью ручного управления параллельным копированием для повышения производительности.
- Зеркальное отображение - Создание почти в реальном времени реплики вашей операционной базы данных в OneLake в Microsoft Fabric для упрощения аналитики и создания отчетов.
Ознакомьтесь с руководством по решению о перемещении данных , чтобы помочь вам выбрать правильный метод перемещения данных для вашего сценария.
Преобразование. Фабрика данных предоставляет действия для подключения к пользовательским сценариям преобразования или мощному конструктору потоков данных.
- Действия конвейера — записная книжка Fabric, действие HDInsight, определение задания Spark, хранимая процедура, скрипты SQL и многое другое. Эти действия позволяют запускать пользовательский код или скрипты для преобразования данных.
- Dataflow Gen2 — преобразуйте данные с помощью low-code интерфейса с более чем 300 функциями преобразования. Вы можете выполнять соединения, агрегацию, очистку данных, кастомные преобразования и многое другое.
- задание dbt — задание dbt в Microsoft Fabric включает преобразования данных на основе SQL непосредственно в Fabric. Они предоставляют простую настройку без кода для создания, тестирования и развертывания моделей dbt на вершине хранилища данных Fabric.
Оркестрация. Фабрика данных позволяет создавать конвейеры, которые могут выполнять несколько движений данных, преобразований и других действий в одном рабочем процессе.
- Запуск конвейеров в определенное время или их запуск на основе событий.
- Конвейеры могут включать логику потока управления, например циклы и условные условия, для обработки сложных рабочих процессов и оркестрации всей обработки данных с помощью простого пользовательского интерфейса конструктора конвейеров с низким кодом.
- Если вы предпочитаете выражать процессы оркестрации в коде, Fabric Data Factory интегрируется с Apache Airflow для создания DAGs с использованием Python.
Интеграция данных на базе ИИ
ИИ появляется в Data Factory, чтобы помочь вам сделать больше с меньшими усилиями. Copilot for Data Factory позволяет проектировать, редактировать и управлять конвейерами и потоками данных с использованием естественного языка. Вы можете ввести запросы на обычный английский язык, и Copilot превращает их в рабочие шаги ETL.
Copilot также суммирует существующие запросы потока данных и конвейеры, чтобы быстро понять, что они делают. Если вы столкнуться с ошибками, Copilot объясняет, что пошло не так, и предлагает способы ее устранения.
Для получения подробной информации см. Copilot в Fabric в рабочей среде службы данных.
Что нужно, чтобы начать работу?
- Учетная запись клиента Microsoft Fabric с активной подпиской. Если у вас нет учетной записи, вы можете создать бесплатную учетную запись.
- Рабочая область с поддержкой Microsoft Fabric. Узнайте, как создать рабочую область.
Что делать, если вы уже используете Фабрика данных Azure?
Фабрика данных в Microsoft Fabric — это следующее поколение Фабрики данных Azure, созданное для решения самых сложных проблем интеграции данных с помощью более простого подхода.
Ознакомьтесь с руководством по сравнению с ключевыми различиями между этими двумя службами, чтобы вы могли выбрать подходящий вариант для вашего предприятия.
Когда вы будете готовы к миграции, следуйте руководству по миграции для конвейеров Фабрика данных Azure и Azure Synapse.
Что такое SLA для Fabric Data Factory Pipeline?
SLA для конвейеров в Fabric эквивалентен SLA для конвейеров в Фабрика данных Azure: «Microsoft гарантирует, что успешно обрабатывает запросы на операции с ресурсами Data Factory как минимум в 99,9% случаев. Он также гарантирует, что все запуски активности начинаются в течение четырёх минут от запланированного времени выполнения не менее 99,9 процента случаев. Ознакомьтесь с полным соглашением Data Factory об уровне сервиса (SLA).»
Связанный контент
Дополнительные сведения и инструкции по началу работы с Microsoft Fabric см. в следующих руководствах.
- Интерактивная лаборатория фабрики данных — демонстрация фабрики данных в Fabric
- К чему можно подключиться? — все доступные источники и приемники для Data Factory
- Сквозной учебник по Data Factory — следуйте этому учебнику на протяжении всего процесса ETL, от ввода данных до преобразования и загрузки в систему назначения.