Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Идеи решения
В этой статье описывается идея решения. Ваш архитектор облака может использовать это руководство, чтобы визуализировать основные компоненты для типичной реализации этой архитектуры. Используйте эту статью в качестве отправной точки для разработки хорошо спроектированного решения, которое соответствует конкретным требованиям рабочей нагрузки.
Это решение описывает основные принципы и компоненты современной архитектуры данных. Azure Databricks является основным элементом решения. Эта платформа интегрируется непосредственно с другими службами, такими как Azure Data Lake Storage, Microsoft Fabric и Power BI.
Apache® и Apache Spark™ являются зарегистрированными товарными знаками или товарными знаками Apache Software Foundation в США и/или других странах. Использование этих меток не подразумевает подтверждения от Apache Software Foundation.
Архитектура
Скачайте файл Visio для этой архитектуры.
Поток данных
Следующий поток данных соответствует предыдущей схеме:
Azure Databricks потребляет необработанные потоковые данные из Центров событий Azure с помощью Декларативных конвейеров Spark Lakeflow (SDP).
Фабрика данных Fabric загружает необработанные пакетные данные в Data Lake Storage.
Следующие компоненты хранят, курируют и упорядочивают данные в озере данных:
Data Lake Storage сохраняет все типы данных, включая структурированные, неструктурированные и частично структурированные данные. Он также хранит пакетные и потоковые данные.
Delta Lake — это курируемый слой озера данных. Он сохраняет уточненные данные в формате с открытым кодом.
Azure Databricks использует архитектуру медальона для упорядочивания данных на следующих уровнях:
Бронзовый слой содержит необработанные данные.
Слой Silver содержит чистые отфильтрованные данные.
Уровень Gold хранит агрегированные данные, поддерживающие бизнес-аналитику.
Аналитическая платформа поглощает данные из разных источников пакетной и потоковой обработки. Специалисты по обработке и анализу данных используют эти данные для таких задач, как:
Подготовка данных
Исследование данных
Подготовка модели
Обучение модели
MLflow управляет параметрами, метриками и отслеживанием моделей в коде обработки и анализа данных. Azure Databricks предоставляет гибкие варианты написания кода для этих рабочих нагрузок, в том числе:
Поддержка SQL, Python, R и Scala.
Интеграция с популярными библиотеками и платформами с открытым кодом, такими как PySpark, API pandas в Spark, pandas и scikit-learn.
Варианты вычислений с одним узлом и несколькими узлами, которые помогают оптимизировать производительность и затраты.
Модели машинного обучения доступны и развертываются с помощью Azure Databricks, в котором хранятся сведения о моделях в реестре моделей MLflow. Реестр предоставляет модели с помощью пакетной, потоковой передачи и REST API. Решение также может сделать модели доступными, развернув их в конечных точках Машинного обучения Azure, включая управляемые онлайн конечные точки, пакетные конечные точки и конечные точки Kubernetes, поддерживаемые службой Azure Kubernetes (AKS).
Чтобы обеспечить согласованность, службы, управляющие данными, подключаются к одному базовому источнику данных. Например, можно выполнять SQL-запросы в озере данных с помощью хранилищ SQL Azure Databricks. Эта служба:
Предоставляет редактор запросов и каталог, журнал запросов, базовую панель мониторинга и оповещения.
Использует встроенную безопасность, включающую разрешения на уровне строк и разрешения на уровне столбцов.
Использует Photon-powered Delta Engine для повышения производительности.
Вы можете зеркально отображать наборы данных из Azure Databricks Unity Catalog в Microsoft OneLake. Используйте зеркальное отображение Azure Databricks в Fabric для интеграции данных без репликации или перемещения.
Power BI создает аналитические и исторические отчеты и панели мониторинга на основе унифицированной платформы данных. Интеграция Power BI с Azure Databricks предоставляет следующие возможности:
Встроенный соединитель Azure Databricks для визуализации базовых данных
Оптимизированные драйверы подключения к базе данных Java (JDBC) и open Database Connectivity (ODBC)
Чтобы загрузить семантические модели Power BI для запросов с более высокой производительностью, можно использовать режим Direct Lake с зеркальным отображением Azure Databricks в OneLake.
Решение использует каталог Unity и службы Azure для совместной работы, производительности, надежности, управления и безопасности. Следующие службы и возможности поддерживают управление платформой и управлением.
Каталог Azure Databricks Unity предоставляет централизованный контроль доступа, аудит, происхождение данных и возможности обнаружения данных в рабочих областях Azure Databricks.
Microsoft Purview предоставляет службы обнаружения данных, классификацию конфиденциальных данных и аналитические сведения об управлении в пределах хранилища данных.
Для доступа к Data Lake Storage используйте средства аутентификации на основе удостоверений, такие как управляемые удостоверения и учетные записи служб, в качестве настройки по умолчанию для всех служб данных. Используйте Azure Key Vault только в том случае, если для рабочей нагрузки требуются неидентные учетные данные, такие как маркеры, пароли или общие ключи. Рассматривать секреты как сквозную меру контроля. Централизуйте хранилище, ограничьте доступ, регулярно проводите смену и настройте рабочие нагрузки для получения секретов в реальном времени, а не с помощью встроенных строк подключения.
Azure DevOps и другие платформы DevOps, такие как GitHub, предлагают непрерывную интеграцию и непрерывную доставку (CI/CD) и другие интегрированные функции управления версиями для автоматизации развертывания инфраструктуры и управления кодом.
Power BI обращается к подготовленным данным (Gold) через конечные точки SQL Azure Databricks с помощью аутентификации и авторизации на основе Microsoft Entra ID. Каталог Databricks Unity и службы управления предприятиями управляют доступом к данным, что означает, что Power BI не требует прямых учетных данных хранения, а только авторизованные пользователи и наборы данных могут получить доступ к данным.
Идентификатор Microsoft Entra предоставляет единый вход (SSO) и автоматическое управление удостоверениями для пользователей и групп Azure Databricks. Автоматическое управление удостоверениями синхронизирует пользователей, основные службы и группы из Microsoft Entra ID без отдельной настройки конфигурации. Azure Databricks поддерживает автоматическое предоставление идентификационных данных с помощью Microsoft Entra ID для:
Создание и синхронизация пользователей, групп и субъектов-служб.
Управление членством в вложенных группах.
Удалите пользователей и запретите доступ при удалении удостоверений из идентификатора Microsoft Entra.
Azure Monitor собирает и анализирует данные телеметрии ресурсов Azure. Эта служба обеспечивает максимальную производительность и надежность путем упреждающего выявления проблем.
Управление затратами Microsoft предоставляет службы управления финансовыми ресурсами для рабочих нагрузок Azure.
Компоненты
Это решение использует следующие компоненты.
Основные компоненты
Azure Databricks — это платформа аналитики данных, использующая кластеры Spark для обработки больших потоков данных. Она очищает и преобразует неструктурированные данные и объединяет их со структурированными данными. Он также может обучать и развертывать модели машинного обучения. В этой архитектуре Azure Databricks служит центральным средством для приема, обработки и обслуживания данных. Она предоставляет единую среду для управления всем жизненным циклом данных.
Хранилища SQL Azure Databricks — это вычислительные ресурсы, которые можно использовать для запроса и изучения данных в Azure Databricks. В этой архитектуре можно использовать конечные точки SQL для подключения непосредственно к данным из Power BI.
SDP Lakeflow, ранее Delta Live Tables, является декларативной платформой для создания надежных, поддерживаемых и тестируемых конвейеров обработки данных. В этой архитектуре SDP Lakeflow помогает определить преобразования для выполнения над вашими данными. Она также помогает управлять оркестрацией задач, управлением кластерами, мониторингом, качеством данных и обработкой ошибок в Azure Databricks.
Fabric — это сквозная аналитика и платформа данных для организаций, которым требуется единое решение. Платформа предоставляет такие службы, как Fabric Data Engineering, Fabric Data Factory, Fabric Data Science, Fabric Real-Time Intelligence, Fabric Data Warehouse, Fabric Databases и OneLake. Эта архитектура отражает таблицы каталога Unity в OneLake и использует режим Direct Lake в Power BI для повышения производительности.
Фабрика данных — это современная платформа интеграции данных, которую можно использовать для приема, подготовки и преобразования данных из набора источников данных в Fabric. Эта архитектура использует встроенные соединители для нескольких источников данных для быстрого приема данных в Data Lake Storage или OneLake. Azure Databricks позже извлекает и преобразует пакетные данные.
Центры событий — это полностью управляемая платформа потоковой передачи больших данных. Как платформа как услуга (PaaS), она обеспечивает возможности для приема событий. Эта архитектура использует Центры событий для потоковой передачи данных. Azure Databricks может подключаться к этим данным и обрабатывать их с помощью Spark Streaming или Lakeflow SDP.
Data Lake Storage — это масштабируемое и безопасное озеро данных для высокопроизводительной аналитики. Он обрабатывает несколько петабайт данных и поддерживает сотни гигабит пропускной способности. Data Lake Storage может хранить структурированные, частично структурированные и неструктурированные данные. Эта архитектура использует Data Lake Storage для хранения как пакетных, так и потоковых данных.
Машинное обучение — это облачная среда, которая помогает создавать и развертывать решения прогнозной аналитики, а также управлять ими. С помощью этих моделей можно прогнозирует поведение, результаты и тенденции. В этой архитектуре машинное обучение использует данные, которые Azure Databricks преобразует для обучения и вывода моделей.
AKS — это высокодоступная, защищенная и полностью управляемая служба Kubernetes. AKS упрощает развертывание контейнерных приложений и управление ими. В этой архитектуре AKS размещает модели машинного обучения в контейнерной среде для масштабируемого вывода.
Delta Lake — это слой хранения, использующий открытый формат файла. Этот уровень функционирует на верхнем уровне облачных решений хранения данных, таких как Data Lake Storage. Delta Lake поддерживает управление версиями данных, откат и транзакции для обновления, удаления и объединения данных. В этой архитектуре Delta Lake служит основным форматом файла для записи и чтения данных из Data Lake Storage.
MLflow — это платформа с открытым исходным кодом для управления жизненным циклом машинного обучения. Его компоненты отслеживают модели машинного обучения во время обучения и эксплуатации. В этой архитектуре, аналогично машинному обучению, можно использовать MLflow в Azure Databricks для управления жизненным циклом машинного обучения. Обучайте и делайте вывод на моделях, используя данные Unity Catalog, которые вы преобразуете в Azure Databricks.
Создание отчетов и управление компонентами
Каталог Azure Databricks Unity предоставляет централизованный контроль доступа, аудит, прослеживаемость данных и возможности поиска данных в рабочих областях Azure Databricks. В этой архитектуре каталог Unity служит основным средством в Azure Databricks для управления и защиты доступа к данным.
Power BI — это коллекция программных служб и приложений. Эти службы создают и совместно используют отчеты, которые подключают и визуализируют несвязанные источники данных. Вместе с Azure Databricks Power BI может обеспечить определение первопричин и анализ необработанных данных. В этой архитектуре вы используете Power BI для создания панелей мониторинга и отчетов, которые предоставляют аналитические сведения о данных, которые обрабатываются в Azure Databricks и Fabric.
Microsoft Purview управляет локальными, многооблачными и программными средствами как услугами (SaaS). Эта служба управления поддерживает карты ландшафта данных. Ее функции включают автоматическое обнаружение данных, классификацию конфиденциальных данных и происхождение данных. В этой архитектуре Microsoft Purview сканирует и отслеживает данные, поступающие в систему через Unity Catalog, Fabric, Power BI и хранилище данных Data Lake Storage.
Azure DevOps — это платформа оркестрации DevOps . Эта служба SaaS предоставляет средства и среды для создания, развертывания и совместной работы с приложениями. В этой архитектуре Azure DevOps автоматизирует развертывание инфраструктуры Azure. Вы также можете использовать GitHub для автоматизации и управления версиями кода Azure Databricks для улучшения совместной работы, отслеживания изменений и интеграции с конвейерами CI/CD.
Key Vault хранит и управляет доступом к секретам, таким как маркеры, пароли и ключи API. Key Vault также создает и контролирует ключи шифрования и управляет сертификатами безопасности. В этой архитектуре Key Vault хранит ключи подписи общего доступа из Data Lake Storage. Затем эти ключи используются в Azure Databricks и других службах для проверки подлинности.
Microsoft Entra ID предоставляет облачные службы управления идентификацией и доступом. Эти функции позволяют пользователям входить и получать доступ к ресурсам. В этой архитектуре идентификатор Microsoft Entra проверяет подлинность и авторизует пользователей и службы в Azure.
Автоматическое управление удостоверениями автоматически синхронизирует пользователей, служебные учетные записи и группы из Microsoft Entra ID в Azure Databricks без необходимости отдельной настройки приложения. Azure Databricks активирует эту функцию по умолчанию и включает поддержку вложенных групп и служебных принципалов. В этой архитектуре можно использовать систему управления идентификацией через домены (SCIM), если у вашей организации есть специфические требования к управлению идентификацией.
Azure Monitor собирает и анализирует данные в средах и ресурсах Azure. Сюда входят данные телеметрии приложений, такие как метрики производительности и журналы действий. В этой архитектуре Azure Monitor отслеживает работоспособность вычислительных ресурсов в Azure Databricks и Машинном обучении, а также другие компоненты, которые отправляют журналы в Azure Monitor.
Управление затратами помогает управлять облачными расходами. Эта служба упорядочивает расходы и показывает, как сократить затраты с помощью бюджетов и рекомендаций. В этой архитектуре управление затратами помогает отслеживать затраты всего решения и управлять ими.
Подробности сценария
Современные архитектуры данных:
- Объединение данных, аналитики и рабочих нагрузок ИИ.
- Эффективное и надежное выполнение в любом масштабе.
- Предоставление аналитических сведений с помощью панелей мониторинга аналитики, операционных отчетов или расширенной аналитики.
Это решение описывает современную архитектуру данных, которая достигает этих целей. Azure Databricks формирует ядро решения. Эта платформа интегрируется непосредственно с другими службами. Вместе эти службы предоставляют решение, которое:
Простой: Единая аналитика, обработка и анализ данных и машинное обучение упрощают архитектуру данных.
Открыть: Решение поддерживает открытый исходный код, открытые стандарты и открытые платформы. Он также работает с популярными интегрированными средами разработки (IDEs), библиотеками и языками программирования. Решение также интегрируется с широким спектром других служб.
Совместное решение: Инженеры по данным, специалисты по анализу данных и аналитики работают вместе с этим решением. Они могут использовать записные книжки для совместной работы, идентификаторы, панели мониторинга и другие средства для доступа к общим базовым данным и их анализа.
Потенциальные варианты использования
Это решение относится к организациям, которые уже используют платформы аналитики на основе PaaS и средства бизнес-аналитики на основе SaaS, часто в разных командах. Это решение помогает инженерам и командам по обработке и анализу данных, которые используют Azure Databricks для масштабируемой обработки и машинного обучения. Аналитика и бизнес-пользователи используют Power BI для стандартизированной отчетности, которая требует единой архитектуры, которая поддерживает обе рабочие нагрузки без дублирования данных или фрагментации управления.
Используйте эту архитектуру, если вы:
Специалисты по обработке и анализу данных и группы обработки и анализа данных, которые уже используют Azure Databricks для масштабируемой обработки данных, расширенной аналитики и машинного обучения.
У вас есть аналитические и бизнес-сообщества пользователей, которые зависят от Power BI для стандартизированных, управляемых отчетов и самостоятельной аналитики.
Требуется унифицированная архитектура данных, чтобы обе платформы могли использовать общую основу данных.
Хотите избежать дублирования данных или создания параллельных конвейеров исключительно для удовлетворения различных рабочих нагрузок аналитики.
Необходимо поддерживать согласованное управление, безопасность и управление доступом в рабочих нагрузках инженерии и бизнес-аналитики.
Cost
Используйте калькулятор цен Azure для оценки затрат для конкретного сценария. В качестве отправной точки см. предварительно настроенную оценку в калькуляторе цен Azure, которая включает основные службы Azure в этой архитектуре.
Оценка не включает в себя Microsoft Fabric, Power BI, Microsoft Purview или Azure DevOps, так как эти службы используют лицензии на емкость или на пользователя, которые зависят от организации.
Соавторы
Корпорация Майкрософт поддерживает эту статью. Следующие авторы написали эту статью.
Основной автор:
- Лоррин Фердинанд | Основной автор
Другой участник:
- Kranthi Kumar Manchhikanti | Вклад
Чтобы увидеть непубличные профили LinkedIn, войдите на сайт LinkedIn.
Следующие шаги
- Создание конвейера извлечения, преобразования и загрузки (ETL) с помощью отслеживания измененных данных
- Создание сквозного конвейера с помощью фабрики данных
- Использование Direct Lake для высокопроизводительной аналитики данных OneLake
- Интегрировать OneLake с Azure Databricks