Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Эталонные архитектуры Databricks предоставляют рекомендации по архитектуре, охватывающие источники данных, приём данных, преобразование, выполнение запросов и обработку, предоставление данных, анализ и хранение.
Каждая эталонная архитектура имеет скачиваемый PDF-файл в формате 11 x 17 (A3).
Хотя Databricks — это открытая платформа, которая интегрируется с большой экосистемой партнерских инструментов, эталонные архитектуры сосредоточены только на Azure службах и платформе Databricks. Показаны службы поставщиков облачных служб, чтобы проиллюстрировать основные понятия и не являются исчерпывающими.
Скачать: эталонная архитектура для платформы Azure Databricks
Эталонная архитектура Azure демонстрирует следующие специфичные службы Azure для сбора данных, хранения, предоставления и анализа:
- Azure Synapse и SQL Server в качестве исходных систем для Lakehouse Federation
- Центр Интернета вещей Azure и Центры событий Azure для потокового приёма данных
- Фабрика данных Azure для пакетной загрузки
- Azure Data Lake Storage 2-го поколения (ADLS) в качестве хранилища объектов для ресурсов данных и искусственного интеллекта
- База данных SQL Azure и Azure Cosmos DB в качестве операционных баз данных
- Azure Purview в качестве корпоративного каталога, куда UC экспортирует информацию о схеме данных и её происхождении.
- Power BI в качестве средства бизнес-аналитики
- Azure OpenAI может использоваться как внешний LLM для обслуживания моделей.
Организация эталонных архитектур
Эталонная архитектура структурирована вдоль полос источник, прием, преобразование, запрос/процесс, обслуживание, анализ, и хранилище:
Source
Существует три способа интеграции внешних данных в платформу Data + AI:
- ETL: платформа обеспечивает интеграцию с системами, предоставляющими полуструктурированные и неструктурированные данные (например, датчики, устройства Интернета вещей, мультимедиа, файлы и журналы), а также структурированные данные из реляционных баз данных или бизнес-приложений.
- Федерация Lakehouse: источники данных SQL, такие как реляционные базы данных, можно интегрировать в Databricks и Unity Catalog без ETL. В этом случае данные исходной системы управляются каталогом Unity, а запросы отправляются в исходную систему.
- Федерация каталога: каталоги хранилища метаданных Hive также можно интегрировать в каталог Unity с помощью федерации каталога, что позволяет каталогу Unity управлять таблицами, хранящимися в хранилище метаданных Hive.
Ingest
Загрузка данных в Databricks в пакетном или потоковом режиме:
- Databricks Lakeflow Connect предлагает встроенные соединители для загрузки из корпоративных приложений и баз данных. Результирующий конвейер обработки данных находится под управлением каталога Unity и осуществляется с помощью бессерверных вычислительных мощностей и конвейеров.
- Файлы, доставленные в облачное хранилище, можно загружать непосредственно с помощью автозагрузчика Databricks.
- Для пакетной загрузки данных из корпоративных приложений в Delta Lake, платформа Databricks использует партнерские инструменты загрузки со специальными адаптерами для этих систем учета.
- События потоковой передачи можно получать непосредственно из систем потоковой передачи данных, таких как Kafka, используя функцию Structured Streaming в Databricks. Источники потоковой передачи могут быть датчиками, IoT или процессами отслеживания измененных данных.
Storage
- Данные обычно хранятся в облачной системе хранения, где конвейеры ETL используют архитектуру медальона для хранения данных в журналируемом виде как Delta файлы/таблицы или таблицы Apache Iceberg.
Преобразование и Запрос / Обработка
Платформа Databricks использует свои подсистемы Apache Spark и Photon для всех преобразований и запросов.
Конвейеры — это декларативная платформа для упрощения и оптимизации надежных, обслуживаемых и тестируемых конвейеров обработки данных.
Платформа Databricks Data + AI, работающая на базе Apache Spark и Photon, поддерживает оба типа рабочих нагрузок: SQL-запросы через SQL-хранилища и SQL, Python и Scala через кластеры рабочих пространств.
Для обработки и анализа данных (моделирование машинного обучения и ИИ) платформа Databricks AI и Машинное обучение предоставляет специализированные среды выполнения машинного обучения для AutoML и для написания заданий машинного обучения. Все рабочие процессы обработки и анализа данных и MLOps лучше всего поддерживаются MLflow.
Serving
Для сценариев хранилищ данных (DWH) и BI платформа Databricks предлагает Databricks SQL — хранилище данных на базе SQL warehouses и serverless SQL warehouses.
Для машинного обучения Model Serving — это масштабируемая возможность обслуживания моделей в реальном времени корпоративного уровня, размещенная в плоскости управления Databricks. Шлюз искусственного интеллекта Unity — это решение Databricks для управления и мониторинга доступа к поддерживаемым моделям ИИ и связанным с ними конечным точкам обслуживания моделей.
Операционные базы данных:
- Lakebase — это онлайн-база данных по обработке транзакций (OLTP), основанная на Postgres и полностью интегрированая с платформой Databricks Data + AI. Это позволяет создавать базы данных OLTP в Databricks и интегрировать рабочие нагрузки OLTP с Databricks.
- Внешние системы, такие как операционные базы данных, можно использовать для хранения и доставки конечных продуктов данных в пользовательские приложения.
Collaboration:
Бизнес-партнеры получают безопасный доступ к данным, которые им нужны через OpenSharing.
На основе OpenSharing , Databricks Marketplace является открытым форумом для обмена продуктами данных.
Чистые комнаты защищены и защищают конфиденциальность сред, где несколько пользователей могут работать совместно с конфиденциальными корпоративными данными без прямого доступа к данным друг друга.
Analysis
Завершающие бизнес-приложения находятся в этой линии процессов. К примерам относятся пользовательские клиенты, такие как приложения ИИ, подключенные к службе модели для вывода в режиме реального времени или приложения, обращаюющиеся к данным, отправленным из Databricks в операционную базу данных.
Для вариантов использования бизнес-аналитики обычно используют средства бизнес-аналитики для доступа к хранилищу данных. Разработчики SQL также могут использовать редактор SQL Databricks (не показан на схеме) для запросов и панелей мониторинга.
Платформа Data + AI также предлагает дашборды для создания визуализаций данных и обмена инсайтами.
Integrate
- Платформа Databricks интегрируется со стандартными поставщиками удостоверений для управления пользователями и единого входа (SSO).
Внешние службы ИИ, такие как OpenAI, LangGraph или HuggingFace , можно использовать непосредственно из платформы аналитики Databricks.
Внешние оркестраторы могут использовать комплексный REST API или специализированные коннекторы для таких внешних средств оркестрации, как Apache Airflow.
Каталог Unity используется для управления всеми данными и ИИ в Интеллектуальной платформе Databricks и может интегрировать другие базы данных в управление с помощью Федерация Lakehouse.
Кроме того, каталог Unity можно интегрировать в другие корпоративные каталоги, например Purview. Для получения сведений обратитесь к поставщику корпоративного каталога.
Общие возможности для всех рабочих нагрузок
Кроме того, платформа Databricks поставляется с возможностями управления, поддерживающими все рабочие нагрузки:
Управление данными и ИИ
Центральная система управления данными и ИИ в платформе Databricks Data + AI — это Unity Catalog. Каталог Unity предоставляет единое место для управления политиками доступа к данным, которые применяются во всех рабочих областях и поддерживают все ресурсы, созданные или используемые в Databricks, такие как таблицы, тома, функции (хранилище компонентов) и модели (реестр моделей). Unity Catalog также может использоваться для фиксации происхождения данных во время выполнения в рамках запросов, выполняемых на Databricks.
Мониторинг качества данных Databricks позволяет отслеживать качество данных всех таблиц в вашей учетной записи. Он обнаруживает аномалии во всех таблицах и предоставляет полный профиль данных для каждой таблицы.
Для наблюдаемости системные таблицы — это аналитическое хранилище, размещенное в Databricks, для операционных данных вашей учетной записи. Системные таблицы можно использовать для исторической наблюдаемости в вашей учетной записи.
Подсистема аналитики данных
Платформа Databricks Data + AI позволяет всей вашей организации использовать данные и ИИ, сочетая ИИ с преимуществами унификации Databricks для понимания уникальной семантики ваших данных. См. дополнительные функции Databricks AI.
Код Genie доступен в записных книжках Databricks, редакторе SQL, редакторе файлов и в других местах в качестве помощника по ИИ с учетом контекста для пользователей.
автоматизация & оркестрация
Lakeflow Jobs координирует процессы обработки данных, машинного обучения и аналитики на платформе Databricks Data + AI. Конвейеры Lakeflow позволяют создавать надежные и обслуживаемые конвейеры ETL с декларативным синтаксисом. Платформа также поддерживает CI/CD и MLOps
Высокоуровневые сценарии использования платформы Data + AI на Azure
Встроенное ингестирование данных из приложений и баз данных SaaS с помощью Lakeflow Connect
Скачайте эталонную архитектуру Lakeflow Connect для Azure Databricks.
Databricks Lakeflow Connect предлагает встроенные соединители для приема из корпоративных приложений и баз данных. Результирующий конвейер приема управляется каталогом Unity и управляется бессерверными вычислительными ресурсами и конвейерами Lakeflow.
Lakeflow Connect использует эффективные добавочные операции чтения и записи для ускорения, масштабирования и удешевления приема данных, в то время как данные остаются актуальными для дальнейшего использования.
Пакетная загрузка и ETL
Скачивание: эталонная архитектура пакетного ETL для Azure Databricks
Инструменты загрузки данных используют адаптеры для конкретного источника, чтобы считывать данные из источника, а затем либо сохраняют их в облачном хранилище, откуда их может считывать Auto Loader, либо напрямую вызывают Databricks (например, с помощью партнерских инструментов загрузки данных, интегрированных в платформу Databricks). Чтобы загрузить данные, модуль ETL Databricks и обработчик обработки выполняет запросы через Пайплайны. Оркестрируйте одно или многозадачные задания с помощью заданий Lakeflow и управляйте ими с помощью каталога Unity (управление доступом, аудит, происхождение и т. д.). Чтобы предоставить доступ к определенным золотым таблицам для операционных систем с низкой задержкой, экспортируйте таблицы в операционную базу данных, например RDBMS или хранилище значений ключей в конце конвейера ETL.
Потоковая передача и запись измененных данных (CDC)
Скачивание: структурированная архитектура потоковой передачи Spark для Azure Databricks
Подсистема ETL Databricks использует структурированную потоковую передачу Spark для чтения из очередей событий, таких как Apache Kafka или Концентратор событий Azure. Шаги последуют методике, описанной в случае использования пакетной обработки выше.
Запись измененных данных в режиме реального времени (CDC) обычно хранит извлеченные события в очереди событий. С этого момента случай использования следует примеру использования потоковой передачи.
Если CDC выполняется в пакетном режиме, с извлеченными записями, которые хранятся сначала в облачном хранилище, автозагрузчик Databricks может считывать их, и сценарий использования относится к пакетной обработке ETL.
Машинное обучение и ИИ (традиционное)
Скачать: эталонная архитектура машинного обучения и искусственного интеллекта для Azure Databricks
Для машинного обучения платформа Databricks Data + AI предоставляет передовые библиотеки машинного и глубокого обучения. Он предоставляет такие возможности, как Хранилище компонентов и Реестр моделей (оба интегрированы в каталог Unity), функции низкого кода с AutoML, а также интеграцию MLflow в жизненный цикл анализа данных.
Каталог Unity управляет всеми ресурсами, связанными с обработкой и анализом данных (таблицами, функциями и моделями), а специалисты по обработке и анализу данных могут использовать Задания Lakeflow для оркестрации своих заданий.
Для масштабируемого и корпоративного развертывания моделей используйте возможности MLOps для их публикации в сервисе моделей.
Приложения агента
Скачать: эталонная архитектура приложений ИИ для Azure Databricks
Для развертывания моделей масштабируемым и корпоративным образом используйте возможности MLOps для публикации моделей в модельном обслуживании.
Аналитика BI и SQL
Скачивание: эталонная архитектура бизнес-аналитики и аналитики SQL для Azure Databricks
Для случаев использования бизнес-аналитики, бизнес-аналитики могут использовать дашборды, редактор SQL Databricks или средства BI, такие как Tableau или Power BI. Во всех случаях подсистемой является Databricks SQL (бессерверный или несерверный), а каталог Unity предоставляет обнаружение данных, исследование и управление доступом.
Бизнес-приложения
Загрузка бизнес-приложений для Databricks в Azure Databricks
Databricks Apps позволяет разработчикам создавать и развертывать безопасные данные и приложения ИИ непосредственно на платформе Databricks, что устраняет необходимость отдельной инфраструктуры. Приложения размещаются на бессерверной платформе Databricks и интегрируются с ключевыми службами платформы. Используйте Lakebase , если приложению нужны данные OLTP, синхронизированные с Databricks.
Федерация Lakehouse
Скачать: референсная архитектура интеграции Lakehouse для Azure Databricks
Федерация Lakehouse позволяет интегрировать внешние базы данных SQL (такие как MySQL, Postgres, SQL Server или Azure Synapse) с Databricks.
Все рабочие нагрузки (ИИ, DWH и BI) могут получить преимущества от этого без необходимости переносить данные в объектное хранилище с помощью ETL. Внешний исходный каталог сопоставляется с каталогом Unity и точное управление доступом можно применять для доступа через платформу Databricks.
Федерация каталогов
Скачать: эталонную архитектуру федерации каталогов Azure Databricks
Федерация каталогов позволяет интегрировать внешние хранилища метаданных Hive (например, MySQL, Postgres, SQL Server или Azure Synapse) с Databricks.
Все рабочие нагрузки (ИИ, DWH и BI) могут получить преимущества от этого без необходимости переносить данные в объектное хранилище с помощью ETL. Внешний исходный каталог добавляется в каталог Unity, где точное управление доступом применяется через платформу Databricks.
Совместное использование данных с сторонними инструментами
Скачайте эталонную архитектуру для сторонних инструментов Azure Databricks, чтобы делиться данными
Обмен данными корпоративного уровня с третьими сторонами обеспечивается с помощью OpenSharing. Он обеспечивает прямой доступ к данным в хранилище объектов, защищенном каталогом Unity. Эта возможность также используется в Databricks Marketplace, открытый форум для обмена продуктами данных.
Используйте общие данные из Databricks
Скачивание: использование общих данных из эталонной архитектуры Databricks для Azure Databricks
Протокол OpenSharing Databricks to Databricks позволяет пользователям безопасно обмениваться данными с любым пользователем Databricks независимо от учетной записи или облачного узла, если у этого пользователя есть доступ к рабочей области, включенной для каталога Unity.