Создайте конвейеры с помощью sdp-meta

Проект sdp-meta из Databricks Labs предоставляет средства для создания конвейеров из метаданных, которые вы поддерживаете.

Note

Проект открытый код sdp-meta, как и все проекты в аккаунте databrickslabs GitHub, существует исключительно для исследовательских целей. Azure Databricks не поддерживает его или предоставляет соглашения об уровне обслуживания (SLA) для него. Не отправляйте запросы в службу поддержки Azure Databricks для проблем, связанных с этим проектом. Вместо этого создайте GitHub issue, который будет рассмотрен по мере возможности.

Что такое sdp-meta?

Конвейеры Lakeflow позволяют декларативно указывать таблицу и генерировать поток в конвейере, который создает таблицу и сохраняет его в актуальном состоянии при изменении исходных данных. Однако если в вашей организации есть сотни таблиц, создание и управление этими конвейерами занимает много времени и может привести к несогласованным методикам.

Проект sdp-meta — это метапрограммный фреймворк на основе метаданных, предназначенный для работы с конвейерами Lakeflow. Эта платформа обеспечивает автоматизацию конвейеров бронзовых и серебряных данных путем использования метаданных, записанных в наборе файлов JSON и YAML. Во время выполнения универсальные конвейеры считывают ваши метаданные и динамически строят описанные в них потоки. Обработка бронзы и серебра может выполняться в отдельных трубопроводах или вместе в совместном конвейере. Вы создаёте метаданные для своих конвейеров, а sdp-meta создаёт ваши конвейеры.

Благодаря тому, что вся логика централизована в одном месте — в метаданных, ваша система работает быстрее, её можно повторно использовать, и её легче поддерживать.

Note

Ранее проект sdp-meta был назван dlt-metaв честь старой функции Delta Live Tables в Azure Databricks. Вместо Delta Live Tables теперь используются конвейеры Lakeflow, и sdp-meta работает с конвейерами Lakeflow. Если вы обновляете существующую dlt-meta установку, ознакомьтесь с руководством по миграции в документации sdp-meta.

Преимущества sdp-meta

Существует два основных сценария применения sdp-meta:

  • Легко загружайте и очищайте большое количество таблиц.
  • Обеспечьте соблюдение стандартов проектирования и обработки данных в нескольких конвейерах и для разных пользователей.

Преимущества использования подхода на основе метаданных:

  • Обслуживание метаданных можно сделать без знания кода Python или SQL.
  • Обслуживание метаданных, а не кода, требует меньше накладных расходов и уменьшает ошибки.
  • Код генерируется с помощью sdp-meta, поэтому он остаётся последовательным и содержит меньше пользовательского кода между конвейерами и опубликованными таблицами.
  • Таблицы можно легко группировать в конвейеры в метаданных, создавая количество конвейеров, необходимых для наиболее эффективного обновления данных.

Как работает sdp-meta

Следующее изображение показывает обзор системы SDP-meta:

Обзор SDP-META

  1. Вы создаёте файлы метаданных как вход в sdp-meta, чтобы указать исходные файлы и выходы, правила качества и необходимую обработку. Эти онбординговые файлы можно записывать в JSON или YAML.
  2. Вы ведёте работу по адаптации SDP-мета. Движок компилирует файлы онбординга в спецификацию потока данных, называемую DataflowSpec, и хранит их в таблицах Delta (bronze_dataflowspec и silver_dataflowspec) для последующего использования.
  3. Во время выполнения общий конвейер считывает DataflowSpec и динамически строит бронзовый граф обработки. Он считывает ваши исходные данные (файлы, потоки или CDC) и применяет правильные ожидания по данным, чтобы соответствовать вашим правилам качества, генерируя бронзовые таблицы и карантинируя записи, которые не соответствуют этим правилам.
  4. Серебряная обработка может работать в отдельном универсальном конвейере, который является стандартом для Декларативных Автоматизированных Пакетов, или в том же конвейере при использовании комбинированного режима. Конвейер использует DataflowSpec для применения соответствующих преобразований и других операций обработки, в результате чего формируются серебряные таблицы, которые очищены, обогащены и подготовлены для аналитики.

Вы запускаете конвейеры, сгенерированные sdp-meta, чтобы поддерживать выход в актуальном состоянии по мере обновления исходных данных.

Get started

Чтобы использовать sdp-meta, вы должны:

  • Развернуть и настроить решение sdp-meta.
  • Подготовьте метаданные для таблиц бронзового и серебряного слоя.
  • Создайте задание для подключения метаданных.
  • Используйте метаданные для создания конвейеров для таблиц.

Проект sdp-meta поддерживает несколько интерфейсов развертывания: рекомендуемые пакеты, интерактивный CLI, приложение Databricks с браузерным интерфейсом, MCP-сервер для настройки с помощью ИИ и портативный Agent Skill для агентов, ориентированных на навыки.

Документация по sdp-meta на GitHub содержит обучающее руководство, которое поможет вам начать этот процесс. Для получения дополнительной информации смотрите раздел «Начало работы с sdp-meta» на GitHub.

Дополнительные ресурсы