Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Проект sdp-meta из Databricks Labs предоставляет средства для создания конвейеров из метаданных, которые вы поддерживаете.
Note
Проект открытый код sdp-meta, как и все проекты в аккаунте databrickslabs GitHub, существует исключительно для исследовательских целей. Azure Databricks не поддерживает его или предоставляет соглашения об уровне обслуживания (SLA) для него. Не отправляйте запросы в службу поддержки Azure Databricks для проблем, связанных с этим проектом. Вместо этого создайте GitHub issue, который будет рассмотрен по мере возможности.
Что такое sdp-meta?
Конвейеры Lakeflow позволяют декларативно указывать таблицу и генерировать поток в конвейере, который создает таблицу и сохраняет его в актуальном состоянии при изменении исходных данных. Однако если в вашей организации есть сотни таблиц, создание и управление этими конвейерами занимает много времени и может привести к несогласованным методикам.
Проект sdp-meta — это метапрограммный фреймворк на основе метаданных, предназначенный для работы с конвейерами Lakeflow. Эта платформа обеспечивает автоматизацию конвейеров бронзовых и серебряных данных путем использования метаданных, записанных в наборе файлов JSON и YAML. Во время выполнения универсальные конвейеры считывают ваши метаданные и динамически строят описанные в них потоки. Обработка бронзы и серебра может выполняться в отдельных трубопроводах или вместе в совместном конвейере. Вы создаёте метаданные для своих конвейеров, а sdp-meta создаёт ваши конвейеры.
Благодаря тому, что вся логика централизована в одном месте — в метаданных, ваша система работает быстрее, её можно повторно использовать, и её легче поддерживать.
Note
Ранее проект sdp-meta был назван dlt-metaв честь старой функции Delta Live Tables в Azure Databricks. Вместо Delta Live Tables теперь используются конвейеры Lakeflow, и sdp-meta работает с конвейерами Lakeflow. Если вы обновляете существующую dlt-meta установку, ознакомьтесь с руководством по миграции в документации sdp-meta.
Преимущества sdp-meta
Существует два основных сценария применения sdp-meta:
- Легко загружайте и очищайте большое количество таблиц.
- Обеспечьте соблюдение стандартов проектирования и обработки данных в нескольких конвейерах и для разных пользователей.
Преимущества использования подхода на основе метаданных:
- Обслуживание метаданных можно сделать без знания кода Python или SQL.
- Обслуживание метаданных, а не кода, требует меньше накладных расходов и уменьшает ошибки.
- Код генерируется с помощью sdp-meta, поэтому он остаётся последовательным и содержит меньше пользовательского кода между конвейерами и опубликованными таблицами.
- Таблицы можно легко группировать в конвейеры в метаданных, создавая количество конвейеров, необходимых для наиболее эффективного обновления данных.
Как работает sdp-meta
Следующее изображение показывает обзор системы SDP-meta:
- Вы создаёте файлы метаданных как вход в sdp-meta, чтобы указать исходные файлы и выходы, правила качества и необходимую обработку. Эти онбординговые файлы можно записывать в JSON или YAML.
- Вы ведёте работу по адаптации SDP-мета. Движок компилирует файлы онбординга в спецификацию потока данных, называемую DataflowSpec, и хранит их в таблицах Delta (
bronze_dataflowspecиsilver_dataflowspec) для последующего использования. - Во время выполнения общий конвейер считывает DataflowSpec и динамически строит бронзовый граф обработки. Он считывает ваши исходные данные (файлы, потоки или CDC) и применяет правильные ожидания по данным, чтобы соответствовать вашим правилам качества, генерируя бронзовые таблицы и карантинируя записи, которые не соответствуют этим правилам.
- Серебряная обработка может работать в отдельном универсальном конвейере, который является стандартом для Декларативных Автоматизированных Пакетов, или в том же конвейере при использовании комбинированного режима. Конвейер использует DataflowSpec для применения соответствующих преобразований и других операций обработки, в результате чего формируются серебряные таблицы, которые очищены, обогащены и подготовлены для аналитики.
Вы запускаете конвейеры, сгенерированные sdp-meta, чтобы поддерживать выход в актуальном состоянии по мере обновления исходных данных.
Get started
Чтобы использовать sdp-meta, вы должны:
- Развернуть и настроить решение sdp-meta.
- Подготовьте метаданные для таблиц бронзового и серебряного слоя.
- Создайте задание для подключения метаданных.
- Используйте метаданные для создания конвейеров для таблиц.
Проект sdp-meta поддерживает несколько интерфейсов развертывания: рекомендуемые пакеты, интерактивный CLI, приложение Databricks с браузерным интерфейсом, MCP-сервер для настройки с помощью ИИ и портативный Agent Skill для агентов, ориентированных на навыки.
Документация по sdp-meta на GitHub содержит обучающее руководство, которое поможет вам начать этот процесс. Для получения дополнительной информации смотрите раздел «Начало работы с sdp-meta» на GitHub.