Общие сведения об Azure Data Lake Storage 2-го поколения

Завершено

Репозиторий данных Data Lake — это система хранения, в которой данные содержатся в естественном формате, обычно в виде BLOB или файлов. Azure Data Lake Storage — это комплексное, масштабируемое, безопасное и экономичное решение озера данных для высокопроизводительной аналитики, встроенной в Azure.

Схема, представляющая файлы в Azure data Lake Storage 2-го поколения, доступ к которым осуществляется с помощью технологий больших данных.

Azure Data Lake Storage сочетает в себе файловую систему с платформой хранилища, позволяя быстро выявлять ценные сведения внутри данных. Data Lake Storage основывается на возможностях Azure Blob Storage, чтобы специально оптимизировать его для рабочих нагрузок аналитики. Такая интеграция обеспечивает аналитические возможности, функции распределения по уровням и управления жизненным циклом данных BLOB-хранилища, а также возможности высокой доступности, безопасности и надежности Azure Storage.

Льготы

Data Lake Storage предназначен для работы с таким разнообразием и объемом данных на уровне эксабайтов при безопасной обработке потоков данных с пропускной способностью в сотни гигабайт. Это позволяет использовать решение Data Lake Storage 2-го поколения в качестве основы для пакетных решений и решений реального времени.

Открытый доступ к платформе аналитики

Преимущество Data Lake Storage заключается в том, что он предоставляет иерархическую файловую систему с помощью открытых API, что позволяет хранить данные в одном месте и получать доступ к ним с помощью современных вычислительных технологий, включая Azure Databricks и Microsoft Fabric без перемещения данных между средами. Инженеры данных также могут использовать открытые форматы файлов, такие как Parquet и Delta Lake, которые очень сжаты, поддерживают применение схемы и хорошо работают на нескольких платформах аналитики.

Безопасность

Azure Data Lake Storage использует многоуровневую модель управления доступом. Управление доступом на основе ролей Azure (Azure RBAC) позволяет предоставлять приблизительный доступ (например, доступ на чтение или запись ко всем данным в контейнере) пользователям, группам и служебным принципалам. Управление доступом на основе атрибутов Azure (Azure ABAC) обновляет эти назначения ролей путем добавления условий, таких как ограничение доступа к данным с определенным тегом. Для точного управления уровнем файлов списки управления доступом (ACL) с разрешениями переносимого интерфейса операционной системы (POSIX) позволяют задавать разрешения на уровне каталога или файла.

Разрешения автоматически не наследуются от родительских каталогов после создания дочернего элемента. Однако вы можете настроить разрешения по умолчанию в родительском каталоге, которые затем применяются к новым дочерним элементам во время их создания. Эти параметры можно управлять с помощью таких служебных программ, как Обозреватель службы хранилища Azure, который работает в Windows, macOS и Linux. Все сохраненные данные зашифрованы в состоянии покоя с использованием ключей, управляемых либо корпорацией Майкрософт, либо клиентом.

Производительность

Решение Azure Data Lake Storage упорядочивает хранимые данные внутри иерархии каталогов и подкаталогов, по аналогии с файловой системой, что упрощает навигацию. В результате обработка данных требует меньше вычислительных ресурсов, снижая затрачиваемое время и расходы.

Избыточность данных

Data Lake Storage наследует все модели репликации хранилища BLOB-объектов Azure. Локально избыточное хранилище (LRS) сохраняет несколько копий в одном центре обработки данных, а хранилище с избыточностью между зонами (ZRS) реплицирует данные между зонами доступности в одном регионе. Для более широкой географической защиты геоизбыточное хранилище (GRS) или геоизбыточное хранилище с доступом только для чтения (RA-GRS) реплицирует данные в дополнительный регион. Для максимального уровня устойчивости геоизбыточное хранилище (GZRS или RA-GZRS) объединяет зональную и географическую избыточность. Этот диапазон параметров гарантирует, что данные всегда доступны и защищены независимо от масштаба нарушений.

Совет

При планировании озера данных инженер данных должен учитывать структуру, управление данными и безопасность. Это должно включать в себя рассмотрение факторов, которые могут повлиять на структуру озера и организацию, например:

  • Типы данных для хранения
  • Преобразование данных
  • Кто должен получить доступ к данным
  • Что такое типичные шаблоны доступа

Этот подход поможет определить, как спланировать управление доступом по всему озеру. Инженеры данных должны быть упреждающими в обеспечении того, чтобы озеро не стало пресловутым болотом данных, которое становится недоступным и не полезным для пользователей из-за отсутствия мер управления данными и качества данных. Создание базовых показателей и следующих рекомендаций для Azure Data Lake поможет обеспечить правильную и надежную реализацию, которая позволит организации расти и получать аналитические сведения для достижения большего.