Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Azure Databricks имеет встроенные привязки ключевых слов для всех форматов данных, поддерживаемых Apache Spark. Azure Databricks использует Delta Lake в качестве протокола по умолчанию для чтения и записи данных и таблиц, в то время как Apache Spark использует Parquet.
В этих статьях представлен обзор многих параметров и конфигураций, доступных при запросе данных в Azure Databricks.
Следующие форматы данных имеют встроенные конфигурации ключевых слов в Кадрах данных Apache Spark и SQL:
Azure Databricks также предоставляет кастомное ключевое слово для загрузки экспериментов MLflow.
Форматы данных с особыми рекомендациями
Для использования некоторых форматов данных требуется дополнительная конфигурация или специальные рекомендации.
- Databricks рекомендует загружать изображения в качестве
binaryданных. - Большинство форматов поддерживают сжатие записи с помощью
compressionпараметра. Дополнительные сведения о конфигурации см. в разделе сжатия в документации по каждому формату. Azure Databricks также позволяет напрямую считывать уже сжатые файлы многих форматов, и при необходимости вы можете распаковать сжатые файлы в Azure Databricks.-
Текст на основе текста (CSV, JSON, XML, текст):
none(по умолчанию),bzip2,gzip,lz4,snappy,deflateиzstd -
Parquet:
snappy(по умолчанию),gzip,lzo,brotli,lz4иzstd -
ORC:
snappy,zlibиlzo -
Avro:
snappy(по умолчанию),deflate,bzip2,xzиzstandard
-
Текст на основе текста (CSV, JSON, XML, текст):
Дополнительные сведения об источниках данных Apache Spark см. в статье Generic Load/Save Functions (Универсальные функции загрузки и сохранения) и Generic File Source Options (Универсальные параметры источников файлов).