Параметры формата данных

Azure Databricks имеет встроенные привязки ключевых слов для всех форматов данных, поддерживаемых Apache Spark. Azure Databricks использует Delta Lake в качестве протокола по умолчанию для чтения и записи данных и таблиц, в то время как Apache Spark использует Parquet.

В этих статьях представлен обзор многих параметров и конфигураций, доступных при запросе данных в Azure Databricks.

Следующие форматы данных имеют встроенные конфигурации ключевых слов в Кадрах данных Apache Spark и SQL:

Azure Databricks также предоставляет кастомное ключевое слово для загрузки экспериментов MLflow.

Форматы данных с особыми рекомендациями

Для использования некоторых форматов данных требуется дополнительная конфигурация или специальные рекомендации.

  • Databricks рекомендует загружать изображения в качестве binary данных.
  • Большинство форматов поддерживают сжатие записи с помощью compression параметра. Дополнительные сведения о конфигурации см. в разделе сжатия в документации по каждому формату. Azure Databricks также позволяет напрямую считывать уже сжатые файлы многих форматов, и при необходимости вы можете распаковать сжатые файлы в Azure Databricks.
    • Текст на основе текста (CSV, JSON, XML, текст): none (по умолчанию), bzip2, gzip, lz4, snappy, deflateи zstd
    • Parquet: snappy (по умолчанию), gzip, lzo, brotli, lz4и zstd
    • ORC: snappy, zlibи lzo
    • Avro: snappy (по умолчанию), deflate, bzip2, xzи zstandard

Дополнительные сведения об источниках данных Apache Spark см. в статье Generic Load/Save Functions (Универсальные функции загрузки и сохранения) и Generic File Source Options (Универсальные параметры источников файлов).