Распаковка и чтение сжатых ZIP-файлов

С помощью unzip команды Bash можно развернуть сжатые zip-файлы.zip или каталоги файлов. Команда magic<\/c1> в Azure Databricks позволяет выполнять произвольный код Bash, включая команду .

Apache Spark предоставляет собственные кодеки для взаимодействия с сжатыми файлами Parquet. Большинство файлов Parquet, написанных Azure Databricks, заканчиваются на .snappy.parquet, указывая на то, что они используют сжатие snappy.

Скачивание и распакуйте файл

Используется curl для скачивания сжатого файла, а затем unzip для расширения данных. В следующем примере используется zippped CSV-файл, скачанный из Интернета. См. статью "Скачать данные из Интернета".

%sh curl https://resources.lendingclub.com/LoanStats3a.csv.zip --output /tmp/LoanStats3a.csv.zip
unzip /tmp/LoanStats3a.csv.zip

Переместите файл на том.

Теперь переместите развернутый файл в том каталога Unity:

%sh mv /tmp/LoanStats3a.csv /Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv

В этом примере скачанные данные имеют комментарий в первой строке и заголовок во втором. Теперь, когда вы переместили и расширили данные, используйте стандартные параметры для чтения CSV-файлов, например:

df = spark.read.format("csv").option("skipRows", 1).option("header", True).load("/Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv")
display(df)