Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
С помощью unzip команды Bash можно развернуть сжатые zip-файлы.zip или каталоги файлов. Команда
Apache Spark предоставляет собственные кодеки для взаимодействия с сжатыми файлами Parquet. Большинство файлов Parquet, написанных Azure Databricks, заканчиваются на .snappy.parquet, указывая на то, что они используют сжатие snappy.
Скачивание и распакуйте файл
Используется curl для скачивания сжатого файла, а затем unzip для расширения данных. В следующем примере используется zippped CSV-файл, скачанный из Интернета. См. статью "Скачать данные из Интернета".
%sh curl https://resources.lendingclub.com/LoanStats3a.csv.zip --output /tmp/LoanStats3a.csv.zip
unzip /tmp/LoanStats3a.csv.zip
Переместите файл на том.
Теперь переместите развернутый файл в том каталога Unity:
%sh mv /tmp/LoanStats3a.csv /Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv
В этом примере скачанные данные имеют комментарий в первой строке и заголовок во втором. Теперь, когда вы переместили и расширили данные, используйте стандартные параметры для чтения CSV-файлов, например:
df = spark.read.format("csv").option("skipRows", 1).option("header", True).load("/Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv")
display(df)