Примеры наборов данных

Существует множество примеров наборов данных, предоставляемых Azure Databricks и предоставляемых сторонними лицами, которые можно использовать в рабочей области Azure Databricks.

Наборы данных каталога Unity

Каталог Unity предоставляет доступ к ряду примеров наборов данных в каталоге samples . Эти наборы данных можно просмотреть в пользовательском интерфейсе обозревателя каталогов и ссылаться на них непосредственно в записной книжке или в редактореSQL с помощью <catalog-name>.<schema-name>.<table-name> шаблона.

В следующей таблице перечислены доступные схемы в каталоге samples :

Набор данных Описание
databricks Примеры файловых наборов данных для построения конвейеров обработки данных в томе datasets.
nyctaxi Записи поездок на такси в Нью-Йорке.
tpcds_sf1 Небольшой набор данных (примерно 1 ГБ) из теста TPC-DS.
tpch Масштабируемый набор данных (примерно 1 ТБ) из TPC-H Benchmark.
wanderbricks Симулированная платформа бронирования путешествий с пользователями, объектами размещения, бронированиями, отзывами и многим другим.

датабрикс

Схема databricks содержит том datasets, в котором размещена коллекция файловых наборов данных, предоставляемых Azure Databricks, которые можно использовать для создания и тестирования конвейеров данных. Чтобы получить список доступных наборов данных, выполните следующую команду:

SQL

LIST '/Volumes/samples/databricks/datasets/'

Питон

display(dbutils.fs.ls("/Volumes/samples/databricks/datasets/"))

nyctaxi

Схема nyctaxi содержит таблицу trips, которая содержит сведения о поездках на такси в Нью-Йорке. В следующем примере возвращаются первые 10 записей в этой таблице:

SQL

SELECT * FROM samples.nyctaxi.trips LIMIT 10

Питон

display(spark.read.table("samples.nyctaxi.trips").limit(10))

tpcds_sf1

Схема tpcds_sf1 содержит данные из тестаTPC-DS. Чтобы получить список таблиц в этой схеме, выполните следующую команду:

SQL

SHOW TABLES IN samples.tpcds_sf1;

Питон

display(spark.sql("SHOW TABLES IN samples.tpcds_sf1"))

Дополнительные рекомендации по использованию этого набора данных для оценки производительности системы см. в разделе "Использование примера набора данных TPC-DS для оценки производительности системы".

tpch

Схема tpch содержит данные из TPC-H Benchmark. Чтобы получить список таблиц в этой схеме, выполните следующую команду:

SQL

SHOW TABLES IN samples.tpch

Питон

display(spark.sql("SHOW TABLES IN samples.tpch"))

wanderbricks

Схема wanderbricks содержит имитированный набор данных платформы бронирования путешествий. Дополнительные сведения о таблицах наборов данных см. в wanderbricks разделе Wanderbricks dataset.

Сторонние примеры наборов данных в формате CSV

Azure Databricks имеет встроенные средства для быстрого отправки сторонних примеров наборов данных в виде файлов с разделием запятыми (CSV) в рабочие области Azure Databricks. Некоторые популярные сторонние примеры наборов данных, доступные в формате CSV:

Пример набора данных Скачивание примера набора данных в виде CSV-файла...
Перепись белка На веб-странице "Данные" щелкните "Парк данных",
Squirrel Data или Сюжеты.
Коллекция наборов данных OWID В репозитории GitHub щелкните папку наборов данных. Щелкните вложенную папку, содержащую целевой набор данных, и выберите CSV-файл набора данных.
наборы данных DATA.GOV CSV На веб-странице результатов поиска щелкните целевой результат поиска и рядом с значком CSV нажмите кнопку "Скачать".
Алмазы (требуется учетная запись Kaggle) На веб-странице набора данных на вкладке "Данные " на вкладке "Данные " рядом с diamonds.csvщелкните значок "Скачать ".
Длительность поездки в такси Нью-Йорка (требуетсяучетная запись Kaggle ) На веб-странице набора данных на вкладке Данные, рядом с sample_submission.zip, щелкните
Значок скачивания . Чтобы найти CSV-файлы набора данных, извлекает содержимое скачаированного ZIP-файла.

Чтобы использовать сторонние примеры наборов данных в рабочей области Azure Databricks, сделайте следующее:

  1. Следуйте инструкциям сторонних разработчиков, чтобы скачать набор данных в виде CSV-файла на локальный компьютер.
  2. Отправьте CSV-файл с локального компьютера в рабочую область Azure Databricks.
  3. Чтобы работать с импортированными данными, используйте Databricks SQL для запроса данных. Также можно использовать ноутбук для загрузки данных в формате DataFrame.

Сторонние примеры наборов данных в библиотеках

Некоторые третьи стороны включают примеры наборов данных в библиотеках, таких как пакеты индексов пакетов Python (PyPI) или комплексные пакеты архивной сети R (CRAN). Дополнительные сведения см. в документации поставщика библиотеки.

Наборы данных Databricks (databricks-datasets), подключенные к DBFS

Azure Databricks рекомендует избегать использования DBFS и подключенного облачного хранилища объектов для большинства вариантов использования в рабочих областях Databricks с включённым Unity Catalog. Некоторые примеры наборов данных, подключенных к DBFS , доступны в Azure Databricks

Примечание.

Доступность и расположение наборов данных Databricks могут изменяться без уведомления.

Обзор подключенных наборов данных Databricks DBFS

Чтобы просмотреть эти файлы из записной книжки Python, Scala или R, можно использовать справочник по служебным программам Databricks (dbutils). В следующем коде перечислены все доступные наборы данных Databricks.

Питон

display(dbutils.fs.ls('/databricks-datasets'))

язык программирования Scala

display(dbutils.fs.ls("/databricks-datasets"))

Р

%fs ls "/databricks-datasets"