Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Существует множество примеров наборов данных, предоставляемых Azure Databricks и предоставляемых сторонними лицами, которые можно использовать в рабочей области Azure Databricks.
Наборы данных каталога Unity
Каталог Unity предоставляет доступ к ряду примеров наборов данных в каталоге samples . Эти наборы данных можно просмотреть в пользовательском интерфейсе обозревателя каталогов и ссылаться на них непосредственно в записной книжке или в редактореSQL с помощью <catalog-name>.<schema-name>.<table-name> шаблона.
В следующей таблице перечислены доступные схемы в каталоге samples :
| Набор данных | Описание |
|---|---|
databricks |
Примеры файловых наборов данных для построения конвейеров обработки данных в томе datasets. |
nyctaxi |
Записи поездок на такси в Нью-Йорке. |
tpcds_sf1 |
Небольшой набор данных (примерно 1 ГБ) из теста TPC-DS. |
tpch |
Масштабируемый набор данных (примерно 1 ТБ) из TPC-H Benchmark. |
wanderbricks |
Симулированная платформа бронирования путешествий с пользователями, объектами размещения, бронированиями, отзывами и многим другим. |
датабрикс
Схема databricks содержит том datasets, в котором размещена коллекция файловых наборов данных, предоставляемых Azure Databricks, которые можно использовать для создания и тестирования конвейеров данных. Чтобы получить список доступных наборов данных, выполните следующую команду:
SQL
LIST '/Volumes/samples/databricks/datasets/'
Питон
display(dbutils.fs.ls("/Volumes/samples/databricks/datasets/"))
nyctaxi
Схема nyctaxi содержит таблицу trips, которая содержит сведения о поездках на такси в Нью-Йорке. В следующем примере возвращаются первые 10 записей в этой таблице:
SQL
SELECT * FROM samples.nyctaxi.trips LIMIT 10
Питон
display(spark.read.table("samples.nyctaxi.trips").limit(10))
tpcds_sf1
Схема tpcds_sf1 содержит данные из тестаTPC-DS. Чтобы получить список таблиц в этой схеме, выполните следующую команду:
SQL
SHOW TABLES IN samples.tpcds_sf1;
Питон
display(spark.sql("SHOW TABLES IN samples.tpcds_sf1"))
Дополнительные рекомендации по использованию этого набора данных для оценки производительности системы см. в разделе "Использование примера набора данных TPC-DS для оценки производительности системы".
tpch
Схема tpch содержит данные из TPC-H Benchmark. Чтобы получить список таблиц в этой схеме, выполните следующую команду:
SQL
SHOW TABLES IN samples.tpch
Питон
display(spark.sql("SHOW TABLES IN samples.tpch"))
wanderbricks
Схема wanderbricks содержит имитированный набор данных платформы бронирования путешествий. Дополнительные сведения о таблицах наборов данных см. в wanderbricks разделе Wanderbricks dataset.
Сторонние примеры наборов данных в формате CSV
Azure Databricks имеет встроенные средства для быстрого отправки сторонних примеров наборов данных в виде файлов с разделием запятыми (CSV) в рабочие области Azure Databricks. Некоторые популярные сторонние примеры наборов данных, доступные в формате CSV:
| Пример набора данных | Скачивание примера набора данных в виде CSV-файла... |
|---|---|
| Перепись белка | На веб-странице "Данные" щелкните "Парк данных", Squirrel Data или Сюжеты. |
| Коллекция наборов данных OWID | В репозитории GitHub щелкните папку наборов данных. Щелкните вложенную папку, содержащую целевой набор данных, и выберите CSV-файл набора данных. |
| наборы данных DATA.GOV CSV | На веб-странице результатов поиска щелкните целевой результат поиска и рядом с значком CSV нажмите кнопку "Скачать". |
| Алмазы (требуется учетная запись Kaggle) | На веб-странице набора данных на вкладке "Данные " на вкладке "Данные " рядом с diamonds.csvщелкните значок "Скачать ". |
| Длительность поездки в такси Нью-Йорка (требуетсяучетная запись Kaggle ) | На веб-странице набора данных на вкладке Данные, рядом с sample_submission.zip, щелкните Значок скачивания . Чтобы найти CSV-файлы набора данных, извлекает содержимое скачаированного ZIP-файла. |
Чтобы использовать сторонние примеры наборов данных в рабочей области Azure Databricks, сделайте следующее:
- Следуйте инструкциям сторонних разработчиков, чтобы скачать набор данных в виде CSV-файла на локальный компьютер.
- Отправьте CSV-файл с локального компьютера в рабочую область Azure Databricks.
- Чтобы работать с импортированными данными, используйте Databricks SQL для запроса данных. Также можно использовать ноутбук для загрузки данных в формате DataFrame.
Сторонние примеры наборов данных в библиотеках
Некоторые третьи стороны включают примеры наборов данных в библиотеках, таких как пакеты индексов пакетов Python (PyPI) или комплексные пакеты архивной сети R (CRAN). Дополнительные сведения см. в документации поставщика библиотеки.
- Сведения о том, как установить библиотеку в кластере Azure Databricks с помощью пользовательского интерфейса кластера, см. в статье "Библиотеки с областью вычислений".
- Чтобы установить библиотеку Python с помощью записной книжки Azure Databricks, см. раздел Библиотеки Python с областью действия записной книжки.
- Чтобы установить библиотеку R с помощью записной книжки Azure Databricks, см. раздел Библиотеки R для записных книжек.
Наборы данных Databricks (databricks-datasets), подключенные к DBFS
Azure Databricks рекомендует избегать использования DBFS и подключенного облачного хранилища объектов для большинства вариантов использования в рабочих областях Databricks с включённым Unity Catalog. Некоторые примеры наборов данных, подключенных к DBFS , доступны в Azure Databricks
Примечание.
Доступность и расположение наборов данных Databricks могут изменяться без уведомления.
Обзор подключенных наборов данных Databricks DBFS
Чтобы просмотреть эти файлы из записной книжки Python, Scala или R, можно использовать справочник по служебным программам Databricks (dbutils). В следующем коде перечислены все доступные наборы данных Databricks.
Питон
display(dbutils.fs.ls('/databricks-datasets'))
язык программирования Scala
display(dbutils.fs.ls("/databricks-datasets"))
Р
%fs ls "/databricks-datasets"