DatasetConsumptionConfig Класс

Представляет, как доставлять набор данных в целевой объект вычислений.

Представляет, как доставлять набор данных целевому объекту вычислений.

Конструктор

DatasetConsumptionConfig(name, dataset, mode='direct', path_on_compute=None)

Параметры

Имя Описание
name
Обязательно
str

Имя набора данных в выполнении, которое может отличаться от зарегистрированного имени. Имя будет зарегистрировано в качестве переменной среды и может использоваться в плоскости данных.

dataset
Обязательно

Набор данных, который будет использоваться в ходе выполнения.

mode
str

Определяет способ доставки набора данных в целевой объект вычислений. Существует три режима:

  1. Direct: использование набора данных в качестве набора данных.
  2. "скачать": скачайте набор данных и потребляйте набор данных как скачанный путь.
  3. "mount": подключите набор данных и потребляйте набор данных в качестве пути подключения.
  4. Hdfs: использует набор данных из разрешенного пути hdfs (в настоящее время поддерживается только в вычислительных ресурсах SynapseSpark).
Default value: direct
path_on_compute
str

Целевой путь к вычислительным ресурсам, чтобы сделать данные доступными. Однако структура папок исходных данных будет сохранена, мы можем добавить префиксы в эту структуру папок, чтобы избежать конфликтов. Используется tabular_dataset.to_path для просмотра структуры выходной папки.

Default value: None
name
Обязательно
str

Имя набора данных в выполнении, которое может отличаться от зарегистрированного имени. Имя будет зарегистрировано в качестве переменной среды и может использоваться в плоскости данных.

dataset
Обязательно

Набор данных, который необходимо доставить в виде объекта набора данных, параметра конвейера, который выполняет прием набора данных, кортежа (рабочей области, имени набора данных) или кортежа (рабочая область, имя набора данных, версия набора данных). Если указано только имя, datasetConsumptionConfig будет использовать последнюю версию набора данных.

mode
Обязательно
str

Определяет способ доставки набора данных в целевой объект вычислений. Существует три режима:

  1. Direct: использование набора данных в качестве набора данных.
  2. "скачать": скачайте набор данных и потребляйте набор данных как скачанный путь.
  3. "mount": подключите набор данных и потребляйте набор данных в качестве пути подключения.
  4. Hdfs: использует набор данных из разрешенного пути hdfs (в настоящее время поддерживается только в вычислительных ресурсах SynapseSpark).
path_on_compute
Обязательно
str

Целевой путь к вычислительным ресурсам, чтобы сделать данные доступными. Однако структура папок исходных данных будет сохранена, мы можем добавить префиксы в эту структуру папок, чтобы избежать конфликтов. Рекомендуется вызывать tabular_dataset.to_path , чтобы просмотреть структуру выходной папки.

Методы

as_download

Задайте для скачивания режим.

В отправленном запуске файлы в наборе данных будут загружены в локальный путь к целевому объекту вычислений. Расположение скачивания можно получить из значений аргументов и поля input_datasets контекста выполнения.


   file_dataset = Dataset.File.from_files('https://dprepdata.blob.core.windows.net/demo/Titanic.csv')
   file_pipeline_param = PipelineParameter(name="file_ds_param", default_value=file_dataset)
   dataset_input = DatasetConsumptionConfig("input_1", file_pipeline_param).as_download()
   experiment.submit(ScriptRunConfig(source_directory, arguments=[dataset_input]))


   # Following are sample codes running in context of the submitted run:

   # The download location can be retrieved from argument values
   import sys
   download_location = sys.argv[1]

   # The download location can also be retrieved from input_datasets of the run context.
   from azureml.core import Run
   download_location = Run.get_context().input_datasets['input_1']
as_hdfs

Задайте для режима hdfs.

В отправленном запуске synapse файлы в наборах данных будут преобразованы в локальный путь к целевому объекту вычислений. Путь hdfs можно получить из значений аргументов и переменных среды ос.


   file_dataset = Dataset.File.from_files('https://dprepdata.blob.core.windows.net/demo/Titanic.csv')
   file_pipeline_param = PipelineParameter(name="file_ds_param", default_value=file_dataset)
   dataset_input = DatasetConsumptionConfig("input_1", file_pipeline_param).as_hdfs()
   experiment.submit(ScriptRunConfig(source_directory, arguments=[dataset_input]))


   # Following are sample codes running in context of the submitted run:

   # The hdfs path can be retrieved from argument values
   import sys
   hdfs_path = sys.argv[1]

   # The hdfs path can also be retrieved from input_datasets of the run context.
   import os
   hdfs_path = os.environ['input_1']
as_mount

Установите для подключения режим.

В отправленном запуске файлы в наборах данных будут подключены к локальному пути к целевому объекту вычислений. Точку подключения можно получить из значений аргументов и поля input_datasets контекста выполнения.


   file_dataset = Dataset.File.from_files('https://dprepdata.blob.core.windows.net/demo/Titanic.csv')
   file_pipeline_param = PipelineParameter(name="file_ds_param", default_value=file_dataset)
   dataset_input = DatasetConsumptionConfig("input_1", file_pipeline_param).as_mount()
   experiment.submit(ScriptRunConfig(source_directory, arguments=[dataset_input]))


   # Following are sample codes running in context of the submitted run:

   # The mount point can be retrieved from argument values
   import sys
   mount_point = sys.argv[1]

   # The mount point can also be retrieved from input_datasets of the run context.
   from azureml.core import Run
   mount_point = Run.get_context().input_datasets['input_1']

as_download

Задайте для скачивания режим.

В отправленном запуске файлы в наборе данных будут загружены в локальный путь к целевому объекту вычислений. Расположение скачивания можно получить из значений аргументов и поля input_datasets контекста выполнения.


   file_dataset = Dataset.File.from_files('https://dprepdata.blob.core.windows.net/demo/Titanic.csv')
   file_pipeline_param = PipelineParameter(name="file_ds_param", default_value=file_dataset)
   dataset_input = DatasetConsumptionConfig("input_1", file_pipeline_param).as_download()
   experiment.submit(ScriptRunConfig(source_directory, arguments=[dataset_input]))


   # Following are sample codes running in context of the submitted run:

   # The download location can be retrieved from argument values
   import sys
   download_location = sys.argv[1]

   # The download location can also be retrieved from input_datasets of the run context.
   from azureml.core import Run
   download_location = Run.get_context().input_datasets['input_1']
as_download(path_on_compute=None)

Параметры

Имя Описание
path_on_compute
str

Целевой путь к вычислительным ресурсам, чтобы сделать данные доступными.

Default value: None

Комментарии

При создании набора данных из пути к одному файлу расположение скачивания будет путь к одному скачанном файлу. В противном случае расположение скачивания будет путь к заключающей папке для всех скачанных файлов.

Если path_on_compute начинается с /, он будет рассматриваться как абсолютный путь. Если он не начинается с /, он будет рассматриваться как относительный путь относительно рабочего каталога. Если вы указали абсолютный путь, убедитесь, что задание имеет разрешение на запись в этот каталог.

as_hdfs

Задайте для режима hdfs.

В отправленном запуске synapse файлы в наборах данных будут преобразованы в локальный путь к целевому объекту вычислений. Путь hdfs можно получить из значений аргументов и переменных среды ос.


   file_dataset = Dataset.File.from_files('https://dprepdata.blob.core.windows.net/demo/Titanic.csv')
   file_pipeline_param = PipelineParameter(name="file_ds_param", default_value=file_dataset)
   dataset_input = DatasetConsumptionConfig("input_1", file_pipeline_param).as_hdfs()
   experiment.submit(ScriptRunConfig(source_directory, arguments=[dataset_input]))


   # Following are sample codes running in context of the submitted run:

   # The hdfs path can be retrieved from argument values
   import sys
   hdfs_path = sys.argv[1]

   # The hdfs path can also be retrieved from input_datasets of the run context.
   import os
   hdfs_path = os.environ['input_1']
as_hdfs()

Комментарии

При создании набора данных из пути к одному файлу путь hdfs будет путь к одному файлу. В противном случае путь hdfs будет путь к заключающей папке для всех подключенных файлов.

as_mount

Установите для подключения режим.

В отправленном запуске файлы в наборах данных будут подключены к локальному пути к целевому объекту вычислений. Точку подключения можно получить из значений аргументов и поля input_datasets контекста выполнения.


   file_dataset = Dataset.File.from_files('https://dprepdata.blob.core.windows.net/demo/Titanic.csv')
   file_pipeline_param = PipelineParameter(name="file_ds_param", default_value=file_dataset)
   dataset_input = DatasetConsumptionConfig("input_1", file_pipeline_param).as_mount()
   experiment.submit(ScriptRunConfig(source_directory, arguments=[dataset_input]))


   # Following are sample codes running in context of the submitted run:

   # The mount point can be retrieved from argument values
   import sys
   mount_point = sys.argv[1]

   # The mount point can also be retrieved from input_datasets of the run context.
   from azureml.core import Run
   mount_point = Run.get_context().input_datasets['input_1']
as_mount(path_on_compute=None)

Параметры

Имя Описание
path_on_compute
str

Целевой путь к вычислительным ресурсам, чтобы сделать данные доступными.

Default value: None

Комментарии

При создании набора данных из пути к одному файлу точка подключения будет путь к одному подключенному файлу. В противном случае точка подключения будет путь к заключающей папке для всех подключенных файлов.

Если path_on_compute начинается с /, он будет рассматриваться как абсолютный путь. Если он не начинается с /, он будет рассматриваться как относительный путь относительно рабочего каталога. Если вы указали абсолютный путь, убедитесь, что задание имеет разрешение на запись в этот каталог.

Атрибуты

name

Имя входных данных.

Возвращаемое значение

Тип Описание

Имя входных данных.