DatasetConsumptionConfig Класс
Представляет, как доставлять набор данных в целевой объект вычислений.
Представляет, как доставлять набор данных целевому объекту вычислений.
Конструктор
DatasetConsumptionConfig(name, dataset, mode='direct', path_on_compute=None)
Параметры
| Имя | Описание |
|---|---|
|
name
Обязательно
|
Имя набора данных в выполнении, которое может отличаться от зарегистрированного имени. Имя будет зарегистрировано в качестве переменной среды и может использоваться в плоскости данных. |
|
dataset
Обязательно
|
Набор данных, который будет использоваться в ходе выполнения. |
|
mode
|
Определяет способ доставки набора данных в целевой объект вычислений. Существует три режима:
Default value: direct
|
|
path_on_compute
|
Целевой путь к вычислительным ресурсам, чтобы сделать данные доступными. Однако структура папок исходных данных будет сохранена, мы можем добавить префиксы в эту структуру папок, чтобы избежать конфликтов. Используется Default value: None
|
|
name
Обязательно
|
Имя набора данных в выполнении, которое может отличаться от зарегистрированного имени. Имя будет зарегистрировано в качестве переменной среды и может использоваться в плоскости данных. |
|
dataset
Обязательно
|
Dataset или
PipelineParameter или
tuple(Workspace, str) или
tuple(Workspace, str, str) или
OutputDatasetConfig
Набор данных, который необходимо доставить в виде объекта набора данных, параметра конвейера, который выполняет прием набора данных, кортежа (рабочей области, имени набора данных) или кортежа (рабочая область, имя набора данных, версия набора данных). Если указано только имя, datasetConsumptionConfig будет использовать последнюю версию набора данных. |
|
mode
Обязательно
|
Определяет способ доставки набора данных в целевой объект вычислений. Существует три режима:
|
|
path_on_compute
Обязательно
|
Целевой путь к вычислительным ресурсам, чтобы сделать данные доступными. Однако структура папок исходных данных будет сохранена, мы можем добавить префиксы в эту структуру папок, чтобы избежать конфликтов. Рекомендуется вызывать tabular_dataset.to_path , чтобы просмотреть структуру выходной папки. |
Методы
| as_download |
Задайте для скачивания режим. В отправленном запуске файлы в наборе данных будут загружены в локальный путь к целевому объекту вычислений. Расположение скачивания можно получить из значений аргументов и поля input_datasets контекста выполнения.
|
| as_hdfs |
Задайте для режима hdfs. В отправленном запуске synapse файлы в наборах данных будут преобразованы в локальный путь к целевому объекту вычислений. Путь hdfs можно получить из значений аргументов и переменных среды ос.
|
| as_mount |
Установите для подключения режим. В отправленном запуске файлы в наборах данных будут подключены к локальному пути к целевому объекту вычислений. Точку подключения можно получить из значений аргументов и поля input_datasets контекста выполнения.
|
as_download
Задайте для скачивания режим.
В отправленном запуске файлы в наборе данных будут загружены в локальный путь к целевому объекту вычислений. Расположение скачивания можно получить из значений аргументов и поля input_datasets контекста выполнения.
file_dataset = Dataset.File.from_files('https://dprepdata.blob.core.windows.net/demo/Titanic.csv')
file_pipeline_param = PipelineParameter(name="file_ds_param", default_value=file_dataset)
dataset_input = DatasetConsumptionConfig("input_1", file_pipeline_param).as_download()
experiment.submit(ScriptRunConfig(source_directory, arguments=[dataset_input]))
# Following are sample codes running in context of the submitted run:
# The download location can be retrieved from argument values
import sys
download_location = sys.argv[1]
# The download location can also be retrieved from input_datasets of the run context.
from azureml.core import Run
download_location = Run.get_context().input_datasets['input_1']
as_download(path_on_compute=None)
Параметры
| Имя | Описание |
|---|---|
|
path_on_compute
|
Целевой путь к вычислительным ресурсам, чтобы сделать данные доступными. Default value: None
|
Комментарии
При создании набора данных из пути к одному файлу расположение скачивания будет путь к одному скачанном файлу. В противном случае расположение скачивания будет путь к заключающей папке для всех скачанных файлов.
Если path_on_compute начинается с /, он будет рассматриваться как абсолютный путь. Если он не начинается с /, он будет рассматриваться как относительный путь относительно рабочего каталога. Если вы указали абсолютный путь, убедитесь, что задание имеет разрешение на запись в этот каталог.
as_hdfs
Задайте для режима hdfs.
В отправленном запуске synapse файлы в наборах данных будут преобразованы в локальный путь к целевому объекту вычислений. Путь hdfs можно получить из значений аргументов и переменных среды ос.
file_dataset = Dataset.File.from_files('https://dprepdata.blob.core.windows.net/demo/Titanic.csv')
file_pipeline_param = PipelineParameter(name="file_ds_param", default_value=file_dataset)
dataset_input = DatasetConsumptionConfig("input_1", file_pipeline_param).as_hdfs()
experiment.submit(ScriptRunConfig(source_directory, arguments=[dataset_input]))
# Following are sample codes running in context of the submitted run:
# The hdfs path can be retrieved from argument values
import sys
hdfs_path = sys.argv[1]
# The hdfs path can also be retrieved from input_datasets of the run context.
import os
hdfs_path = os.environ['input_1']
as_hdfs()
Комментарии
При создании набора данных из пути к одному файлу путь hdfs будет путь к одному файлу. В противном случае путь hdfs будет путь к заключающей папке для всех подключенных файлов.
as_mount
Установите для подключения режим.
В отправленном запуске файлы в наборах данных будут подключены к локальному пути к целевому объекту вычислений. Точку подключения можно получить из значений аргументов и поля input_datasets контекста выполнения.
file_dataset = Dataset.File.from_files('https://dprepdata.blob.core.windows.net/demo/Titanic.csv')
file_pipeline_param = PipelineParameter(name="file_ds_param", default_value=file_dataset)
dataset_input = DatasetConsumptionConfig("input_1", file_pipeline_param).as_mount()
experiment.submit(ScriptRunConfig(source_directory, arguments=[dataset_input]))
# Following are sample codes running in context of the submitted run:
# The mount point can be retrieved from argument values
import sys
mount_point = sys.argv[1]
# The mount point can also be retrieved from input_datasets of the run context.
from azureml.core import Run
mount_point = Run.get_context().input_datasets['input_1']
as_mount(path_on_compute=None)
Параметры
| Имя | Описание |
|---|---|
|
path_on_compute
|
Целевой путь к вычислительным ресурсам, чтобы сделать данные доступными. Default value: None
|
Комментарии
При создании набора данных из пути к одному файлу точка подключения будет путь к одному подключенному файлу. В противном случае точка подключения будет путь к заключающей папке для всех подключенных файлов.
Если path_on_compute начинается с /, он будет рассматриваться как абсолютный путь. Если он не начинается с /, он будет рассматриваться как относительный путь относительно рабочего каталога. Если вы указали абсолютный путь, убедитесь, что задание имеет разрешение на запись в этот каталог.
Атрибуты
name
Имя входных данных.
Возвращаемое значение
| Тип | Описание |
|---|---|
|
Имя входных данных. |