Задача блокнота для работы

Используйте задачу ноутбука для развертывания ноутбуков Databricks.

Requirements

  • Блокнот должен находиться в месте, доступном пользователю, настраивающему задание.

Настройка задачи записной книжки

Note

Пользовательский интерфейс заданий динамически отображает параметры на основе других настроенных параметров.

Чтобы начать процесс настройки Notebook задачи, выполните следующие действия.

  1. Перейдите на вкладку "Задачи " в пользовательском интерфейсе заданий.
  2. Щелкните значок Добавьте задачу.
  3. Введите имя в поле "Имя задачи ".
  4. В раскрывающемся меню Тип выберите Notebook.

Настройка источника

В раскрывающемся меню "Источник " выберите расположение записной книжки с помощью одного из следующих параметров.

Workspace

Используйте рабочую область для настройки записной книжки, хранящейся в рабочей области, выполнив следующие действия:

  1. Щелкните поле "Путь". Откроется диалоговое окно Выбор записной книжки.
  2. Перейдите к записной книжке, щелкните, чтобы выделить файл и нажмите кнопку "Подтвердить".

Note

Этот параметр можно использовать для настройки задачи для записной книжки, хранящейся в папке Databricks Git. Databricks рекомендует использовать опцию поставщика Git и удаленный репозиторий Git для версионирования ресурсов, запланированных заданиями.

Поставщик Git

Используйте Git-сервис для настройки записной книжки в удаленном репозитории Git.

Параметры, отображаемые пользовательским интерфейсом, зависят от того, настроен ли поставщик Git в другом месте. Для всех задач в задании можно использовать только один удаленный репозиторий Git. См. статью "Использование Git с заданиями Lakeflow".

Это важно

Блокноты, созданные задачами Lakeflow, которые запускаются из удаленных репозиториев Git, являются временными и не могут использоваться для отслеживания запусков MLflow, экспериментов или моделей. При создании записной книжки из задания используйте эксперимент MLflow в рабочей области (вместо эксперимента MLflow в записной книжке) и вызовите mlflow.set_experiment("/path/to/experiment") в записной книжке рабочей области перед выполнением любого кода отслеживания MLflow. Дополнительные сведения см. в статье "Предотвращение потери данных в экспериментах MLflow".

Поле "Путь" отображается после настройки ссылки на git.

Введите относительный путь для записной книжки, например etl/bronze/ingest.py.

Это важно

При вводе относительного пути не начинайте с / или ./. Например, если абсолютный путь к записной книжке, к которой вы хотите получить доступ, — это /etl/bronze/ingest.py, введите etl/bronze/ingest.py в поле Path.

Настройка вычислительных и зависимых библиотек

Note

Вы можете выбрать хранилище SQL в качестве вычислительных ресурсов для задачи записной книжки, только если записная книжка написана полностью в SQL и SQL в качестве языка по умолчанию. Если записная книжка использует другой язык по умолчанию или смешивает языки, выберите кластер или другие поддерживаемые вычислительные ресурсы.

  1. Используйте Compute, чтобы выбрать или настроить кластер, который поддерживает выполнение логики в вашей записной книжке.
  2. Если вы используете вычислительные мощности Serverless, устанавливайте библиотеки непосредственно в ноутбуке с помощью панели среды или с помощью %pip install. См. Настройте бессерверную среду.
  3. Для всех остальных конфигураций вычислений щелкните значок Добавьте в зависимые библиотеки. Откроется диалог "Добавить зависимые библиотеки".
    • Вы можете выбрать существующую библиотеку или отправить новую библиотеку.
    • Вы можете использовать только библиотеки, хранящиеся в расположении, поддерживаемом конфигурациями вычислений. См. поддержка библиотеки Python.
    • Каждый источник библиотеки имеет другой поток для выбора или отправки библиотеки. См. раздел "Установка библиотек".

Завершение настройки задания

  1. (Необязательно) Настройте параметры в виде пар "ключ-значение", к которым можно получить доступ в ноутбуке с помощью dbutils.widgets. См. раздел "Настройка параметров задачи".
  2. (Необязательно) Сведения о настройке повторных попыток, значений длительности выполнения или пороговых значений невыполненной работы потоковой передачи или уведомлений см. в разделе "Дополнительные параметры задач".
  3. Нажмите кнопку " Сохранить задачу".

Чтобы изменить, клонировать, отключить или удалить эту задачу, см. статью "Настройка и изменение задач в заданиях Lakeflow".

Подготовка визуальных данных

Подготовка визуальных данных в раскрывающемся списке "Тип задачи" создает задачу записной книжки для файла подготовки визуальных данных. Эти файлы создаются на визуальном холсте в конструкторе Lakeflow, который сохраняет каждую из них в виде записной книжки с именем <name>.designer.ipynb. Чтобы запустить его в качестве задания, добавьте задачу блокнота и выберите в качестве источника файл .designer.ipynb. См. конструктор Lakeflow.

Limitations

Общий объем выходных данных ячейки записной книжки (объединенные выходные данные всех ячеек записной книжки) подлежит ограничению размера в 30 МБ. Кроме того, отдельные выходные данные ячеек подвергаются ограничению размера 8 МБ. Если общий объем выходных данных ячейки превышает 30 МБ или если выходные данные отдельной ячейки больше 8 МБ, выполнение отменяется и помечается как неудачное.

Если вам нужна помощь по поиску ячеек вблизи или за пределами лимита, запустите записную книжку в универсальном кластере и используйте метод автосохранения записной книжки.

Дополнительные ресурсы