Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Вы можете создать и запустить задание с помощью пользовательского интерфейса заданий или средств разработчика, таких как CLI Databricks или REST API. С помощью пользовательского интерфейса или API можно восстановить и повторно запустить неисправное или отмененное задание. В этой статье показано, как создавать, настраивать и изменять задания с помощью пользовательского интерфейса рабочей области "Задания и конвейеры ". Дополнительные сведения о других средствах см. в следующих статьях:
- Дополнительные сведения об использовании интерфейса командной строки Databricks для создания и запуска заданий см. в статье Databricks CLI.
- Дополнительные сведения об использовании API заданий для создания и выполнения процессов смотрите в разделе Задания справочника по REST API.
- Если вы предпочитаете подход инфраструктуры как кода (IaC) к настройке заданий, можно использовать декларативные пакеты автоматизации. Дополнительные сведения об использовании пакетов для настройки и оркестрации заданий см. в разделе "Декларативные пакеты автоматизации".
- Сведения о том, как выполнять и планировать задания непосредственно в записной книжке Databricks, см. в статье "Создание запланированных заданий записной книжки и управление ими".
Подсказка
Чтобы просмотреть задание как YAML, щелкните меню опций слева от Запустить сейчас для задания, а затем выберите Переключиться на версию кода (YAML).
Минимальная конфигурация для задания
Для всех заданий в Azure Databricks требуется следующее:
- Задача, содержащая логику для выполнения, например ноутбук Databricks. См. статью "Настройка и изменение задач" в заданиях Lakeflow
- Вычислительный ресурс для выполнения логики. Вычислительный ресурс может быть бессерверным вычислением, вычислением для классических заданий или универсальным вычислением. См. раздел "Настройка вычислений для заданий".
- Указанное расписание для выполнения задания. При необходимости можно опустить расписание и запустить задание вручную.
- Уникальное имя.
Создайте новое задание
В этом разделе описаны шаги по созданию нового задания с использованием задачи в записной книжке и запланировать его с помощью пользовательского интерфейса рабочей области.
Задания содержат одну или несколько задач. Вы создаёте новое задание, настраивая первую задачу для этого задания.
Примечание.
Каждый тип задачи имеет динамические параметры конфигурации в пользовательском интерфейсе рабочей области. См. Конфигурация и редактирование задач в заданиях Lakeflow.
- В рабочей области щелкните на
Задания и конвейеры на боковой панели.
- Нажмите кнопку "Создать", а затем "Задание".
- Щелкните плитку Notebook , чтобы настроить первую задачу. Если плитка "Записная книжка недоступна", нажмите кнопку "Добавить другой тип задачи " и найдите записную книжку.
- Введите имя задачи.
- Выберите записную книжку для поля пути.
- Нажмите кнопку " Сохранить задачу".
Если для вашей рабочей области не настроены бессерверные вычисления для заданий, необходимо выбрать параметр вычислительных ресурсов. Databricks рекомендует всегда использовать вычисления заданий при настройке задач.
Новое задание отображается в списке заданий рабочей области с именем по умолчанию New Job <date> <time>.
Вы можете продолжать добавлять дополнительные задачи в одном задании, если это необходимо для рабочего процесса. Задания с более чем 100 задачами могут иметь особые требования. Дополнительные сведения см. в разделе "Задания" с большим количеством задач.
Планирование задания
Вы можете решить, когда задание выполняется. По умолчанию он выполняется только при запуске вручную, но его также можно настроить для автоматического запуска. Вы можете создать триггер для запуска задания по расписанию или на основе события.
Управление потоком задач в задании
При настройке нескольких задач в заданиях можно использовать специализированные задачи для управления выполнением задач. См. раздел "Управление потоком задач" в заданиях Lakeflow.
Выберите задачу для редактирования в рабочей области
Чтобы изменить существующее задание с помощью пользовательского интерфейса рабочей области, сделайте следующее:
- На боковой панели рабочей области Azure Databricks щелкните
Jobs & Конвейеры . - При необходимости выберите фильтры "Задания " и " Принадлежащие мне ".
- Щелкните по ссылке с названием вашей работы.
Используйте пользовательский интерфейс заданий для выполнения следующих действий:
- Изменение настроек задания
- Переименование, клонирование или удаление задания
- Добавление новых задач в существующее задание
- Изменение параметров задачи
Примечание.
Вы также можете просмотреть определения JSON для использования с REST API получения, созданияи сброса точек доступа.
Изменение параметров задания
На боковой панели содержатся сведения о задании. Можно изменить расписание задания или триггер, параметры задания, конфигурацию вычислений, теги, уведомления, максимальное количество одновременных запусков, пороговые значения длительности и параметры Git. Кроме того, можно изменять разрешения задания, если включено управление доступом к заданиям.
Добавление параметров ко всем задачам
Параметры, настроенные на уровне задания, передаются задачам задания, принимаюющим параметры значения ключа, включая Python файлы колес, настроенные для принятия аргументов ключевых слов. См . статью "Параметризация заданий".
Добавление тегов в задание
Чтобы добавить метки или атрибуты key-value в задание, можно добавить теги при редактировании задания. Теги можно использовать для фильтрации заданий в списке заданийdepartment тег для фильтрации всех заданий, принадлежащих определенному отделу.
Примечание.
Так как теги заданий не предназначены для хранения конфиденциальных данных, таких как персональные данные или пароли, Databricks рекомендует использовать теги только для нечувствительных значений.
Теги также распространяются на кластеры заданий, созданные при запуске задания, что позволяет использовать теги с существующим механизмом мониторинга кластера.
Щелкните Тег в боковой области сведений о задании для добавления или редактирования тегов. Тег можно добавить как метку или как пару "ключ-значение". Чтобы добавить метку, введите метку в поле Ключ, а поле Значение оставьте пустым.
Использование Git с заданиями
Вы можете настроить задачи задания для получения исходного кода непосредственно из удаленного репозитория Git. Инструкции и рекомендации, включая разреженную проверку для больших репозиториев, см. в разделе "Использование Git с заданиями Lakeflow".
Добавление политики бессерверного использования в задание
Если в рабочей области используются бессерверные политики использования для атрибута бессерверного использования, можно выбрать политику бессерверного использования задания с помощью параметра политики использования на боковой панели сведений о задании . См. раздел "Использование атрибутов с бессерверными политиками".
Переименование, клонирование или удаление задания
Чтобы переименовать задание, перейдите в пользовательский интерфейс заданий, щелкните имя задания и введите новое имя.
Чтобы быстро создать новое задание, можно клонировать уже существующее. Клонирование задания создает идентичную копию задания, за исключением идентификатора задания. Чтобы клонировать работу, сделайте следующее:
- Щелкните
Задания и конвейеры на левой боковой панели.
- Щелкните имя задания, которое нужно клонировать, чтобы открыть пользовательский интерфейс заданий.
- Щелкните
Рядом с кнопкой "Запустить".
- Выберите задание клонирования в раскрывающемся меню.
- Введите имя клонированной задачи.
- Нажмите Клонировать.
Удаление задания
Чтобы удалить задание, перейдите на страницу задания, щелкните Рядом с именем задания и выберите "Удалить задание " в раскрывающемся меню.
Настройка пороговых значений для длительности выполнения заданий или метрик отставания потоковой обработки
Это важно
Наблюдаемость потоковой передачи для заданий Lakeflow доступна в общедоступной предварительной версии.
Можно настроить необязательные пороговые значения для длительности выполнения задания или метрик отставания потока. Чтобы настроить пороговые значения длительности или метрик потоковой передачи, нажмите Пороговые значения длительности и отставания потоковой передачи на панели Сведения о задании.
Чтобы настроить пороговые значения длительности задания, включая ожидаемое и максимальное время завершения, выберите Длительность выполнения в раскрывающемся меню Метрика. Введите длительность в поле "Предупреждение" , чтобы настроить ожидаемое время завершения задания. Если задание превышает это пороговое значение, активируется событие. Это событие можно использовать для уведомления о медленном выполнении задания. См. раздел Настройка уведомлений для медленных заданий. Чтобы настроить максимальное время завершения задания, введите максимальную длительность в поле "Время ожидания ". Если задание не завершено в это время, Azure Databricks задает для него значение Timed Out.
Чтобы настроить пороговое значение для метрики отставания потоковой передачи, выберите метрику в раскрывающемся меню Метрика и введите значение порога. Дополнительные сведения о конкретных метриках, поддерживаемых источником потоковой передачи, см. в разделе Просмотр метрик для задач потоковой передачи.
Если событие активируется из-за превышения порогового значения, можно использовать событие для отправки уведомления. См. раздел Настройка уведомлений для медленных заданий.
При необходимости можно указать пороговые значения длительности для задач. Смотрите настройку порогов для продолжительности выполнения задач или метрик потока невыполненных задач.
Включение очереди запусков заданий
Примечание.
Очередь включена по умолчанию для заданий, созданных с помощью пользовательского интерфейса после 15 апреля 2024 г.
Чтобы предотвратить пропуск выполнения задания из-за ограничений параллелизма, можно включить очередь для задания. Если включена очередь, выполнение задания ставится в очередь до 48 часов, если ресурсы недоступны для выполнения задания. Когда емкость доступна, выполнение задания будет отложено и выполняется. Очереди запуска отображаются в списке запусков для задания, а также в списке последних запусков заданий.
Выполнение выполняется в очередь при достижении одного из следующих ограничений:
- Максимальное число параллельных активных процессов в рабочей области.
- Максимальная параллельная
Run Jobзадача выполняется в рабочей области. - Максимальное число параллельных запусков задания.
Очередь — это свойство уровня задания, которое выполняется только для этого задания.
Чтобы включить или отключить очередь, нажмите кнопку "Дополнительные параметры " и нажмите кнопку "Переключатель очереди " на боковой панели сведений о задании .
Настройка максимального числа одновременных запусков
По умолчанию максимальное число одновременных запусков для всех новых заданий равно 1.
Нажмите кнопку "Изменить параллельные запуски " в разделе "Дополнительные параметры", чтобы задать максимальное количество параллельных запусков этого задания.
Azure Databricks пропускает выполнение, если задание уже достигло максимального количества активных запусков при попытке запустить новый запуск.
Задайте это значение выше 1, чтобы разрешить несколько одновременных запусков одного задания. Это полезно, например, если вы запускаете задание по частому расписанию и хотите допустить перекрытие последовательных запусков или инициировать несколько запусков, различающихся входными параметрами.