Просмотр метрик вычислений

В этой статье объясняется, как использовать собственное средство метрики вычислений в пользовательском интерфейсе Azure Databricks для сбора ключевых аппаратных и метрик Spark. Пользовательский интерфейс метрик доступен для универсальных вычислений и вычислений заданий.

Метрики кластера за последние 24 часа

Метрики доступны практически в режиме реального времени с обычной задержкой менее одной минуты. Метрики хранятся в управляемом хранилище Azure Databricks, а не в хранилище клиента.

Бессерверные вычисления для записных книжек и заданий используют аналитические сведения о запросах вместо пользовательского интерфейса метрик. Дополнительные сведения о метриках бессерверных вычислений см. в разделе "Просмотр аналитических сведений о запросах".

Доступ к пользовательскому интерфейсу вычислительных метрик

Чтобы просмотреть пользовательский интерфейс вычислительных метрик, выполните следующие действия.

  1. На боковой панели щелкните Вычислительная среда.
  2. Щелкните вычислительный ресурс, для которого нужно просмотреть метрики.
  3. Перейдите на вкладку "Метрики ".

Аппаратные метрики для всех узлов отображаются по умолчанию. Чтобы просмотреть метрики Spark, нажмите выпадающее меню Аппаратные и выберите Spark. Вы также можете выбрать GPU, если экземпляр поддерживает использование GPU.

Фильтрация метрик по периоду времени

Вы можете просмотреть исторические метрики, выбрав диапазон времени с помощью фильтра средства выбора дат. Метрики собираются каждую минуту, поэтому можно фильтровать по любому диапазону дня, часа или минуты за последние 30 дней. Щелкните значок календаря, чтобы выбрать из предопределенных диапазонов данных или щелкните внутри текстового поля, чтобы определить пользовательские значения.

Примечание.

Интервалы времени, отображаемые в диаграммах, корректируются на основе времени просмотра. Большинство метрик являются средними на основе интервала времени, который вы просматриваете в настоящее время.

Вы также можете получить последние метрики, нажав кнопку Обновить.

Просмотр метрик на уровне узла

По умолчанию на странице метрик отображаются метрики для всех узлов в кластере (включая драйвер) в среднем за период времени.

Метрики для отдельных узлов можно просмотреть, щелкнув раскрывающееся меню "Все узлы " и выбрав узел, для которого нужно просмотреть метрики. Метрики GPU доступны только на уровне отдельного узла. Метрики Spark недоступны для отдельных узлов.

Чтобы помочь выявить выбивающиеся из общего ряда узлы в кластере, вы также можете просмотреть метрики для всех отдельных узлов на одной странице. Чтобы получить доступ к этому представлению, щелкните раскрывающееся меню "Все узлы " и выберите "По узлу", а затем выберите подкатегорию метрик, которую вы хотите просмотреть.

Метрики кластера по узлам за последние 24 часа

Скачивание данных диаграммы

Чтобы экспортировать данные для отдельной диаграммы, нажмите на меню переполнения () в правом верхнем углу диаграммы, затем выберите «Скачать CSV» или «Скачать Excel». Экспорт содержит одну строку на каждую метку времени для каждой метрики, отображаемой на графике, соответствующей категории, узлу и текущему временному диапазону.

Загрузки доступны для всех графиков, кроме вида узла By .

Графики метрик аппаратного обеспечения

Для просмотра в пользовательском интерфейсе вычислительных метрик доступны следующие аппаратные диаграммы метрик:

  • Использование ЦП и активные узлы: график линии отображает количество активных узлов при каждом метке времени для заданного вычисления. Столбчатая диаграмма отображает процент времени, которое процессор затратил в каждом режиме, на основе общего времени работы процессора в секундах. Ниже перечислены отслеживаемые режимы.
    • guest: если вы запускаете виртуальные машины, используемый этими виртуальными машинами процессор
    • iowait: время ожидания ввода-вывода
    • idle: время простоя ЦП
    • irq: время, затраченное на запросы прерываний
    • nice: время, используемое процессами, которые имеют положительную приятность, что означает более низкий приоритет, чем другие задачи
    • softirq: время, затраченное на запросы на прерывание программного обеспечения
    • steal: если вы виртуальная машина, то время, отнятое другими виртуальными машинами с вашей ЦП
    • system: время, проведённое в режиме ядра
    • user: время, затраченное в пользовательском пространстве
  • Использование памяти контейнера: память, потребляемая контейнером Spark, в среднем по всем применимым узлам. Включает средние значения нераспределяемой памяти (Container memory used), файлового кэша страниц ОС (Container memory file cache) и настроенного предела памяти (Container memory limit).
  • Использование кучи JVM: среднее использование кучи JVM по всем применимым узлам. Включает среднее фактическое использование кучи, емкость кучи и настроенный максимальный предел кучи.
  • Полученные и переданные данные сети: количество байтов, полученных и переданных через сеть каждым устройством.
  • Свободное пространство файловой системы: общее использование файловой системы по каждой точке подключения, измеряемой в байтах.

Диаграммы метрик Spark

Для просмотра в пользовательском интерфейсе вычислительных метрик доступны следующие диаграммы метрик Spark:

  • Распределение нагрузки сервера: эти плитки показывают использование ЦП за последнюю минуту для каждого узла в вычислительном ресурсе. Каждая плитка — это ссылка на страницу метрик отдельного узла.
  • Активные задачи: общее количество выполняемых задач в любое время.
  • Общее количество неудачных задач: общее количество задач, которые завершились сбоем в исполнителях.
  • Общее количество завершенных задач: количество задач, завершенных исполнителями.
  • Общее количество задач: общее количество всех задач (выполнение, сбой и завершение) в исполнителях.
  • Общий объем данных, считанных при перемешивании: общий размер данных, измеряемый в байтах. Shuffle read означает сумму сериализованных данных чтения на всех узлах-исполнителях в начале этапа.
  • Общий объем записанных данных при распределении: Общий размер данных, записанных при распределении, измеряемый в байтах. Shuffle Write — это сумма всех записанных сериализованных данных для всех исполнителей перед передачей (обычно в конце этапа).
  • Общая длительность задачи: общее время, затраченное на выполнение задач на исполнителях, измеряемое в секундах.

Диаграммы метрик GPU

Примечание.

Метрики GPU доступны только в Databricks Runtime ML 13.3 и выше.

Для просмотра в пользовательском интерфейсе вычислительных метрик доступны следующие диаграммы метрик GPU:

  • Распределение нагрузки сервера: на этой диаграмме показана загрузка ЦП за последнюю минуту для каждого узла.
  • Использование декодера на каждый GPU: процент использования декодера GPU.
  • Использование кодировщика по каждому GPU: процент использования кодировщика GPU.
  • Использование памяти буфера кадров на GPU в байтах: использование памяти буфера кадров, измеряемое в байтах.
  • Использование памяти на один GPU: процент использования памяти GPU.
  • Per-GPU использование: процент использования GPU.

Устранение неполадок

Если в течение периода отображаются неполные или отсутствующие метрики, это может быть одно из следующих проблем:

  • Сбой в службе Databricks, ответственной за запросы и хранение метрик.
  • Проблемы с сетью на стороне клиента.
  • Вычислительная система находится или находилась в неработоспособном состоянии.