Проблемы Azure Monitor

Агент Azure Copilot Observability помогает выявлять, исследовать и объяснять ухудшения в работе сервисов. При возникновении таких ухудшений часто требуется сохранить контекст, поделиться результатами с командой и продолжать работать над проблемой с течением времени.

Проблема — это постоянная запись, которая делает это возможным. Он сохраняет связанные сигналы вместе и предоставляет вашей команде общее место для продолжения устранения неполадок, а не начиная с отдельных оповещений, ресурсов или сеансов исследования.

Проблемы в сравнении с оповещениями

Оповещения и проблемы служат различным целям.

Оповещение представляет определенный сигнал, наблюдаемый на ресурсе. Он активируется, когда отслеживаемые данные соответствуют условиям правила генерации оповещений.

Проблема заключается в постоянной записи, используемой для изучения, управления и устранения ухудшения службы. Хотя оповещения помогают выявить отдельные симптомы, проблемы помогают командам понять и управлять более широкой операционной проблемой. Одна проблема может охватывать несколько оповещений и ресурсов, предоставляя единое представление инцидента на протяжении всего жизненного цикла.

Как создаются проблемы

Вы можете создать проблему двумя способами:

  • Из результатов глубокого исследования, если вы хотите продолжить работу, используя контекст, созданный исследованием агента наблюдаемости. Сведения о сценарии исследования, запускаемого пользователем, см. в разделе Подробные исследования в агенте наблюдаемости Azure Copilot.
  • Автономно, когда агент наблюдения Azure Copilot выполняет автономные операции в фоновом режиме. В зависимости от конфигурации агент может создавать проблемы, объединяя связанные оповещения в единый инцидент или преобразуя отдельные важные оповещения в проблемы. Для пути фоновой корреляции см. Автономные операции в агенте Azure Copilot для наблюдаемости.

Каждая проблема сохраняется в рабочей области Azure Monitor (AMW).

Чтобы создать задачу, вам потребуется роль Автора, Автора мониторинга или Создателя задач в рабочей области Azure Monitor. Дополнительные сведения об управлении ролями см. в статье "Назначение ролей Azure" с помощью портала Azure.

Что содержит обращение

Проблема сохраняет контекст ухудшения службы при переходе от первоначального обнаружения к текущему расследованию и реагированию. В зависимости от того, как была создана проблема, она может включать:

  • Метаданные проблемы, такие как название, уровень серьезности, состояние и время воздействия.
  • Фоновая информация, которая обобщает проблему, ее влияние и контекст, собранный до сих пор.
  • Расследования, выполняемые агентом наблюдаемости Azure Copilot, включая результаты расследования, анализ, рекомендуемые дальнейшие шаги и возможность продолжить доработку расследования с помощью агента наблюдаемости.
  • Связанные оповещения , связанные с проблемой.
  • Связанные ресурсы , затронутые или подключенные к проблеме.

Эта модель использует инциденты как устойчивую точку передачи между расследованием, выполняемым агентом, и рабочим процессом реагирования человека.

Просмотр проблем

Список проблем можно просмотреть в следующих расположениях:

  • Azure Monitor — отображает проблемы во всех рабочих областях Azure Monitor (AMWs) в выбранных подписках.
  • Рабочая область Azure Monitor — отображает проблемы, хранящиеся в определенном AMW.

Рабочая область Azure Monitor в качестве контейнера проблем

Рабочие области Azure Monitor (AMWs) выполняют роль контейнеров для проблем.

Вы можете настроить AMW в качестве контейнера по умолчанию для всех задач в подписке. При настройке AMW по умолчанию процесс исследования сохраняет проблемы в той же рабочей области при срабатывании оповещений о ресурсах в этой подписке. Сохранение их в одной рабочей области помогает гарантировать, что все связанные проблемы хранятся и управляются в согласованном расположении.

Чтобы узнать, как связать подписку с рабочей областью Azure Monitor, см. статью Использование проблем Azure Monitor.

Ниже приведен пример проблемы, содержащейся в AMW.

Снимок экрана: рабочая область Azure Monitor, содержащая проблемы.

Действия по проблеме

Когда обращение создается или обновляется, действия с обращением позволяют запускать уведомления или автоматизированные рабочие процессы на этом этапе процесса обработки. Поскольку действия основаны на коррелированных и обогащенных проблемах, а не на отдельных оповещениях, они несут консолидированный контекст: серьезность, затронутые ресурсы и результаты исследования. Это дает подчиненным рабочим процессам достаточно информации, чтобы применить целевые, согласованные ответы, а не реагировать на изолированные сигналы.

При активации уведомлений

Уведомления отправляются в следующих ситуациях:

  • Создается новая задача — либо в результате сохраненного расследования, либо автономным агентом.
  • Существующая проблема обновляется , когда изменяется серьезность или состояние проблемы.

Поддерживаемые типы действий

Поддерживаются следующие типы действий:

  • Электронная почта (отдельные получатели или роли Azure Resource Manager)
  • SMS/текст
  • Голос
  • Logic Apps
  • Event Hubs
  • Функции Azure
  • Сценарий автоматизации
  • Безопасный веб-перехватчик (используется для подключения к ServiceNow)
  • Webhook

Настройка действий

Настройте действия с помощью групп действий в рабочей области Azure Monitor (AMW), в которой хранится проблема. Вы можете настроить одну или несколько групп действий в качестве действий по умолчанию для этой рабочей области.

При создании или обновлении проблемы группы действий, настроенные в связанном AMW, активируются автоматически.

Вы также можете определить действия с помощью конфигурации ресурсов агента наблюдения Azure Copilot. Дополнительные сведения см. в статье "Создание ресурса "Агент наблюдаемости Azure Copilot" в портале Azure".

Дополнительные сведения о группах действий см. в разделе "Группы действий".

Пример сценариев

В следующих примерах показано, как действия по проблеме могут использоваться для поддержки различных сценариев реагирования:

  • Координация технического исследования и управления инцидентами с помощью ServiceNow. Отправьте инцидент в ServiceNow ITOM через защищённый вебхук. Проблема Azure Monitor остается технической рабочей областью для инженеров по вызову с соответствующими оповещениями, ресурсами и результатами исследования агента наблюдения. Соответствующее оповещение ServiceNow и инцидент ITSM поддерживают назначение ответственной группы поддержки, эскалацию, коммуникации и закрытие инцидента. При включении двунаправленной синхронизации соответствующие изменения состояния остаются согласованными в обеих системах.

  • Создание билетов и интеграция рабочих процессов— используйте приложение логики для создания или обновления рабочего элемента в таких системах, как Azure DevOps или Jira при создании или обновлении проблемы. Рабочий элемент может включать сведения о проблеме, такие как степень серьезности, затронутые ресурсы и рабочий контекст, что помогает командам отслеживать зоны ответственности, координировать работу и управлять процессом устранения в рамках существующих инженерных процессов.

  • Интеллектуальная маршрутизация— используйте функцию Azure или приложение логики для проверки свойств проблем, таких как серьезность, затронутые службы или затронутые ресурсы, и перенаправите проблему в соответствующую команду, канал или рабочий процесс. Например, направляйте проблемы, затрагивающие клиентское приложение, в дежурную инженерную команду, а проблемы, затрагивающие внутренние системы, — в другой операционный процесс.

  • Потоковая передача данных о проблемах в подчиненные системы— отправка событий жизненного цикла проблем в Центры событий Azure для обработки внешними системами. Используйте этот подход для работы с пользовательскими панелями мониторинга, операционной аналитикой, конвейерами отчетов, озерами данных или внутренними платформами, которые используют и анализируют данные о проблемах вместе с другими операционными сигналами.