AIOps и агентические операции в Azure Monitor

Azure Monitor использует AIOps, машинное обучение и агентные операции, чтобы раньше выявлять проблемы, более естественно анализировать данные, понимать изменения, которые могут повлиять на работу, и предпринимать действия по устранению обнаруженных проблем, располагая более полным контекстом. Текущее направление все чаще подчеркивает агентические операции в качестве слоя, который подключает обнаружение, аналитику, исследование, объяснение и руководство по дальнейшим действиям.

Эти возможности охватывают три широких подхода:

  • Агентические операции с помощью агента наблюдения, который помогает изучать данные, исследовать проблемы, объяснить, что изменилось, и следить за Azure Monitor сигналами.
  • Встроенные функции AIOps и машинного обучения , которые обнаруживают аномалии, прогнозируют тенденции и автоматизируют выбранные операционные решения.
  • Пользовательское машинное обучение в журналах Azure Monitor для сложных сценариев, где требуется создать и запустить собственный конвейер анализа.

В этой статье представлены агентные и встроенные возможности AIOps в Azure Monitor. Затем объясняется, как создавать пользовательские конвейеры машинного обучения в журналах Azure Monitor, если требуется более специализированный анализ.

Агентические операции в Azure Monitor

Агентические операции в Azure Monitor помогают работать на нескольких этапах рабочего процесса наблюдаемости:

  • Изучение и анализ данных с помощью естественного языка для работы с журналами, метриками и связанными данными телеметрии.
  • Анализ проблем путем сопоставления сигналов между источниками данных Azure Monitor и соответствующим контекстом ресурсов.
  • Сохраняйте и делитесь результатами с помощью Azure Monitor проблем, которые служат операционными артефактами для постоянного исследования и совместной работы.
  • Поддержка упреждающих и автономных рабочих процессов по мере развития платформы к более управляемому системой исследованию и последующим действиям в поддерживаемых сценариях.

Агентические операции дополняют традиционные функции обнаружения аномалий и прогнозирования. Вместо того, чтобы определить, что-то необычное произошло, они также помогают объяснить, что изменилось, какие доказательства поддерживают заключение, и что делать дальше.

Встроенные возможности

встроенные возможности Azure Monitor помогают обнаруживать, исследовать и реагировать на проблемы, не требуя создания пользовательских моделей машинного обучения.

Агентные операции сосредоточены на исследовании, объяснении и выполнении последующих шагов под руководством. Традиционные функции машинного обучения сосредоточены на обнаружении шаблонов, прогнозировании и идентификации аномалий. Вместе они обеспечивают более широкую операционную модель, чем один подход.

Сценарий мониторинга Capability Description
Мониторинг журналов Аналитика рабочей области Log Analytics Предоставляет единое представление ваших рабочих областей Log Analytics и использует машинное обучение для обнаружения аномалий приема данных.
Язык запросов Kusto (KQL): анализ временных рядов и функции машинного обучения Средства простого использования для создания данных временных рядов, обнаружения аномалий, прогнозирования и выполнения анализа первопричин непосредственно в журналах Azure Monitor без глубокого знания о языках обработки и программирования.
Microsoft Copilot в Azure Помогает использовать Log Analytics для анализа данных и устранения неполадок. Создает примеры запросов KQL на основе запросов, таких как "Есть ли ошибки в журналах контейнеров?".
Агент наблюдаемости Помогает исследовать журналы, метрики и связанные данные телеметрии, используя естественный язык и последовательные уточняющие вопросы в текущем интерфейсе продукта.
Мониторинг производительности приложения Интеллектуальное представление карты приложений Сопоставляет зависимости между службами и помогает обнаружить узкие места производительности или горячие точки сбоя во всех компонентах распределенного приложения.
Интеллектуальное обнаружение Анализирует данные телеметрии, которые приложение отправляет в Application Insights, оповещения о проблемах с производительностью и аномалиях сбоев, а также определяет потенциальные первопричины проблем с производительностью приложения.
Оповещения на основе метрик Динамические пороговые значения для оповещений метрик Изучает закономерности метрик, автоматически устанавливает пороговые значения оповещений на основе исторических данных и выявляет аномалии, которые могут указывать на проблемы в работе сервиса.
Масштабируемые наборы виртуальных машин Прогнозное автомасштабирование Прогнозирует общие требования ЦП масштабируемого набора виртуальных машин на основе исторических шаблонов использования ЦП и автоматически масштабируется в соответствии с этими потребностями.
Изучение и диагностика Агент наблюдаемости Использует сигналы Azure Monitor и операционный анализ для исследования проблем, сопоставления результатов и объяснения того, что произошло в журналах, метриках, трассировках, оповещениях и связанном контексте ресурсов.
Проблемы Azure Monitor Сохраняет результаты исследования в качестве операционных артефактов, чтобы команды могли просматривать результаты, продолжать анализ и сотрудничать со временем.
Упреждающие и автономные операции Проактивные действия агента наблюдаемости Расширяет модель агента к более системному расследованию и обработке проблем для поддерживаемых сценариев по мере того, как эти возможности становятся доступными.

Настраиваемое машинное обучение для журналов Azure Monitor

Используйте встроенные функции анализа временных рядов и машинного обучения, операторы и подключаемые модули языка запросов Kusto, чтобы получать аналитические сведения о работоспособности служб, использовании, доступных ресурсах и других тенденциях, а также создавать прогнозы и обнаруживать аномалии в журналах Azure Monitor.

Чтобы повысить гибкость и расширить возможность анализа и действия с данными, вы также можете реализовать собственный конвейер машинного обучения для данных в журналах Azure Monitor.

В этой таблице сравниваются преимущества и ограничения использования встроенных возможностей машинного обучения KQL и создания собственного конвейера машинного обучения, а также ссылки на руководства, демонстрирующие реализацию каждого из них:

Встроенные возможности машинного обучения KQL Создание собственного конвейера машинного обучения
Сценарий ✅ Обнаружение аномалий, первопричина и анализ временных рядов
✅ Обнаружение аномалий, первопричина и анализ временных рядов
Создание пользовательского конвейера машинного обучения
Преимущества 🔹Помогает очень быстро начать работу.
🔹Знания и навыки программирования для обработки и анализа данных не требуются.
🔹 Оптимальная производительность и экономия затрат.
🔹Поддерживает более крупные масштабы.
🔹Включает расширенные, более сложные сценарии.
🔹Гибкость при выборе библиотек, моделей, параметров.
Ограничения служб и тома данных портал Azure или ограничения запросов к журналам API в зависимости от того, работаете ли вы на портале или используете API, например из записной книжки. 🔹 Ограничения запросов к журналам API при запросе данных в журналах Azure Monitor в рамках конвейера машинного обучения. В противном случае ограничения службы Azure отсутствуют.
🔹Может поддерживать большие объемы данных.
Интеграция Не требуется. Запустите в портале Azure с помощью Log Analytics или из встроенной записной книжки Jupyter. Требуется интеграция с инструментом, например Jupyter Notebook. Как правило, вы также интегрирулись с другими службами Azure, такими как Azure Synapse Analytics.
Производительность Оптимальная производительность с помощью платформы Azure Data Explorer, выполняющаяся в больших масштабах в распределенном режиме. Представляет небольшую задержку при запросе или экспорте данных в зависимости от способа реализации конвейера машинного обучения.
Тип модели Модель линейной регрессии и другие модели, поддерживаемые функциями временных рядов KQL с набором настраиваемых параметров. Полностью настраиваемая модель машинного обучения или метод обнаружения аномалий.
Cost Без дополнительных затрат. В зависимости от того, как вы реализуете конвейер машинного обучения, вы можете взимать плату за экспорт данных, прием оцененных данных в журналы Azure Monitor и использование других служб Azure.
Руководство Обнаружение и анализ аномалий с помощью возможностей машинного обучения KQL в Azure Monitor Анализ данных в журналах Azure Monitor с помощью записной книжки

Создание пользовательского конвейера машинного обучения

Создайте собственный конвейер машинного обучения на основе данных в журналах Azure Monitor для внедрения новых возможностей AIOps и поддержки расширенных сценариев, таких как:

  • Выявление кибератак с помощью более сложных моделей, чем модели на основе KQL.
  • Обнаружение проблем с производительностью и устранение ошибок в веб-приложении.
  • Создание многошаговых потоков, выполнение кода на каждом шаге на основе результатов предыдущего шага.
  • Автоматизация анализа данных журнала Azure Monitor и предоставление аналитических сведений о нескольких областях, включая работоспособность инфраструктуры и поведение клиентов.
  • Сопоставление данных в журналах Azure Monitor с данными из других источников.

Существует два подхода к созданию данных в журналах Azure Monitor для конвейера машинного обучения:

В этой таблице сравниваются преимущества и ограничения подходов к получению данных для конвейера машинного обучения:

Запрашивайте данные в Azure Monitor Logs Экспорт данных
Преимущества 🔹Поможет быстро приступить к работе.
🔹Требуются только базовые навыки в области data science и программирования.
🔹Минимальная задержка и экономия затрат.
🔹Поддерживает более крупные масштабы.
🔹Ограничения запросов отсутствуют.
Экспортируемые данные? Нет Да
Ограничения службы Ограничения запросов к журналам в API запросов и ограничение частоты пользовательских запросов. Вы можете преодолеть ограничения API запросов до определенной степени, разделив большие запросы на блоки. Нет данных из Azure Monitor.
Объемы данных Анализируйте несколько ГБ данных или несколько миллионов записей в час. Поддерживает большие объемы данных.
Библиотека машинного обучения Для небольших и средних наборов данных обычно используются библиотеки машинного обучения с одним узлом, такие как Scikit Learn. Для больших наборов данных обычно используются библиотеки машинного обучения больших данных, такие как SynapseML.
Задержка Минимальный. Представляет небольшую задержку при экспорте данных.
Cost В Azure Monitor дополнительная плата не взимается.
Стоимость Azure Synapse Analytics, Машинное обучение Azure или другой службы при использовании.
Стоимость экспорта данных и внешнего хранилища.
Стоимость Azure Synapse Analytics, Машинное обучение Azure или другой службы в случае использования.

Tip

Чтобы воспользоваться преимуществами обоих подходов к реализации, создайте гибридный конвейер. Распространенный гибридный подход заключается в экспорте данных для обучения модели, которая включает большие объемы данных, а также использовать данные запроса в журналах Azure Monitor для изучения данных и оценки новых данных для снижения задержки и затрат.

Реализация жизненного цикла машинного обучения

Настройка конвейера машинного обучения обычно включает все или некоторые шаги, описанные ниже.

Существуют различные библиотеки машинного обучения Azure и открытый код, которые можно использовать для реализации конвейера машинного обучения, включая Scikit Learn, PyTorch, Tensorflow, Spark MLlib и SynapseML.

Эта таблица описывает каждый шаг и предоставляет общие рекомендации и некоторые примеры реализации этих действий на основе подходов реализации, описанных в статье "Создание собственного конвейера машинного обучения для данных в журналах Azure Monitor".

Step Description Запрос данных в журналах Azure Monitor Экспорт данных
Изучение данных Изучите и поймите собранные данные. Самый простой способ изучения данных — использовать Log Analytics, который предоставляет широкий набор средств для изучения и визуализации данных в портал Azure. Вы также можете анализировать данные в журналах Azure Monitor с помощью записной книжки. Чтобы проанализировать журналы за пределами Azure Monitor, экспортируйте данные из рабочей области Log Analytics и настройте среду в выбранной службе.
Пример изучения журналов за пределами Azure Monitor см. в статье "Анализ данных, экспортированных из Log Analytics с помощью Synapse".
Создание и обучение модели машинного обучения Обучение модели — это итеративный процесс. Исследователи или специалисты по обработке и анализу данных разрабатывают модель, извлекая и очищая обучающие данные, функции инженера, пробуя различные модели и параметры настройки, и повторяя этот цикл, пока модель не будет точной и надежной. Для небольших и средних наборов данных обычно используются библиотеки машинного обучения с одним узлом, такие как Scikit Learn.
Пример обучения модели машинного обучения для данных в журналах Azure Monitor с помощью библиотеки Scikit Learn см. в этом примере записной книжки: обнаружение аномалий в журналах Azure Monitor с помощью методов машинного обучения.
Для больших наборов данных обычно используются библиотеки машинного обучения больших данных, такие как SynapseML.
Развертывание и оценка модели Оценка — это процесс применения модели машинного обучения к новым данным для получения прогнозов. Скоринг обычно требуется выполнять в больших масштабах с минимальной задержкой. Чтобы запрашивать новые данные в журналах Azure Monitor, используйте клиентскую библиотеку запросов Azure Monitor.
Пример того, как оценивать данные с помощью инструментов с открытым исходным кодом, см. в этом примере записной книжки: Обнаружение аномалий в журналах Azure Monitor с помощью методов машинного обучения.
Запуск конвейера по расписанию Автоматизируйте свой конвейер, чтобы регулярно переобучать модель на актуальных данных. Запланируйте конвейер машинного обучения с помощью Azure Synapse Analytics или Машинное обучение Azure. Ознакомьтесь с примерами данных запроса в столбце журналов Azure Monitor.

Прием результатов оценки в рабочую область Log Analytics позволяет использовать данные для получения расширенной аналитики, а также для создания оповещений и панелей мониторинга. Пример того, как принимать оцененные результаты с помощью клиентской библиотеки приема данных Azure Monitor, см. в статье «Прием аномалий в настраиваемую таблицу в рабочей области Log Analytics».

Дальнейшие действия

Дополнительные сведения: