Углублённый анализ в агенте наблюдаемости Azure Copilot

Глубокое исследование — это рабочий процесс устранения неполадок, который выполняется агентом Azure Copilot наблюдаемости, когда что-то уже неправильно, и вам нужно знать, что произошло и что делать дальше. Агент собирает сигналы из приложения, инфраструктуры и Azure уровней платформы, сопоставляет их автоматически и создает отчет с выводами и рекомендуемыми дальнейшими шагами. Углублённый анализ заменяет ручную работу по переходу между панелями мониторинга, логами и историей развёртываний, чтобы понять, что именно изменилось. Углубленные исследования работают с типами ресурсов Azure, включая Azure Kubernetes Service (AKS), виртуальные машины и Application Insights.

В этой статье объясняется, когда следует использовать глубокое исследование, где вы запускаете его, как агент запускает его, и какие данные содержатся в отчете. Если у вас есть разовые вопросы, не связанные с активным инцидентом, см. Чат с данными наблюдаемости.

Глубокое исследование или исследование в чате

Используйте глубокое исследование, когда:

  • Срабатывает оповещение Azure Monitor, и вы пока не знаете причину.
  • Вы видите всплеск задержки или ошибок сразу в нескольких ресурсах и хотите получить сквозное представление по всем уровням.
  • Инцидент охватывает код приложения, инфраструктуру узла и условия платформы Azure.

Вместо этого используйте чат с данными о наблюдаемости, когда:

  • У вас есть разовый вопрос по одному ресурсу («Какие исключения вчера встречались чаще всего?»).
  • Вы изучаете данные телеметрии без активного инцидента.
  • Вы хотите составить запрос Kusto или выявить закономерность в своих журналах.

Сведения о рабочих процессах чата см. в разделе Чат с данными наблюдаемости. Одна операция углублённого анализа ограничена 300 кредитами агента Azure (AAC). Сведения о затратах см. в разделе "Управление выставлением счетов и затратами" для агента наблюдения в Azure Monitor.

Поддерживаемые сценарии инцидентов

Глубокие расследования предназначены для следующих категорий инцидентов. Пошаговые инструкции для различных сценариев см. в примерах углубленного анализа в агенте наблюдаемости Azure Copilot.

  • Проблемы с приложением
    • Регрессии развертывания
    • Сбои запросов и зависимостей
    • Регрессии производительности
    • Нехватка ресурсов
    • Ошибки идентификации или конфигурации
  • Проблемы с инфраструктурой
    • Вычислительная насыщенность
    • Регулирование операций ввода-вывода диска
    • Неправильно настроенные зависимости
    • Сбои сетевого подключения
  • Проблемы с платформой
    • Техническое обслуживание Azure или сбои
    • Проблемы с управляемой инфраструктурой, такие как исчерпание портов SNAT и проблемы блокировки обновления

Где вы начинаете глубокое исследование на портале Azure

Пользователи с доступом к Azure Copilot могут выполнять глубокие исследования. Если ваша организация ограничивает доступ Azure Copilot, вы не можете использовать агент наблюдения. Дополнительные сведения см. в статье "Управление доступом к Azure Copilot".

Вы начинаете глубокое исследование из нескольких мест на портале Azure. Каждая точка входа предоставляет агенту контекст ресурса и диапазона времени для инцидента.

  • Оповещение Azure Monitor (рекомендуется) — откройте сработавшее оповещение в портале и выберите Изучить. Этот путь входа является основным, так как оповещение уже содержит затронутый ресурс, симптом и время запуска.

    Снимок экрана страницы оповещений Azure Monitor с открытой панелью сведений об оповещении, в которой выделено действие

    После нажатия кнопки "Исследование" агент наблюдаемости открывается во временном чате и автоматически определяет область исследования в исходном оповещении. Он публикует открывающее сообщение, описывающее запланированный анализ, включая период времени воздействия, триггерное оповещение, целевой ресурс и связанные сигналы, которые он намерен сопоставить. Эти сигналы включают правила мониторинга, соответствующие метрики и последние оповещения о смежных ресурсах.

    Затем агент предложит предоставить дополнительный контекст перед продолжением или подтвердить, что он должен начать расследование с помощью отображаемой области.

  • Уведомление об оповещении по электронной почте — откройте ссылку Расследовать в электронном письме оповещения Azure Monitor, чтобы начать расследование, не открывая сначала список оповещений.

  • Панель журналов — открывает чат в контексте рабочей области или запроса Log Analytics, где можно перейти к углубленному исследованию.

  • Журнал действий — начните расследование по событию Сбой службы работоспособности ресурсов в журнале действий.

  • Application Insights — перейдите сразу из панели "Сбои", передав агенту контекст выбранного сбоя, или откройте чат из представления "Агенты" и перейдите к углублённому расследованию.

  • AKS — откройте чат в колонке "Аналитика контейнеров " или на странице ресурсов AKS и выполните глубокое исследование.

Подробнее о способах доступа к чату см. в статье Общение в чате с данными наблюдаемости.

Конвейер шестиэтапного исследования

При запуске глубокого исследования агент выполняет фиксированную последовательность этапов. Эти этапы выполняются без входных данных. Агент автоматически выполняет каждый этап и в процессе транслирует ход выполнения.

Этап Что делает агент
1. Область проблемы Определяет наиболее вероятные затронутые ресурсы и их подключенные зависимости на основе контекста точки входа.
2. Сбор данных Извлекает метрики, журналы, трассировки, события, записи журнала действий и историю изменений для ресурсов, входящих в область охвата.
3. Обнаружение аномалий Применяет обученные базовые уровни к метрикам и анализирует журналы на наличие выбросов и необычных закономерностей.
4. Корреляция между ресурсами Сопоставляет сигналы на уровнях приложения и инфраструктуры, чтобы выявить свидетельства, которые изменяются согласованно.
5. Выполнение глубокой диагностики Вызывает средства, относящиеся к ресурсам, если это необходимо (например, диагностика на уровне узла AKS или анализ зависимостей Application Insights).
6. Сводка результатов Создает отчет, который объясняет, что произошло, почему и что делать дальше.

На следующем рисунке показано, как агент суммирует действия, которые планируется предпринять после определения проблемы.

Снимок экрана: сводка плана исследования с кнопками области ресурсов и действий.

На следующей схеме показано подробное исследование в общих чертах. Блок «Сбор и анализ сигналов» охватывает как сбор данных, так и обнаружение аномалий, представленные в подробной таблице, а углублённая диагностика для конкретных ресурсов выполняется в рамках этапа Correlate anomalies.

Поток глубокого исследования: от триггера генерации оповещений с помощью анализа, корреляции до сводки результатов.

По мере выполнения исследования агент передает свои результаты в режиме реального времени.

Снимок экрана: ход исследования, показывающий анализ метрик с обнаруженными семействами метрик.

Как агент анализирует инцидент

Углублённые исследования строятся вокруг практического цикла управления, который отражает подход к работе опытных специалистов по реагированию:

  1. Сформулируйте гипотезу на основе триггера и масштаба инцидента.
  2. Соберите и соотносите доказательства между приложениями , инфраструктурой и сигналами платформы.
  3. Проверьте альтернативные объяснения, проверяя , соответствуют ли сигналы по времени, области и типу.
  4. Исключите слабые гипотезы , когда поддержка доказательств отсутствует или несогласованна.
  5. Уточнение и обобщение наиболее вероятных объяснений с помощью рекомендуемых дальнейших шагов.

Этот цикл заключается в том, что выходные данные исследования включают как выводы, так и гипотезы, которые были исключены. Это поможет вам проверить путь рассуждений, а не только окончательный вывод.

Как агент выравнивает сигналы по времени, области и типу

Агент соотносит свидетельства по трём осям, чтобы в итоговом отчёте связать причины со следствиями, а не просто перечислить все обнаруженные им аномалии.

  • Время — сигнал переместился вместе с инцидентом? Всплеск загрузки ЦП, начавшийся за 20 минут до срабатывания оповещения и совпадающий с его траекторией, считается коррелирующим. Всплеск по сравнению с предыдущим днём — нет.
  • Область — имеет ли сигнал общий ресурс, зависимость, операцию или регион с инцидентом? Задержка в зависимости, к которой обращается затронутое приложение, коррелирует. Задержка в не связанном приложении в одном регионе отсутствует.
  • Тип — соответствует ли сигнал симптому? Увеличение количества исключений сопоставляется с оповещением о частоте ошибок. Медленный диск тут ни при чём, если только он не находится на пути выполнения сбойного запроса.

Это выравнивание по трем осям позволяет агенту исключить несвязанный шум и представить короткий список причинно-соответствующих доказательств.

Глубокое исследование сопоставляет доказательства между несколькими слоями и ресурсами, поэтому анализ первопричин не ограничивается одним ресурсом или типом сигнала. Агент обрабатывает оповещения как вспомогательные доказательства, а не как первопричину. Агент использует оповещения, чтобы зафиксировать временное окно и затронутые ресурсы, а затем анализирует события, предшествующие оповещению, чтобы понять, что именно изменилось.

Сведения, содержащиеся в отчете по расследованию

Отчет о расследовании отвечает на вопросы, которые инженер по вызову задает во время инцидента:

  • Контекст инцидента — что послужило причиной расследования, временной интервал и масштаб воздействия (какие ресурсы затронуты).
  • Затронутые компоненты — ресурсы приложений, инфраструктуры и платформы, которые свидетельствуют о проблеме.
  • Исключённые гипотезы — альтернативные причины, которые агент рассматривал, и доказательства, позволившие их исключить. Эти данные делают вывод проверяемым.
  • Действия по устранению рисков — рекомендуемые действия для стабилизации системы.
  • Вспомогательные данные — ссылки обратно в метрики, журналы, запросы и записи журнала действий, используемые агентом.
  • Ход выполнения в реальном времени — отчет формируется в потоковом режиме во время расследования, поэтому вы можете видеть выводы по мере их появления.

На следующем рисунке показан отчет о расследовании с результатами агента и список рекомендуемых действий.

Снимок экрана с результатами расследования и предлагаемыми последующими запросами.

Последующие запросы, уточняющие расследование

После того как агент вернет отчет, задайте дополнительные вопросы, чтобы уточнить охват, проверить альтернативные гипотезы или переключиться на связанный ресурс. Разговор сохраняет контекст расследования, поэтому вам не нужно заново описывать инцидент.

Полезные уточняющие запросы включают:

  • "Что изменилось незадолго до начала инцидента?"
  • "Существуют ли проблемы в виртуальной машине <vm-id> и связаны ли они? Если да, выполните глубокое исследование, включая эту виртуальную машину".
  • "Какие зависимости наиболее коррелируются с этим пиком сбоя?"
  • "Существуют ли связанные оповещения или изменения конфигурации, которые объясняют это поведение?"

Ниже приведен пример, в котором пользователь задал ответы на последующие вопросы.

Снимок экрана: анализ исследования с последующим чатом и поддержкой панели мониторинга данных.

Сохранить результаты расследования как инцидент Azure Monitor

Результаты исследования являются временными. Сохраните расследование как проблему Azure Monitor, чтобы сохранить полный контекст, включая отчет, ход рассуждений агента, вспомогательные данные и последующее обсуждение. Из проблемы вы можете возобновить беседу позже, поделиться им с коллегами и продолжить анализ без потери контекста.

Снимок экрана: диалоговое окно

Дополнительные сведения о проблемах см. в разделе Проблемы Azure Monitor и Использование проблем Azure Monitor.

Эскалация из чата в глубокое исследование

Когда исследование в чате на странице Logs выявляет более глубокую проблему, чем можно решить с помощью разовых вопросов, перейдите к полноценному углублённому расследованию, не выходя из чата. Агент использует контекст чата в качестве исходного контекста для расследования.

Дополнительные сведения о рабочем процессе чата см. в разделе "Чат" с данными о наблюдаемости.

Как агент объясняет ход своих рассуждений

Агент наблюдаемости показывает ход своих рассуждений в процессе работы: какие сигналы он учитывал, какие запросы выполнял и к каким ресурсам Azure обращался. Эта прозрачность позволяет проверять выводы агента, изучать шаблоны, которые он использует, и перехватывать случаи, когда доступные сигналы не поддерживают предложенный следующий шаг.

Дополнительные сведения о том, какие данные регистрируются, как представляются обоснования и как выполнять аудит действий агента, см. в разделе «Прозрачность в агенте наблюдаемости Azure Copilot».

Хранение данных, конфиденциальность и ответственное использование

Служба может хранить данные исследования до 30 дней для поддержки расследований и взаимодействия с пользователем. Microsoft не использует запросы или ответы агента для обучения или улучшения базовых моделей ИИ.

Сведения о требованиях к прозрачности и надежности см. в разделе «Вопросы и ответы о прозрачности для агента наблюдаемости Azure Copilot». Сведения об управлении, конфиденциальности и соответствии требованиям см. в разделе Вопросы и ответы о данных, конфиденциальности и управлении для агента наблюдаемости Azure Copilot.

Регионы и текущие ограничения

Углублённые исследования доступны в тех же регионах Azure, что и сам агент Observability. Список текущих регионов см. в разделе "Регионы " в обзоре. Сведения об известных ограничениях и способах устранения неполадок см. в статье «Устранение неполадок агента наблюдаемости Azure Copilot».

Дальнейшие действия: автономные операции

Помимо глубоких расследований, инициированных пользователем, описанных в этой статье, агент наблюдения может выполнять глубокие исследования автоматически в отношении проблем, созданных агентом, без запроса пользователя. Автономные операции на момент запуска доступны в общедоступной предварительной версии, включены по умолчанию с возможностью отключения, а тарификация автономных глубоких расследований началась 1 июля 2026 года.

Сведения о настройке, отказе от участия, пользовательских инструкциях, управлении доступом на основе ролей и сведениях о выставлении счетов, связанных с автономными операциями, см. в разделе Автономные операции в агенте Azure Copilot Observability.