Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Применяется к этой рекомендации по эффективности производительности платформы Azure Well-Architected Framework:
| PE:11 | Реагирование на проблемы с производительностью в реальном времени. Планирование решения проблем с производительностью путем включения четких линий связи и обязанностей. При возникновении проблемной ситуации используйте то, что вы узнаете, чтобы определить превентивные меры и включить их в рабочую нагрузку. Реализуйте методы для быстрого возвращения к обычным операциям при возникновении аналогичных ситуаций. |
|---|
В этом руководстве описаны рекомендации по реагированию на проблемы с производительностью в реальном времени. Проблемы с производительностью в реальном времени относятся к проблемам реального времени и узким местам, которые могут препятствовать оптимальному функционированию рабочей нагрузки. Решение этих проблем быстро упрощает не только немедленное обнаружение и исправление ошибок производительности, но и гарантирует, что рабочая нагрузка согласованно соответствует его производительности. Неспособность устранить их может привести к осложнениям, включая замедление, сбои и неответственность системы, а также ухудшение взаимодействия с пользователем. Они также могут препятствовать эффективному выполнению задач пользователями и, в свою очередь, запятнать репутацию организации.
Определения
| Срок | Definition |
|---|---|
| Корреляция данных | Выравнивание журналов, метрик и событий из различных частей рабочей нагрузки для выявления основных причин. |
| Анализ первопричин | Процесс выявления базовых факторов, ответственных за проблему. |
| Самозалечивание | Возможность автоматического восстановления проблем без вмешательства человека. |
| Самостоятельное предотвращение | Реализации в рабочей нагрузке для предотвращения потенциальных проблем и сбоев. |
При возникновении проблемы с производительностью в реальном времени необходимо подготовиться с правильными данными и планом реагирования на проблему. Этот план должен включать четкие линии связи и обязанностей. Основной задачей является реализация решений, которые упрощают быстрое возвращение к регулярным операциям и предоставляют аналитические сведения об инциденте. Интеграция профилактических мер в рабочий процесс является ключевой стратегией. Цель заключается в том, чтобы предотвратить повторение или уменьшение его влияния на производительность, если это невозможно.
Подготовка к проблемам
Идеальный ответ на проблемы производительности динамического сайта является точным и быстрым. Точность и скорость исправления производительности требуют подготовки. Чтобы эффективно реагировать на проблемы с производительностью в реальном времени, важно отслеживать ключевые метрики производительности, определять первопричину проблем и реализовывать соответствующие решения или оптимизации. Для выполнения этих действий может потребоваться проанализировать журналы рабочих нагрузок, провести тестирование производительности, оптимизировать код или конфигурации и масштабировать ресурсы. В следующих примерах описаны некоторые важные области подготовки:
Точную схему архитектуры. Схемы архитектуры должны содержать все компоненты и показать, как они взаимодействуют. Визуальное представление может помочь определить узкие места и отдельные точки сбоя, которые могут привести к снижению производительности или недоступности. В идеале вы поймаете и удалите эти проблемы, прежде чем они вызывают проблемы, но наличие схемы up-to-date может помочь вам определить проблемы в моменты высокой нагрузки.
Проверьте доступ к данным. Данные и журналы из процессов мониторинга критически важны для реагирования на проблемы с производительностью в реальном времени и проведения анализа первопричин. Но важно поддерживать целостность и конфиденциальность данных. Для реагирования на проблемы с производительностью live-сайта часто требуется доступ к базовым данным, которые обычно недоступны. Необходимо убедиться, что персонал имеет доступ к данным, которые им нужны при возникновении проблем. Но вы должны предоставить доступ только по времени, наименее привилегированный доступ, и вы должны ограничить доступ к авторизованным сотрудникам.
Настройка автоматических оповещений. Оповещения помогают выявлять и устранять проблемы сразу после их возникновения. Оповещения должны создавать уведомления, когда производительность рабочей нагрузки отклоняется от базовых показателей производительности. Со временем следует настраивать конфигурации оповещений, чтобы избежать создания слишком большого количества или слишком мало уведомлений. Решения мониторинга, используемые для сбора достаточного количества данных для создания оповещений. Эти оповещения должны соответствовать целевым показателям производительности и установленным базовым показателям. Следует избегать создания оповещений о проблемах, относящихся к вашим целям. Примеры оповещений включают снижение использования ЦП, памяти, времени отклика и производительности базы данных.
Создание плана триажа
Создание плана триажа включает разработку структурированного подхода для выявления, эскалации, анализа, определения приоритетов и взаимодействия с проблемами производительности live-site. План триажа — это стратегия реагирования на проблемы с производительностью в реальном времени. Это гарантирует, что нарушения производительности устраняются быстро и эффективно, с четкими ролями и процедурами. Большинство проблем с производительностью не заслуживают протоколов аварийного восстановления, но они могут повлиять на функциональность рабочей нагрузки достаточно, чтобы требовать планирования работы. Хорошо задокументированный план триажа гарантирует, что все члены команды выровнены и могут быстро действовать, минимизируя влияние на пользователей и рабочие нагрузки. План триажа должен включать следующие компоненты:
Идентификация и мониторинг. Реализация системы для выявления и мониторинга проблем с производительностью в режиме реального времени. У вас должен быть список контактных данных людей, способных принимать решения или создавать проблемы на более высоком уровне. План также должен определять роли и обязанности. Он должен документировать, какие учетные записи получают доступ к защищенной информации и сколько времени.
Процесс эскалации: определите четкий процесс эскалации, чтобы обеспечить своевременное эскалацию проблем с производительностью для соответствующих команд или отдельных лиц. Определение процесса должно содержать контактные данные и рекомендации по эскалации проблем.
Анализ первопричин: разработка процесса для проведения анализа первопричин, чтобы определить основную причину каждой проблемы с производительностью. Процесс должен включать анализ журналов и метрик производительности и проведение диагностических тестов, чтобы определить источник каждой проблемы.
Приоритет. Создайте платформу приоритетов, чтобы определить серьезность проблем с производительностью и определить их приоритеты на основе их влияния на рабочую нагрузку и пользователей.
Коммуникация: создание плана коммуникации для информирования заинтересованных лиц о состоянии проблем с производительностью и ходе их решения. Рассмотрите регулярные обновления, отчеты о состоянии и очистить каналы связи.
Документация. Документируйте план обработки, включая все его шаги, процессы и рекомендации. Эта документация должна быть легко доступна участникам группы, участвующим в реагировании на проблемы с производительностью.
Разработка методов для выявления и устранения проблем
Устранение проблем с производительностью в реальном времени включает определение и устранение любых факторов, которые могут привести к снижению производительности или неэффективности в динамической рабочей нагрузке. Данные, собираемые во время мониторинга, являются бесценными при изучении и устранении инцидентов, связанных с производительностью. Эти данные предоставляют историческую запись метрик производительности. Если у вас есть доступные данные мониторинга, вы можете проанализировать первопричины и определить факторы, влияющие на них. Для понимания и устранения каждой проблемы производительности следует использовать все соответствующие данные мониторинга.
Использование анализа первопричин
Для анализа первопричин требуется тестирование гипотез. После просмотра данных мониторинга следует перечислить потенциальные причины проблемы с производительностью и проверить их. Чтобы выполнить анализ первопричин по проблеме с производительностью в реальном времени, выполните следующие действия:
Сбор сведений. Соберите как можно больше сведений о проблеме с производительностью. Примеры включают сообщения об ошибках, журналы, метрики производительности и другие соответствующие данные.
Определите проблему. Четко определите проблему, определив симптомы и влияние проблемы на рабочую нагрузку или пользователей.
Изучение потенциальных причин. Сузьте область анализа, определив конкретный компонент или область рабочей нагрузки, в которой возникает проблема с производительностью. Определите потенциальные причины проблемы с производительностью на основе собранных сведений. Этот процесс может включать анализ кода, параметров конфигурации, инфраструктуры или внешних зависимостей.
Сопоставлять данные. Подробно изучите собранные данные, чтобы определить закономерности, аномалии или корреляции, которые могут способствовать проблеме с производительностью. Корреляция данных является ключом для выявления проблем с производительностью и причин. Он может включать просмотр журналов, анализ метрик производительности и проведение тестов.
Проверьте гипотезы. Сформулировать гипотезы на основе потенциальных причин, которые вы определяете. Провести тесты, чтобы проверить или опровергнуть гипотезы. Вы должны использовать тестовую среду, чтобы узнать, можно ли реплицировать ошибку.
Реализуйте решения. Когда вы определите первопричину, разработайте и реализуйте решения для решения проблемы с производительностью.
Мониторинг и проверка. После реализации решений непрерывно отслеживайте рабочую нагрузку, чтобы убедиться, что проблема с производительностью устранена. Проверьте эффективность решений, отслеживая метрики производительности и отзывы пользователей.
Компромисс. Шаги анализа первопричин, такие как определение возможных причин, тестирование гипотез и документирование анализа, могут занять много времени. Чтобы сопоставить проблемы с производительностью, необходимо также собирать и хранить данные. Необходимое время и инфраструктура могут добавить значительную работу в операционные группы и затраты на рабочую нагрузку.
Риск. Если вы выполняете анализ первопричин без надлежащего контроля безопасности, при предоставлении доступа к журналам и данным возникает риск предоставления конфиденциальной информации.
Поддержка поставщиков
Поддержка поставщиков может быть важным шагом при работе с текущими проблемами производительности. Поставщики обладают опытом, инструментами, ресурсами и опытом, чтобы помочь устранить проблемы с их продуктами. Ваше соглашение о поддержке с поставщиком определяет уровень поддержки поставщика.
Часто рекомендуется работать параллельно с поставщиками. Необходимо создать план, чтобы некоторые члены группы сотрудничали с поддержкой поставщиков, а другие продолжают выполнять действия и устранять проблемы с производительностью. Группы поддержки поставщиков также могут создавать предложения по предотвращению и автоматизации ответов на аналогичные события.
У вас должны быть контактные данные, доступные для персонала. Поставщикам также может потребоваться доступ к данным для эффективного участия в решении проблем. Необходимо иметь план для проверки подлинности и авторизации внешних или гостевых учетных записей для доступа к данным мониторинга.
Узнайте о результатах
После устранения проблемы с производительностью динамического сайта необходимо проверить, что произошло. Цель состоит в том, чтобы узнать о проблемах с производительностью, а не просто выявить проблемы. Лучший способ научиться — это документация. Задокументируйте каждую проблему и объясните, как ее исправить. Если поставщик помог, обратитесь к поставщику, чтобы улучшить документацию, обучить свою команду и соответствующим образом изменить рабочую нагрузку.
Документация должна указать, как предотвратить повторную проблему. Одним из способов избежать повторяющихся проблем является внедрение автоматизации для реагирования на распространенные проблемы. Автоматизация должна добавлять качества самовосстановления и самовосстановления в рабочую нагрузку. Наряду с автоматизацией можно создавать улучшенные оповещения, которые помогают вам реагировать на ранние показатели проблем с производительностью.
Упрощение функций Azure
Разработка методов для выявления и устранения проблем: Azure предоставляет несколько средств, которые помогут вам реагировать на проблемы с производительностью в реальном времени:
Azure Monitor — это комплексное решение для мониторинга, которое предоставляет аналитические сведения о производительности и работоспособности приложений и инфраструктуры. Монитор предлагает такие функции, как метрики, журналы, оповещения и панели мониторинга, которые помогут вам отслеживать и диагностировать проблемы с производительностью.
Application Insights — это служба управления производительностью приложений (APM), которая помогает разработчикам и специалистам DevOps отслеживать динамические приложения. Он автоматически обнаруживает аномалии производительности, собирает журналы и события уровня приложения и предоставляет средства аналитики для диагностики проблем.
Log Analytics — это служба, которая собирает и анализирует данные журнала из различных источников, включая приложения, виртуальные машины и ресурсы Azure. При использовании Log Analytics можно запрашивать и анализировать данные журнала, чтобы получить аналитические сведения о производительности и поведении приложений.
Связанные ссылки
Контрольный список эффективности производительности
Ознакомьтесь с полным набором рекомендаций.