Устранение неполадок при анализе журналов событий состояния балансировщика нагрузки

Сводка

Эта статья поможет разобраться, как устранять неполадки журналов событий работоспособности Azure Load Balancer, чтобы быстро восстановить подключение и поддерживать доступность приложений.

Событие DataPathAvailabilityWarning

Метрика доступности пути данных подсистемы балансировки нагрузки упала ниже 90% из-за потенциальных проблем с платформой. Это событие также может быть вызвано достижением других ограничений платформы Azure.

Пример события

Warning - DataPathAvailabilityWarning: The data path availability for frontend IP 20.29.152.178 is below 90% on the following ports: 80. To mitigate this issue, please refer to aka.ms/lbhealth for more detailed event definitions and troubleshooting guidance.

Действия по устранению неполадок

  1. Убедитесь, что по крайней мере один серверный экземпляр отвечает на проверку работоспособности, настроенную для соответствующего правила балансировки нагрузки. Правило включает интерфейсный IP-адрес, протокол и порт, предоставленный в описании события.
    1. Если да, перейдите к следующему шагу для проверки статуса Azure.
    2. Если нет, обратитесь к Устранение проблем с Azure Load Balancer: состояние проверки работоспособности | для более подробных шагов по устранению неполадок.
  2. Посетите Статус Azure, чтобы определить наличие известных проблем с платформой или инфраструктурой Azure, которые могут повлиять на ресурс балансировщика нагрузки.
  3. Обратитесь к поддержка Azure для дальнейшего изучения, если вы наблюдаете эти события в журналах, и вы испытываете текущие проблемы с подключением.

Событие DataPathAvailabilityCritical

Метрика DataPathAvailability вашего балансировщика нагрузки снизилась ниже 25% из-за потенциальных проблем с платформой. Это событие также может быть вызвано достижением других ограничений платформы Azure.

Пример события

    Critical - DataPathAvailabilityCritical: The data path availability for frontend IP {FrontendIPAddress} is below 25% on the following ports: {LoadBalancingRulePorts}. To mitigate this issue, please refer to aka.ms/lbhealth for more detailed event definitions and troubleshooting guidance.

Действия по устранению неполадок

  1. Убедитесь, что по крайней мере один серверный экземпляр отвечает на проверку работоспособности, настроенную для соответствующего правила балансировки нагрузки. Правило включает интерфейсный IP-адрес, протокол и порт, предоставленный в описании события.
    1. Если да, перейдите к следующему шагу, чтобы проверить состояние Azure.
    2. Если нет, см. Соответствующие сведения об устранении неполадок состояния зондов работоспособности Azure Load Balancer на Майкрософт Learn для получения более подробных шагов по устранению неполадок.
  2. Посетите состояние Azure, чтобы определить наличие известных проблем с платформой или инфраструктурой Azure, которые могут повлиять на ресурс балансировщика нагрузки.
  3. Обратитесь к поддержка Azure для дальнейшего изучения, если вы наблюдаете эти события в журналах, и вы испытываете текущие проблемы с подключением.

Событие NoHealthyBackends

Серверные экземпляры подсистемы балансировки нагрузки не отвечают на пробы работоспособности. Неправильная настройка балансировщика нагрузки или внутренних экземпляров может вызвать это событие. Некоторые из распространенных причин:

  • Брандмауэр или правила группы безопасности сети блокируют IP-адрес теста работоспособности или порты.
  • Приложение не прослушивает настроенный порт пробы работоспособности или проба работоспособности настроена на неправильный порт.
  • Проверка работоспособности HTTP настроена, но приложение не отвечает с кодом состояния 200 OK.

Пример события

Critical - NoHealthyBackends: the frontend IP {FrontendIPAddress} is completely unreachable because all backend instances configured to the following protocol:port {Protocol:Port, Protocol:Port,...} are not responding to health probes. Please review the associated health probe configuration(s) and ensure that at least one of the backend instances are responding to the health probes on the configured ports. To mitigate this issue, please refer to aka.ms/lbhealth for more detailed event definitions and troubleshooting guidance.

Действия по устранению неполадок

Событие HighSnatPortUsage

Это событие указывает, что вы приближаетесь к исчерпанию портов SNAT на конкретных бэкенд-экземплярах. Вы хотите просмотреть архитектуру исходящего подключения.

Пример события

Warning - High SNAT Port Usage: Backend IP {BackendIPAddress} is utilizing more than 75% of SNAT ports allocated from frontend IP {FrontendIPAddress} and is at-risk for SNAT port exhaustion. To reduce the risk of SNAT exhaustion, please refer to aka.ms/lbhealth for more detailed event definitions and troubleshooting guidance.

Действия по устранению неполадок

  • Дополнительные сведения о распространенных параметрах исходящего подключения Azure см. в разделе Source Network Address Translation (SNAT) для исходящих подключений — Azure Load Balancer.
  • Для рабочих сценариев рекомендуется использовать шлюз NAT для ваших потребностей в исходящем подключении. Шлюз NAT обеспечивает динамическое выделение SNAT, поэтому снижает риск неудачных подключений из-за нехватки портов SNAT. Подробные шаги по улучшению архитектуры исходящей связности см. в разделе "Шаги устранения неполадок" под разделом событий SnatPortExhaustion в этой статье.

Событие SnatPortExhaustion

Это событие указывает, что все выделенные порты SNAT исчерпаны для одного или нескольких экземпляров серверной части.

Пример события

Critical - SNATPortExhaustion: Backend IP {BackendIPAddress} has exhausted all SNAT ports allocated to it.  One of the frontend IPs where the backend IP gets SNAT port is {FrontendIPAddress}. To reduce the risk of SNAT exhaustion, please refer to aka.ms/lbhealth for more detailed event definitions and troubleshooting guidance.

Действия по устранению неполадок

  1. Чтобы устранить проблемы с исчерпанием SNAT, рекомендуется использовать шлюз NAT. Дополнительные сведения о том, как шлюз NAT снижает риск нехватки портов SNAT, см. в статье Source Network Address Translation (SNAT) с Azure NAT Gateway.
  2. Если вы используете правила исходящего трафика балансировщика нагрузки и хотите перейти на использование шлюза NAT, см. Руководство: перенос исходящего доступа к шлюзу NAT.
  3. Чтобы определить затронутые подключения из-за исчерпания портов SNAT:
    1. На портале Azure выберите ресурс подсистемы балансировки нагрузки.
    2. На Обзоре балансировщика нагрузки выберите Мониторинг>Метрики в левом меню.
    3. В окне метрик выберите метрику счетчика подключений SNAT и агрегированиесуммы.
    4. Выберите "Применить разделение" и выберите значение состояния подключения.
    5. Если состояние подключения равно сбою, это указывает количество неудачных подключений из-за нехватки портов SNAT.

Альтернативные решения

  1. Убедитесь, что вы настроили правила исходящего трафика путем назначения портов вручную и выделили максимальное возможное количество портов.
  2. Добавьте дополнительные общедоступные IP-адреса в шлюз Load Balancer или NAT.

Событие NetworkPlatformThrottlingActive

Это событие указывает, что ограничение платформы было применено к фронтальным IP-адресам балансировщика нагрузки из-за высокой нагрузки трафика или большого использования полосы пропускания. Возможно, вы хотите масштабировать приложения с несколькими интерфейсными IP-адресами.

Пример события

Critical - NetworkPlatformThrottlingActive: At {DateTime} UTC, we detected that the load balancer with frontend IP configuration {FrontendIPAddress} exceeded platform-defined network thresholds. As a result, you may experience packet drops due to active network throttling. For detailed event definitions and troubleshooting guidance, please refer to aka.ms/lbhealth.

Действия по устранению неполадок

  • Проверьте, получает ли приложение непредвиденный объем трафика, и если возникают какие-либо проблемы на стороне клиента, что приводит к увеличению трафика
  • Если это ожидаемый трафик, рассмотрите возможность масштабирования развертываний путем распределения трафика между несколькими интерфейсными IP-конфигурациями или подсистемами балансировки нагрузки.
  • Обратитесь к поддержка Azure для дальнейшего изучения, если вы наблюдаете эти события в журналах, и вы испытываете текущие проблемы с подключением.

Дальнейшие действия

Из этой статьи вы узнали, как устранить неполадки с каждым типом событий работоспособности Azure Load Balancer.

Дополнительные сведения о журналах событий работоспособности Azure Load Balancer и типах событий работоспособности, а также о сборе, анализе и создании оповещений с помощью этих журналов см. в следующей статье: