Создание плана аварийного восстановления

Бизнес-приложения Microsoft обеспечивают возможности обеспечения непрерывности бизнеса и аварийного восстановления (BCDR) для всех производственных сред в Dynamics 365 и Power Platform приложениях программного обеспечения как услуги (SaaS). Узнайте, как Microsoft обеспечивает устойчивость ваших производственных данных во время региональных сбоев.

Примечание.

Ознакомьтесь с рекомендациями по разработке стратегии восстановления после сбоев, специфичными для конкретной рабочей нагрузки. В этой статье обобщены основные рекомендации и передовой опыт по созданию плана восстановления после сбоев.

Задокументируйте свой план восстановления после аварии

Ключом к надежной стратегии аварийного восстановления рабочей нагрузки является план аварийного восстановления. Проводите учения по восстановлению после сбоев или реагируйте на чрезвычайные ситуации до того, как произойдет настоящая катастрофа, чтобы задокументировать все шаги, необходимые для любых внешних точек интеграции Power Platform. Такая подготовка гарантирует готовность вашей компании к восстановлению в случае настоящей катастрофы.

Хотя ваш план восстановления после сбоев может быть адаптирован к вашей конкретной рабочей нагрузке или среде, предоставление шаблонов и рекомендаций группам по рабочей нагрузке гарантирует, что они выполнят все необходимые шаги.

Ниже приведены некоторые этапы создания комплексного плана восстановления после сбоя для Power Platform, а также роли и обязанности участвующих членов команды:

  • Оценка рисков и анализ влияния на бизнес: группы по рабочей нагрузке оценивают типы катастроф, которые могут повлиять на их решения, и определяют потенциальное влияние этих рисков на бизнес-операции, включая потерю данных, простои и финансовые последствия. Группы по рабочей нагрузке определяют критические потоки и выполняют анализ видов отказов.
  • Определите цели восстановления: установите максимально приемлемое время простоя для ваших Power Platform приложений и определите максимально приемлемую потерю данных, измеренную во времени. Узнайте больше о показателях доступности и целевых показателей восстановления.
  • Разработайте стратегии восстановления: регулярно создавайте резервные копии сред, а также определяйте, тестируйте и реализуйте подход к отказоустойчивости с помощью самостоятельного аварийного восстановления.
  • Создайте план коммуникации: разработайте план коммуникации со всеми заинтересованными сторонами во время стихийного бедствия, включая роли и обязанности.
  • Задокументируйте план восстановления после сбоя: задокументируйте пошаговые процедуры восстановления после сбоя, включая порядок восстановления данных, переключения на резервные системы и проверки целостности системы. Включите контактные данные ключевого персонала, поставщиков и экстренных служб.
  • Протестируйте и обновите план восстановления после сбоев: проводите регулярные учения по восстановлению после сбоев, чтобы убедиться, что план эффективен, а члены команды знакомы со своими ролями. Регулярно обновляйте план с учетом результатов испытаний, изменений в окружающей среде и уроков, извлеченных из реальных инцидентов.

Подробнее: Разработайте план восстановления после сбоев

Роли и обязанности

Вот некоторые роли и их обязанности, которые необходимо учитывать при планировании и документировании плана восстановления после сбоя:

  • Руководитель операций: контролирует разработку, реализацию и поддержание плана восстановления после сбоев. Координирует оценки рисков, управляет усилиями по восстановлению и обеспечивает регулярное тестирование и обновление плана.
  • Команда ИТ-операций и Power Platform администратор: обеспечивает техническую поддержку и экспертизу во время восстановления после сбоев. Реализует решения по резервному копированию и избыточности, восстанавливает системы и данные, а также проверяет целостность систем.
  • Планировщик непрерывности бизнеса: обеспечивает возможность продолжения бизнес-операций во время и после катастрофы. Разрабатывает и поддерживает план обеспечения непрерывности бизнеса, координирует работу с менеджером по восстановлению после сбоев и взаимодействует с заинтересованными сторонами.
  • Руководитель отдела коммуникаций: управляет внутренней и внешней коммуникацией во время стихийных бедствий. Разрабатывает планы коммуникаций, готовит шаблоны коммуникаций и обеспечивает своевременное распространение информации.
  • Исполнительный спонсор: Обеспечивает руководство и поддержку усилиям по восстановлению после стихийных бедствий. Распределяет ресурсы, утверждает план восстановления после сбоев и обеспечивает его соответствие бизнес-целям.
  • Группа по управлению рабочей нагрузкой: обеспечивает возможность восстановления и работоспособность определенных рабочих нагрузок после стихийного бедствия. Следуйте предоставленным шаблонам и инструкциям для выполнения всех необходимых шагов, регулярно выполняйте резервное копирование и тестируйте процедуры восстановления.
  • Заинтересованные стороны бизнеса: Представляют интересы бизнеса и обеспечивают соответствие целям бизнеса. Вносите свой вклад в критически важные бизнес-функции, утверждаете цели восстановления и участвуете в тестировании и обзоре плана восстановления после сбоев.

Определите и реализуйте подход к отказоустойчивости с помощью самостоятельного аварийного восстановления

Благодаря самостоятельному аварийному восстановлению вы можете определить, протестировать и реализовать межрегиональный подход к отказоустойчивости для своих Power Platform сред. Такой подход помогает вам соблюдать нормативные требования и обеспечивает бесперебойную работу рабочих нагрузок в случае возникновения непредвиденных проблем в масштабах региона.

Если для среды включена функция самостоятельного аварийного восстановления, копия среды сохраняется во вторичном регионе. Такая конфигурация обеспечивает непрерывность бизнеса, позволяя рабочим нагрузкам переключаться на резервный регион в случае масштабных сбоев, сводя к минимуму время простоя и последствия.

Функция самостоятельного аварийного восстановления также поддерживает режим экстренного реагирования. В случае серьезного сбоя переключение в режим экстренного реагирования ставит приоритетной задачей скорейшее восстановление услуг. Это означает пропуск репликации данных и переход к последней полностью проверенной копии для быстрого восстановления работы. Вы можете контролировать каждый этап процесса аварийного переключения, от проверки до выполнения, обеспечивая прозрачность и контроль. Независимо от того, проводится ли тренировка по восстановлению после сбоя или аварийное переключение, задержка репликации между регионами обычно составляет менее 15 минут.

Проводите тренировочные упражнения по аварийному восстановлению

Тестирование восстановления после сбоев имеет решающее значение для разработки надежного плана восстановления после сбоев. Во многих отраслях действуют системы соответствия, требующие регулярных учений по восстановлению после сбоев. Регулярные учения по восстановлению после сбоев имеют решающее значение для успеха, независимо от отрасли.

Благодаря самостоятельному аварийному восстановлению вы контролируете, когда следует проводить отработки отказов для обеспечения соответствия требованиям, а когда следует выполнять аварийные переключения и возвраты к исходному состоянию.

Проводите учения на копии производственной среды, поскольку этот процесс подразумевает простой, который может длиться несколько минут. Например, скопируйте производственную среду в среду «песочницы», а затем измените ее тип на производственный.