Большинство (86,9%) российских Enterprise-компаний утверждают о высоком уровне готовности к чрезвычайным ситуациям. Однако на практике устойчивость к таким ситуациям реализована лишь частично. Это подтверждают результаты исследования, проведенного разработчиком инфраструктурного программного обеспечения Orion soft. Редакция IT Speaker ознакомилась с результатами.

Как сообщил IT Speaker Евгений Макарьин, глава группы разработки продуктов и решений Linx Cloud, причина, по которой компании утверждают о высокой готовности к авариям, но почти не проверяют планы восстановления регулярно, заключается в ошибочном мнении, что такая проверка не является срочной задачей.
«Аварии не происходят каждый день или месяц, а операционная деятельность продолжается. Поэтому задача проверки планов восстановления в матрице приоритетов откладывается в категорию “не срочных”. Это приводит к ситуации, когда DR-план остается в состоянии Шредингера – пока не попытаемся восстановиться, не знаем, сработает ли он», – отметил эксперт.
74% компаний сталкиваются с аварийными сбоями не чаще одного-двух раз в год. Тем не менее, построение катастрофоустойчивости является высоким приоритетом в развитии инфраструктуры: 86,9% организаций имеют хотя бы частично спланированные сценарии Disaster Recovery (DR), а 91,3% внедряют средства репликации, включая DR-решения на уровне виртуализации и аппаратную репликацию на уровне систем хранения данных (СХД).
Высокий уровень подготовки к авариям объясняется строгими требованиями к доступности инфраструктуры и непрерывности бизнес-процессов. Так, для 87,7% респондентов время восстановления после сбоя (RTO) является строго регламентированным параметром. Для 41,5% целевой показатель RTO составляет до одного часа, что свидетельствует о высоком уровне критичности бизнес-процессов. Еще 46,2% допускают простой в несколько часов, и лишь 12,3% респондентов могут позволить себе восстановление в течение суток.
В то же время, несмотря на заявления о высоком уровне готовности к авариям, значительная часть компаний не обладает системным подходом к проверке планов восстановления в реальных условиях. Только 34,4% компаний проводят регулярные учения чаще двух раз в год. Около 37,6% не проводят проверок систем для аварийного восстановления либо протестировали их лишь один раз при внедрении. Кроме того, даже при наличии DR-инструментов для 68,1% организаций основным методом аварийного восстановления остается резервное копирование и ручное восстановление виртуальных машин в работу.
Андрей Кузнецов, генеральный директор ООО «РуБэкап» (входит в «Группу Астра»), рассказал IT Speaker, что такая статистика объясняется несколькими факторами. Самая распространенная причина заключается в том, что DR-тесты требуют времени команды ИТ, окон обслуживания, иногда отдельного стенда и привлечения смежных подразделений, но напрямую не приносят доход. В условиях ограниченных бюджетов и высокой операционной нагрузки такие мероприятия легко откладываются «на потом»; к тому же, ИТ-команды перегружены, и DR уходит на второй план.
Султан Салпагаров, архитектор по информационной безопасности Getmobit, также поделился с IT Speaker информацией о том, в каких сценариях резервного копирования достаточно, а когда требуются изолированные контуры и автоматическое восстановление. По словам эксперта, защита резервированием – это дорого и не гарантировано, а также требует значительных ресурсов. В результате начинается поиск компромиссов, где цена надежности становится критической – вместо полного копирования выполняется инкрементальное, дублируются только самые критические подсистемы.
«Резервного копирования достаточно, только если консистентность базы данных можно сохранить простым копированием. Для систем, которые не могут быть “заморожены” в текущем состоянии конечного автомата, а большинство из них таковыми не являются – копия будет просто непригодна. Такие системы необходимо резервировать полностью, с синхронизацией всех информационных потоков. Чаще всего резервные системы работают в паре с базовыми, разделяя нагрузку или функционируя как горячий резерв», – добавил эксперт.
Что касается автоматизации, то Евгений Макарьин считает, что она позволяет уменьшить количество ошибок при ручном восстановлении. Если компания ставит себе RTO, измеряемый десятками минут, а не часами и днями, то без автоматизации не обойтись. Эксперт отметил, что все зрелые системы аварийного восстановления позволяют заранее настроить Recovery plan и восстанавливать все серверы всего несколькими нажатиями кнопок.
«Автоматизация сокращает время простоя с часов до минут и устраняет главный риск ручного восстановления – человеческую ошибку. Она абсолютно необходима для микросервисов, крупных масштабов, облачных сред и ситуаций, когда цена минуты простоя многократно превышает стоимость внедрения инструментов оркестрации. Автоматизация аварийного восстановления – это не просто “ускорение” процесса, а фундаментальное изменение парадигмы: переход от ручного исполнения чек-листов к программно управляемому сценарию», – добавил Андрей Кузнецов.
Ранее российский независимый провайдер услуг ИТ-инфраструктуры Selectel запустил решение для аварийного восстановления инфраструктуры на базе «Хайстекс Акура». Сервис позволяет компаниям создать резервную площадку в облаке Selectel и быстро восстановить работоспособность ИТ-систем в случае недоступности основной инфраструктуры.
Россия вошла в рейтинг топ-5 стран по числу DDoS-атак


