В статье рассмотрена проблема незапланированных простоев из-за отказа серверного оборудования на производстве. Эта проблема рассматривается на примере молочного и пивного производства, поскольку они не допускают долгих простоев. Даже после 10-минутного простоя нарушаются технологические процессы пастеризации и фильтрации и дело заканчивается потерей сырья, дополнительными затратами на санитарную обработку и повторный запуск производства. В подобных условиях способность инфраструктуры обеспечивать непрерывность работы технологических систем имеет критическое значение.
Значительная часть материала посвящена ограничениям традиционных методов резервирования. Авторы отмечают, что стандартные подходы, включая резервное копирование, холодный резерв и встроенные механизмы кластеризации, позволяют сохранить данные, но не предназначены для того, чтобы быстро восстановить работу производственных систем. Отдельно рассматриваются риски, связанные с человеческим фактором, а также последствия некорректных действий персонала при возникновении аварийной ситуации в ИТ-инфраструктуре.

Рис. Архитектура отказоустойчивой системы управления техпроцессом на базе ПО «ГиперСфера»
Исходя из этого, компания «СТР» разработала платформу виртуализации «ГиперСфера», предназначенную для того, чтобы повысить отказоустойчивость инфраструктуры. В статье подробно описывается архитектура решения, построенного на двух физических серверах с синхронным копированием виртуальных машин, содержащих SCADA-системы, базы данных, MES и шлюзовые компоненты. Объясняется, каким образом реализуется высокая доступность виртуальных машин без применения отдельной системы хранения данных, а также как обеспечивается автоматическое восстановление работы после отказа оборудования. Отдельно рассматриваются режимы высокой доступности и непрерывной доступности (HA и FT), различия между ними и особенности их применения для разных типов производств. Затрагиваются вопросы построения отказоустойчивой физической инфраструктуры: резервирования блоков питания, использования RAID-массивов, дублирования сетевых подключений и организации вычислительных кластеров.


_small.jpg)
