Сценарии аварийного восстановления
НазначениеОписание
ОписаниеНиже типовыхописаны сценариевтиповые сценарии аварийного восстановления системы Printum: симптомы, порядок действий и ориентировочное время восстановления.
Для успешного восстановления системы обязательно иметь резервные копии Мониторинга и ПринтМенеджера(ов) в рабочем состоянии, созданные с помощью встроенного функционала резервного копирования или внешними средствами (например, снапшота\бэкапами на гипервизоре).
Сценарий 1 —1: Отказ одного сервера ПринтМенеджера в кластере
конфигурации кластера
Симптомы
СтраницаНасостоянияпанели администратора HAProxyпоказываетодин или несколькоузловсервисов конкретного сервера ПМ отображаются как «DOWN».и подсвечены красным цветом.- Часть заданий
непечати,обрабатывается;копированияпользователии сканирования пользователей незамечаютобрабатываетсясбояустройствами(еслиподузловуправлением≥ 2).печатью.
Порядок действий
ПроверитьПроверьте статус контейнеров на отказавшем сервере:
cd /opt/printmanager && sudo docker-compose ps
sudo /opt/printmanager/logs.sh
sudo docker-compose logsdown
--tail=200sudo docker-compose restartup -d
- Если работоспособность ПМ не
помогаетвернулась,—выполнитевосстановитьего восстановление из резервной копии (см. «ВосстановлениеРезервноеизкопированиерезервнойикопии»восстановление данных»). - После восстановления
проверитьпроверьтестраницусостояниесостояниясервисов всех ПМ на странице панели администратора HAProxy.
Ориентировочное время: 15–30 минут при перезапуске; 60–120 минут при восстановлении из резервной копии.
Сценарий 2 — Отказ нескольких серверов ПринтМенеджера
Симптомы
- Большинство заданий печати, копирования и сканирования пользователей не
обрабатываются.обрабатываются не обрабатываются на устройствах под управлением печатью. - На панели администратора HAProxy
показываетменее половины узлов отображаются в статусе «UP» и отмечены зелёным цветом (кластер утратил кворум).
Порядок действий
ВосстановитьВосстановитенаибольшеесерверачислоПринтМенеджера,серверовпоПринтМенеджер (перезапуск контейнеров или восстановлениеописанию изрезервнойсценариякопии)№1 (пункты 1-6).Убедиться,Послечтовосстановления:активно≥- Проверьте
(N/2состояние+сервисов1)всехузловПМ(кворум),нагдестраницеNпанели—администратораобщее число узлов.HAProxy. ПроверитьПроверьтестатусуспешностьHAProxyвыполнения заданий печати, копирования исинхронизациюсканированияснаМониторингом.устройствах под управлением печатью.
Ориентировочное время: 60–240 минут в зависимости от числа отказавших узлов.
Сценарий 3 — Потеря базы данных PostgreSQL
Симптомы
- Ошибки в логах ПМ:
django.db.utils.OperationalError: connection to server failed - Веб-интерфейс Личного кабинета недоступен или отображает ошибки.
Порядок действий
Убедиться,Убедитесь, что контейнер PostgreSQL запущен:
sudo docker ps | grep postgres
Если контейнер
упалне запущен —перезапустить:запустите его:
cd /opt/printum
sudo docker-compose up -d postgres
cd /opt/printmanager
sudo docker-compose up -d db
Если
данныевозникаютповрежденыошибки —восстановитьсоберитебазулоги работы контейнеров и выполните восстановление из резервнойкопии.копии:
sudo /opt/printum/logs.sh
#или
sudo /opt/printmanager/logs.sh
Для восстановления на чистый сервер выполнитьвыполните команды (см.из раздела «Восстановление изрезервных резервнойкопий» копии»):
sudoстранице tar«Резервное xzvfкопирование printum_backup_<date>и восстановление данных».tar.gz
sudo printum_backup_<date>/restore.sh
ПодождатьПодождите несколько минут для запуска системы.
Ориентировочное время: 30–120 минут в зависимости от объёма данных.
Важно: IP-адрес или hostname сервера должны совпадать с теми, что были при создании резервной копии.
Сценарий 4 — Потеря NFS-хранилища (кластер)
Симптомы
- Пользователи при попытке
печатипечати, копирования и сканирования заданий на устройствах под управлением печатью получают ошибку «Файл недоступен». - Логи
ПринтМенеджерПринтМенеджера содержат ошибки обращения к NFS-директории.
Порядок действий
файл на NFS-сервере:ПроверитьПроверьте доступность NFS-сервера с сервера ПМ:попробоватьвручнуюсмонтироватьсоздайтепапкутестовыйвручную.
cd /opt/printmanager
sudo docker-compose exec app touch /opt/app/public/media/test.txt
УбедитьсяУбедитесь в правильности параметров DRIVER_OPTS_DEVICE, DRIVER_OPTS_O, DRIVER_OPTS_TYPE для NFS-сервера в /opt/printmanager/.env:
sudo cat /opt/printmanager/.env
Проверить
sudo /opt/printmanager/logs.sh
восстановление NFS-сервера из резервной копии. После восстановления NFSперезапустите перезапуститьконтейнеры контейнеры:ПМ:
cd /opt/printmanager
sudo docker-compose restartdown
sudo docker-compose up -d
печати, копирования и сканирования обрабатываются корректно.Проверить,Проверьте, что задания в отложенной очередиобрабатываются.
Ориентировочное время: 15–60 минут.