Failover
Failover — автоматическое переключение нагрузки с отказавшего компонента на резервный для обеспечения непрерывности сервиса.
Типы
Active-passive: standby ждёт, включается при отказе primary. Recovery time зависит от startup. Active-active: обе стороны работают, при отказе одной вторая берёт всю нагрузку. Быстрее, дороже. Cold vs warm vs hot standby по степени готовности.
Метрики
RTO (Recovery Time Objective): целевое время восстановления, 30 сек — 1 час. RPO (Recovery Point Objective): допустимая потеря данных, 0 сек (sync replication) — минуты. SLA определяет требования: 99.99% uptime = 52 мин downtime/год.
Механизмы
DNS failover (Route53 health checks): TTL зависит от кэша, минуты. Anycast IP: секунды. Load balancer health check + автозамена unhealthy. Database failover через orchestrator (Patroni, Orchestrator). Cross-region — сложнее, обычно async.
iGaming-специфика
Multi-region active-active для основных сервисов. Wallet: hot standby с sync репликацией в регионе. Payment orchestration: routing к альтернативному PSP при отказе первичного. Regular chaos engineering (Netflix Chaos Monkey, Gremlin) для валидации failover. Регуляторы требуют документированный DR-план и регулярные drills.