Мониторинг инфраструктуры
Мониторинг игровой платформы — обязательное условие 99.99% uptime и compliance. Без observability невозможно вовремя реагировать.
Три столпа observability
Metrics: временны́е ряды (RPS, latency, error rate). Prometheus + Grafana. Logs: события системы с контекстом. Loki, Elasticsearch. Traces: путь запроса через микросервисы. Jaeger, Tempo. Вместе дают полную картину состояния.
Golden signals (SRE)
Latency: P50/P95/P99 время ответа. Traffic: RPS, concurrent users. Errors: 5xx rate, failed transactions. Saturation: утилизация CPU/memory/disk. Дашборды по каждому сервису. Alerting только на симптомы (latency, errors), не на CPU.
Business metrics
GGR (Gross Gaming Revenue) real-time. Активные игроки. Deposit/withdrawal success rate. RTP по играм. Alerting на аномалии: резкое падение оборота, всплеск проигрышей. Anomaly detection: Prophet, statistical baselines.
SLI/SLO/SLA
SLI: измеримый показатель качества (uptime, latency). SLO: внутренняя цель (99.95%). SLA: контракт с клиентами (99.9%). Error budget: разрешённое время недоступности. Гейминг-регуляторы требуют reporting SLA breach.