Мониторинг инфраструктуры

Мониторинг игровой платформы — обязательное условие 99.99% uptime и compliance. Без observability невозможно вовремя реагировать.

Три столпа observability

Metrics: временны́е ряды (RPS, latency, error rate). Prometheus + Grafana. Logs: события системы с контекстом. Loki, Elasticsearch. Traces: путь запроса через микросервисы. Jaeger, Tempo. Вместе дают полную картину состояния.

Golden signals (SRE)

Latency: P50/P95/P99 время ответа. Traffic: RPS, concurrent users. Errors: 5xx rate, failed transactions. Saturation: утилизация CPU/memory/disk. Дашборды по каждому сервису. Alerting только на симптомы (latency, errors), не на CPU.

Business metrics

GGR (Gross Gaming Revenue) real-time. Активные игроки. Deposit/withdrawal success rate. RTP по играм. Alerting на аномалии: резкое падение оборота, всплеск проигрышей. Anomaly detection: Prophet, statistical baselines.

SLI/SLO/SLA

SLI: измеримый показатель качества (uptime, latency). SLO: внутренняя цель (99.95%). SLA: контракт с клиентами (99.9%). Error budget: разрешённое время недоступности. Гейминг-регуляторы требуют reporting SLA breach.