🛡️ SecurewebScan

ADR-002 — Architecture Decision Record

Politique SRE et modèle d'alerte par Error Budget

Décision — Stack technique

Prometheus Operator (via le chart kube-prometheus-stack), Grafana et Loki sont déployés en GitOps, au même titre que tout autre composant du cluster. Les ressources allouées sont actuellement volontairement réduites pour tenir sur le nœud EC2 t4g.medium unique.

Décision — Modèle d'alerte

Le modèle de burn rate est retenu plutôt qu'un seuil de disponibilité brut :

Ce modèle, standard dans la pratique SRE, évite de déclencher une alerte pour un incident isolé de quelques secondes tout en détectant rapidement une dégradation structurelle.

Fonctionnement du burn rate

Le budget d'erreur mensuel est de 0,5% (environ 3h36 d'indisponibilité autorisée par mois).

Décision — Cibles initiales

Décision — Canal d'alerte unifié

Les alertes SRE (Alertmanager) transitent par le même topic SNS que les alertes de sécurité, évitant la prolifération de canaux distincts et centralisant la vigilance opérationnelle.

Conséquences