- Validation des invariants (idempotence, timeout, corrélation).
- Tests unitaires sur politiques de résilience.
- Tests d’intégration Kafka → API externe mockée → audit Ceph.
- Injection de latence et pertes (VM/TC/netem).
- Vérification de la stabilité p95/p99 et du comportement circuit breaker.
- Contrôle du backpressure (absence d’explosion mémoire/threads).
- Génération charge continue (k6/Locust) avec paliers.
- Mesure saturation CPU, mémoire, IO Ceph RGW, queue depth.
- Validation des SLO en charge nominale et pic.
graph LR
subgraph VM1[VM-1 Ingress]
LG[Load Generator]
end
subgraph VM2[VM-2 Pipeline]
SVC[NetScope Service]
K[Kafka]
end
subgraph VM3[VM-3 Storage/Obs]
C[Ceph RGW]
P[Prometheus]
G[Grafana]
end
LG --> SVC
SVC --> K
SVC --> C
SVC --> P
G --> P
- 100% des requêtes sortantes traçables (
trace_idprésent). - 100% des événements critiques écrits dans Ceph (ou buffer de reprise durable).
- Dashboard WS reflète les événements en < 2 s.
- p95 latence conforme cible en charge nominale définie.
- Aucun retry non idempotent autorisé.
- Procédure de démarrage/arrêt environnement Docker.
- Checklist de santé: Kafka, service, RGW, métriques, WS.
- Procédure incident: hausse erreurs, circuit ouvert, retard audit, saturation queue.
- Procédure replay depuis Kafka / reconstitution depuis audit Ceph.
- Revues d’architecture brèves à chaque étape (Probe, Metrics, API, WS, Ceph).
- Contrat de schéma d’événement gelé par version.
- Changement d’invariant = décision explicite + mise à jour doc obligatoire.