Observabilité : la stack Prometheus + Loki + Grafana
La stack PLG unifie métriques et journaux avec une empreinte mémoire modeste, idéale pour un laboratoire de plusieurs machines virtuelles.
Contexte
Un SOC ne surveille pas que la sécurité : disponibilité et performance des hôtes donnent le contexte indispensable pour interpréter une alerte.
Analyse
Prometheus collecte les métriques (CPU, RAM, disque, réseau) via node_exporter. Promtail (ou Grafana Alloy) pousse les journaux vers Loki, qui les indexe par étiquettes plutôt qu’en texte intégral. Grafana unifie les deux dans des tableaux de bord et gère l’alerting.
# Exemple LogQL : échecs SSH par hôte sur 5 minutes
sum by (host) (count_over_time({job="auth"} |= "Failed password" [5m]))
À retenir
- Empreinte mémoire faible comparée à ELK : adaptée aux labs et petites infrastructures.
- LogQL reprend la logique de PromQL : une seule façon de penser métriques et logs.
- Grafana centralise métriques, logs et alertes dans une seule interface.
Application dans mon lab
La supervision du lab SOC GSB s’appuie sur Zabbix ; PLG est étudiée comme alternative orientée logs.