A három pillér
A metrika (mit és mennyit) idősoros szám, olcsó tárolni és riasztani rá. A log (mi történt) a részletes esemény-napló. A trace (hol lassult) egy kérés útját követi a szolgáltatások között. Külön-külön részigazság, együtt a teljes kép.
- Metrika: CPU, memória, tár, I/O, hálózati késleltetés
- Log: strukturált, kereshető, korrelálható események
- Trace: elosztott kérés-követés a mikroszolgáltatások közt
Proaktív, nem reaktív
A jó monitoring nem a kiesést jelenti, hanem megelőzi. A SLI (service level indicator) méri a szolgáltatás valódi minőségét, az SLO (objective) tűzi ki a célt, az error budget pedig megmondja, mennyi hiba fér még bele — mielőtt leállítjuk a kiadásokat és a stabilitásra fókuszálunk.
slo:availability: 99.9% # havi ~43 perc hibakeretlatency_p95: 300msalert_on: burn_rate > 2
Biztonsági esemény-figyelés
A monitoring és a biztonság összeér: a szokatlan bejelentkezési mintázat, a jogosultság-emelkedés vagy a kiugró kimenő forgalom ugyanúgy anomália, mint egy teljesítmény-probléma — csak a tét más.