← vissza a főoldalra

Monitoring

Monitoring és megfigyelhetőség (observability)

Nem tudod üzemeltetni, amit nem látsz. A megfigyelhetőség három pillére — metrika, log, trace — együtt adja meg a rendszer teljes belső állapotát.

A három pillér

A metrika (mit és mennyit) idősoros szám, olcsó tárolni és riasztani rá. A log (mi történt) a részletes esemény-napló. A trace (hol lassult) egy kérés útját követi a szolgáltatások között. Külön-külön részigazság, együtt a teljes kép.

  • Metrika: CPU, memória, tár, I/O, hálózati késleltetés
  • Log: strukturált, kereshető, korrelálható események
  • Trace: elosztott kérés-követés a mikroszolgáltatások közt

Proaktív, nem reaktív

A jó monitoring nem a kiesést jelenti, hanem megelőzi. A SLI (service level indicator) méri a szolgáltatás valódi minőségét, az SLO (objective) tűzi ki a célt, az error budget pedig megmondja, mennyi hiba fér még bele — mielőtt leállítjuk a kiadásokat és a stabilitásra fókuszálunk.

slo:  availability: 99.9%   # havi ~43 perc hibakeret  latency_p95: 300msalert_on: burn_rate > 2

Biztonsági esemény-figyelés

A monitoring és a biztonság összeér: a szokatlan bejelentkezési mintázat, a jogosultság-emelkedés vagy a kiugró kimenő forgalom ugyanúgy anomália, mint egy teljesítmény-probléma — csak a tét más.

Kérdésed van ebben a témában? Vegyük fel a kapcsolatot.

Kapcsolatfelvétel