Monitoring, ktorý vás nebudí pre každú drobnosť

Ako rozlíšiť incident od krátkeho zakolísania a nastaviť upozornenia, na ktoré sa dá spoľahnúť.

Monitor a notebook na pracovnom stole v tlmenom svetle
Fotografia: Ales Nesetril / Unsplash

Ak príde dvadsať upozornení denne a väčšina nevyžaduje zásah, tím si zvykne odkladať ich čítanie. Skutočný výpadok potom dostane rovnakú pozornosť ako krátka sieťová chyba. Užitočný alert má jasný dôvod, konkrétneho príjemcu a krok, ktorý sa po doručení oplatí urobiť.

Začnite dopadom na používateľa

Nedostupné prihlásenie má iný význam než krátky nárast využitia CPU. Meranie zdrojov je dôležité pri diagnostike a kapacitnom plánovaní, ale nie každá odchýlka musí niekoho zobudiť. Oddeľte urgentný incident, upozornenie na preverenie počas dňa a údaj, ktorý má zostať iba v grafe.

Pre každý urgentný alert si napíšte očakávanú reakciu. Ak neviete povedať, čo má človek po jeho prijatí urobiť, pravidlo treba spresniť. Samotná existencia metriky nie je dôvodom na notifikáciu.

Potvrdenie chyby je kompromis s časom detekcie

Jeden neúspešný pokus môže byť prechodná chyba spojenia. Viac neúspešných kontrol alebo nezávislé overenie zníži šum, no posunie upozornenie neskôr. Interval a podmienky preto nastavte podľa služby. Pri zlyhaní platby môže byť dlhé čakanie neprijateľné; pri internom reporte nemusí byť kritické.

Po obnovení použite primerané potvrdenie stabilného stavu. Inak sa služba na hranici timeoutu bude neustále prepínať medzi výpadkom a zotavením. Súčasne sa vyhnite nastaveniu, ktoré zakryje opakované krátke výpadky: aj tie môžu zákazníkom kaziť prácu.

Doručte správu človeku, ktorý vie konať

Priraďte služby kontaktným skupinám a určte náhradníka. E-mail môže stačiť pri menej urgentnej úlohe, pri kritickej službe potrebujete kanál, ktorý tím skutočne sleduje. Doručenie vyskúšajte kontrolovaným testom. Platná adresa ešte nezaručuje, že upozornenie niekto uvidí.

Údržbu plánujte a pravidlá pravidelne čistite

Plánovanú odstávku odlíšte od incidentu a vopred ohraničte jej trvanie. Neumlčujte monitor na neurčito. Po opakovanom falošnom alerte preskúmajte dôvod, miesto toho, aby ste len zvyšovali timeout. Možno kontrolujete nesprávny endpoint alebo prehliadate skutočný problém.

  • Názov a adresa zasiahnutej služby.
  • Čas začiatku a presný prejav chyby.
  • Odkaz na históriu kontrol a postup diagnostiky.
  • Zodpovedná osoba a náhradný kontakt.

Čo si odniesť

Cieľom nie je čo najmenej upozornení za každú cenu. Cieľom je, aby každé urgentné upozornenie nieslo informáciu, ktorú tím potrebuje práve teraz, a viedlo k užitočnej reakcii.

Dokumentácia a ďalšie čítanie

Mgr. Martin Hlavaj, MBA

Softvérový inžinier

Všetky články

O výpadku sa dozviete včas.

Pridajte svoj web alebo API do UpBota a nastavte, komu príde upozornenie.

Začať monitorovať zadarmo