Monitoring, ktorý vás nebudí pre každú drobnosť
Ako rozlíšiť incident od krátkeho zakolísania a nastaviť upozornenia, na ktoré sa dá spoľahnúť.

Ak príde dvadsať upozornení denne a väčšina nevyžaduje zásah, tím si zvykne odkladať ich čítanie. Skutočný výpadok potom dostane rovnakú pozornosť ako krátka sieťová chyba. Užitočný alert má jasný dôvod, konkrétneho príjemcu a krok, ktorý sa po doručení oplatí urobiť.
Začnite dopadom na používateľa
Nedostupné prihlásenie má iný význam než krátky nárast využitia CPU. Meranie zdrojov je dôležité pri diagnostike a kapacitnom plánovaní, ale nie každá odchýlka musí niekoho zobudiť. Oddeľte urgentný incident, upozornenie na preverenie počas dňa a údaj, ktorý má zostať iba v grafe.
Pre každý urgentný alert si napíšte očakávanú reakciu. Ak neviete povedať, čo má človek po jeho prijatí urobiť, pravidlo treba spresniť. Samotná existencia metriky nie je dôvodom na notifikáciu.
Potvrdenie chyby je kompromis s časom detekcie
Jeden neúspešný pokus môže byť prechodná chyba spojenia. Viac neúspešných kontrol alebo nezávislé overenie zníži šum, no posunie upozornenie neskôr. Interval a podmienky preto nastavte podľa služby. Pri zlyhaní platby môže byť dlhé čakanie neprijateľné; pri internom reporte nemusí byť kritické.
Po obnovení použite primerané potvrdenie stabilného stavu. Inak sa služba na hranici timeoutu bude neustále prepínať medzi výpadkom a zotavením. Súčasne sa vyhnite nastaveniu, ktoré zakryje opakované krátke výpadky: aj tie môžu zákazníkom kaziť prácu.
Doručte správu človeku, ktorý vie konať
Priraďte služby kontaktným skupinám a určte náhradníka. E-mail môže stačiť pri menej urgentnej úlohe, pri kritickej službe potrebujete kanál, ktorý tím skutočne sleduje. Doručenie vyskúšajte kontrolovaným testom. Platná adresa ešte nezaručuje, že upozornenie niekto uvidí.
Údržbu plánujte a pravidlá pravidelne čistite
Plánovanú odstávku odlíšte od incidentu a vopred ohraničte jej trvanie. Neumlčujte monitor na neurčito. Po opakovanom falošnom alerte preskúmajte dôvod, miesto toho, aby ste len zvyšovali timeout. Možno kontrolujete nesprávny endpoint alebo prehliadate skutočný problém.
- Názov a adresa zasiahnutej služby.
- Čas začiatku a presný prejav chyby.
- Odkaz na históriu kontrol a postup diagnostiky.
- Zodpovedná osoba a náhradný kontakt.
Čo si odniesť
Cieľom nie je čo najmenej upozornení za každú cenu. Cieľom je, aby každé urgentné upozornenie nieslo informáciu, ktorú tím potrebuje práve teraz, a viedlo k užitočnej reakcii.


