
Po výpadku: ako napísať postmortem, ktorý niečo zmení
Časová os, skutočný dopad a konkrétne opatrenia. Užitočný zápis z incidentu pomôže tímu viac než hľadanie vinníka.
Praktické čítanie o výpadkoch, serveroch a monitoringu. Aby ste vedeli, čo sledovať, kde hľadať chybu a ako sa vrátiť do prevádzky.

Pokojný postup od prvého upozornenia po obnovu služby. Ako overiť rozsah výpadku, zastaviť ďalšie zmeny a nestratiť čas náhodnými reštartmi.

Časová os, skutočný dopad a konkrétne opatrenia. Užitočný zápis z incidentu pomôže tímu viac než hľadanie vinníka.

Timeout, obmedzené opakovanie a idempotencia. Ako zabrániť tomu, aby sa malý problém jednej služby rozšíril na celý systém.

Od dostupného endpointu k použiteľnej službe. Čo kontrolovať v odpovedi, odozve a závislostiach API.

Web môže fungovať, zatiaľ čo zálohy a importy stoja. Heartbeat pomôže sledovať dokončenie úloh, ktoré nemajú vlastný verejný endpoint.

Úspešná zálohovacia úloha je iba začiatok. RPO, RTO a pravidelný test obnovy ukážu, akú ochranu dát v skutočnosti máte.

Ako rozlíšiť incident od krátkeho zakolísania a nastaviť upozornenia, na ktoré sa dá spoľahnúť.

Automatická obnova môže zlyhať na DNS, oprávneniach aj konfigurácii. Prečo kontrolovať certifikát, ktorý vidí návštevník.

Ako rozlíšiť chybu DNS od chyby aplikácie a pripraviť zmenu záznamov bez zbytočného výpadku.

CPU je iba časť obrazu. Ako spojiť odozvu, chyby, pamäť, disk a fronty pri hľadaní úzkeho miesta.
Pridajte svoj web alebo API do UpBota a nastavte, komu príde upozornenie.