Nach dem Ausfall: ein Postmortem, das etwas verändert

Zeitlicher Ablauf, belegte Auswirkungen und konkrete Maßnahmen. Ein hilfreicher Incident-Bericht bringt mehr als die Suche nach Schuldigen.

Ein Team arbeitet und diskutiert gemeinsam an einem Tisch
Fotografie: Annie Spratt / Unsplash

Der Dienst funktioniert wieder und alle möchten zu ihren Aufgaben zurückkehren. Entscheidungen, Sackgassen und Details, die in keinem Log stehen, sind aber noch frisch. Ein kurzes Postmortem kann den Ausfall in eine konkrete Verbesserung übersetzen. Es muss nicht lang sein; es muss zeigen, was das Team beim nächsten Mal anders macht.

Beginnen Sie mit den Auswirkungen

Notieren Sie Beginn, Ende und betroffene Funktionen. Trennen Sie bestätigte Angaben von Schätzungen. Ist die Zahl fehlgeschlagener Bestellungen unbekannt, schreiben Sie genau das. Ein belastbarer Zeitpunkt der Wiederherstellung und eine Liste betroffener Dienste helfen mehr als eine erfundene Schadenssumme.

Unterscheiden Sie den ersten Fehler, den ersten Alarm und den Beginn der Reaktion. Diese Zeitpunkte zeigen verschiedene Schwächen: langsame Erkennung, fehlende Eskalation oder aufwendige Diagnose. Eine Verbesserung an einer Stelle löst die anderen nicht automatisch.

Erstellen Sie den Ablauf anhand von Belegen

Verbinden Sie Ereignisse aus Monitoring, Deployments, Logs und dem gemeinsamen Incident-Protokoll. Verwenden Sie eine einheitliche Zeitzone. Halten Sie bei jedem Eingriff das beobachtete Ergebnis fest, auch bei erfolglosen Versuchen. Fakten und Hypothesen müssen auch für unbeteiligte Leser unterscheidbar bleiben.

Untersuchen Sie die Bedingungen hinter dem Fehler

„Jemand hat eine fehlerhafte Konfiguration ausgerollt“ erklärt noch nicht, warum sie Produktion erreichte oder schwer rückgängig zu machen war. Prüfen Sie Validierung, Testumgebung, Änderungsprüfung und Rollback. Menschen entscheiden mit den Informationen, die ihnen zum jeweiligen Zeitpunkt vorliegen.

Benennen Sie auch, was gut funktioniert hat. Ein früher Alarm, ein aktueller Leitfaden oder klare Zuständigkeiten sollten erhalten bleiben. Das Postmortem verbessert das System und die Zusammenarbeit; es ist keine persönliche Leistungsbewertung.

Jede Maßnahme braucht Zuständigkeit und Prüfung

„Monitoring verbessern“ lässt sich schwer abschließen. „Anmeldung prüfen und Alarmzustellung testen“ hat ein sichtbares Ergebnis. Wählen Sie einige Maßnahmen, die Wiederholungen unwahrscheinlicher machen oder die Wiederherstellung verkürzen. Eine lange Liste ohne Prioritäten wird schnell zum Archiv.

  • Auswirkungen und Dauer zusammenfassen.
  • Zeitlichen Ablauf mit Belegen verknüpfen.
  • Ursache und begünstigende Bedingungen beschreiben.
  • Maßnahmen mit Verantwortlichen, Termin und Prüfung festlegen.

Was Sie mitnehmen

Kehren Sie nach der Umsetzung zu den Maßnahmen zurück. Der Bericht wird wertvoll, wenn seine Erkenntnisse in einen Test, eine Konfiguration oder einen tatsächlich genutzten Ablauf einfließen.

Dokumentation und weiterführende Links

Mgr. Martin Hlavaj, MBA

Softwareentwickler

Alle Artikel

Erfahren Sie frühzeitig von Ausfällen.

Fügen Sie Ihre Website oder API zu UpBot hinzu und bestimmen Sie, wer den Alarm erhält.

Kostenlos überwachen