Die Website ist ausgefallen. Was tun in den ersten 15 Minuten?

Ein klarer Ablauf vom ersten Alarm bis zur Wiederherstellung. Umfang prüfen, Änderungen stoppen und zufällige Neustarts vermeiden.

Serverracks und Netzwerkverkabelung in einem Rechenzentrum
Fotografie: Taylor Vick / Unsplash

Ein Alarm trifft ein, ein Kunde kann seine Bestellung nicht abschließen und im Teamchat stehen mehrere Erklärungen nebeneinander. Die ersten Minuten entscheiden, ob Sie das Problem eingrenzen oder fünf Dinge gleichzeitig ändern. Das Ziel ist klar: Auswirkungen feststellen, den Dienst wiederherstellen und Belege für den späteren Rückblick erhalten.

Prüfen Sie zuerst, was tatsächlich ausfällt

Öffnen Sie den Dienst aus einem anderen Netzwerk und sehen Sie sich die letzten erfolgreichen Prüfungen an. Ist die gesamte Website betroffen oder nur die Anmeldung beziehungsweise eine bestimmte API? Ein fehlgeschlagener Versuch zeigt noch nicht, ob Server, DNS oder Netzwerkweg verantwortlich sind. Notieren Sie Zeitpunkt, Adresse und genaue Fehlermeldung.

Unterscheiden Sie einen Verbindungsfehler von einer HTTP-Antwort. Bei 503 hat der Server geantwortet, der Dienst ist jedoch nicht verfügbar. Ein Timeout liefert andere Hinweise. Funktioniert die Startseite, prüfen Sie auch den Schritt, den der Kunde ausführen muss. Eine erreichbare Startseite bedeutet nicht automatisch ein funktionierendes Produkt.

Stoppen Sie Änderungen und bestimmen Sie eine Leitung

Pausieren Sie weitere Deployments und legen Sie fest, wer die Diagnose koordiniert. Eine zweite Person kann Auswirkungen verfolgen und kommunizieren. Auch kleinen Teams hilft ein gemeinsames Protokoll: Was wissen wir, was prüfen wir, mit welchem Ergebnis? Unkoordinierte Eingriffe können die ursprüngliche Ursache verdecken.

Suchen Sie die letzte Änderung und den Engpass

Vergleichen Sie den Beginn mit Deployments, Konfigurationsänderungen, DNS-Anpassungen und Datenbankmigrationen. Zeitliche Nähe ist ein Hinweis, kein Beweis. Prüfen Sie Anwendungsfehler, Datenbankverbindungen, Speicherplatz und Ressourcennutzung. Ein Neustart ohne diese Informationen kann kurz helfen und gleichzeitig wichtige Spuren beseitigen.

Erwägen Sie einen sicheren Rollback, bevor Sie eine Änderung in Produktion improvisieren. Nach einer Datenbankmigration muss der alte Anwendungscode noch zur neuen Struktur passen. Die Wiederherstellung hat Vorrang vor einer vollständigen Erklärung, darf aber nicht den Schutz der Daten verdrängen.

Kommunizieren Sie auch ohne bekannte Ursache

Nennen Sie betroffene Funktionen und den Zeitpunkt des nächsten Updates. Versprechen Sie keine Reparaturdauer ohne Grundlage. Prüfen Sie nach einem Eingriff die Erreichbarkeit von außen und beobachten Sie mehrere weitere Kontrollen. Ein einziger erfolgreicher Seitenaufruf reicht nicht zum Abschluss des Incidents.

  • Ausfall und Umfang bestätigen.
  • Änderungen pausieren und Eingriffe protokollieren.
  • Den Dienst mit einem sicheren, überprüfbaren Schritt wiederherstellen.
  • Den Kundenablauf testen und die Wiederherstellung melden.

Was Sie mitnehmen

Bereiten Sie diesen Ablauf vor einem Incident vor und hinterlegen Sie bei jedem Monitor eine verantwortliche Kontaktperson. Ein Alarm spart nur dann Zeit, wenn ihm eine klare Reaktion folgt.

Dokumentation und weiterführende Links

Mgr. Martin Hlavaj, MBA

Softwareentwickler

Alle Artikel

Erfahren Sie frühzeitig von Ausfällen.

Fügen Sie Ihre Website oder API zu UpBot hinzu und bestimmen Sie, wer den Alarm erhält.

Kostenlos überwachen