RTO und RPO festlegen und testen
AbgeschlossenDefinieren Sie akzeptable Unterbrechung und Datenverlust. Vergleichen Sie Wiederherstellungsstrategien und messen Sie eine vollständige Übung an den Geschäftsanforderungen.
Veröffentlicht von TaigaWie wir schreiben
Verständnis prüfenEine Wiederherstellungsübung stellt den nutzbaren Dienst in 55 Minuten wieder her. Die Daten stammen von 20 Minuten vor der Unterbrechung. Ziele sind RTO 60 Minuten und RPO 15 Minuten. Wie lautet das Ergebnis?Übung bearbeiten
Das lernen Sie
- RTO von RPO und Verfügbarkeit unterscheiden.
- Gesamte Wiederherstellungszeit und zeitliche Datenlücke berechnen.
- Eine Wiederherstellungsübung mit Nachweisen und Dienstverantwortlichem festlegen.
Definieren Sie zwei getrennte Ziele
Das Recovery Time Objective (RTO) legt die maximal akzeptable Unterbrechung fest, bis der Dienst wieder nutzbar sein muss. Das Recovery Point Objective (RPO) legt den maximal akzeptablen Datenverlust als Zeitspanne fest. Vereinbaren Sie diese Ziele mit dem fachlich Verantwortlichen für einen definierten Dienst und ein Ausfallszenario.
Ein Verfügbarkeitsziel beschreibt die Verfügbarkeit eines Dienstes über einen Zeitraum. RTO und RPO beschreiben Erwartungen an die Wiederherstellung. Sie beantworten unterschiedliche Fragen.
Für einen fiktiven Bestelldienst setzt der Verantwortliche das RTO auf 60 Minuten und das RPO auf 15 Minuten. Dies sind Beispielwerte, keine allgemeinen Empfehlungen. Ein anderer Dienst kann andere Grenzen brauchen, weil fehlende Bestellungen und verspätete Berichte unterschiedliche Folgen haben.
Messen Sie die gesamte Wiederherstellung
Der Dienst stoppt um 10:00. Das Team erfasst diese Übung:
| Phase | Dauer | Uhrzeit |
|---|---|---|
| Unterbrechung erkennen | 8 Minuten | 10:08 |
| Wiederherstellung bewerten und freigeben | 12 Minuten | 10:20 |
| Dienst und Daten wiederherstellen | 25 Minuten | 10:45 |
| Nutzbaren Betrieb prüfen | 10 Minuten | 10:55 |
Die gesamte Wiederherstellungszeit beträgt 55 Minuten. Die Übung erfüllt das RTO von 60 Minuten. Nur die 25 Minuten des Wiederherstellungsvorgangs zu zählen, würde den Großteil der Unterbrechung verbergen.
Der neueste nutzbare Wiederherstellungspunkt ist 09:40. Bis zur Unterbrechung um 10:00 liegen 20 Minuten. Das verfehlt das RPO von 15 Minuten um 5 Minuten. Dieselben Daten schneller wiederherzustellen, würde diese Lücke nicht schließen.
Untersuchen Sie tatsächlich fehlende oder inkonsistente Datensätze. Eine Zeitlücke beschreibt das Risiko, zählt aber nicht die betroffenen Bestellungen. Gleichen Sie externe Zahlungs- und Auftragsabwicklungsdaten ab, bevor Sie die normale Verarbeitung fortsetzen. Testen Sie andere Annahmen in der Wiederherstellungsübung.
Wählen Sie eine Wiederherstellungsstrategie
Eine Strategie muss den erforderlichen Dienst, seine Daten und Abhängigkeiten abdecken. Vergleichen Sie diese Muster anhand gemessener Ziele:
| Muster | Vor dem Ereignis vorbereitet |
|---|---|
| Backup und Wiederherstellung | Wiederherstellbare Daten und ein Weg, die Umgebung neu zu erstellen |
| Pilot Light | Wesentliche Datendienste; andere Komponenten müssen aktiviert oder erstellt werden |
| Warm Standby | Eine funktionierende Umgebung mit verringerter Kapazität |
| Aktiv/aktiv | Mehr als eine Umgebung verarbeitet bereits Verkehr |
Für diese Muster gibt es keine universellen Wiederherstellungszeiten. Implementierung, Datenmenge, Abhängigkeiten und Testbedingungen bestimmen das Ergebnis. Beziehen Sie Betriebskosten und Teamfähigkeiten in die Entscheidung ein.
Schützen Sie vor mehr als einem Ausfall
Ein Replikat kann eine unerwünschte Löschung oder einen beschädigten Datensatz kopieren. Bewahren Sie bei Bedarf wiederherstellbare Versionen auf oder nutzen Sie Point-in-Time Recovery. Prüfen Sie Aufbewahrung, Wiederherstellungsberechtigungen und Zugriff auf Verschlüsselungsschlüssel. Passen Sie die Backup-Isolation an das Szenario an, einschließlich eines Zugriffsverlusts auf das primäre Konto.
Prüfen Sie für die Wiederherstellung nach einem Regionsausfall den erlaubten Datenstandort und die vollständige Abhängigkeitskette. Beziehen Sie Identität, DNS, Zertifikate, Secrets, Deployment-Artefakte, Quoten und Netzwerkzugriff ein. Eine Wiederherstellungsumgebung ohne einen erforderlichen Schlüssel kann unbrauchbar sein.
Definieren Sie, wer das Ereignis ausrufen darf, wer die Wiederherstellung ausführt und wer den wiederhergestellten Dienst abnimmt. Planen Sie die Rückkehr oder den Weiterbetrieb in der Wiederherstellungsumgebung. Verhindern Sie widersprüchliche Schreibvorgänge und gleichen Sie Daten vor einem erneuten Wechsel ab.
Machen Sie aus dem Plan Nachweise
Schreiben Sie ein Runbook und testen Sie es unter kontrollierten Bedingungen. Erfassen Sie Szenario, Datensatzgröße, Start- und Endzeiten, wiederhergestellten Datenstand, fehlgeschlagene Schritte und Verantwortliche. Prüfen Sie einen echten Geschäftsvorgang mit sicheren Testdatensätzen.
Wiederholen Sie die Übung nach relevanten Änderungen und gemäß vereinbartem Zeitplan. Eine Schemaänderung, eine neue externe Abhängigkeit oder eine andere Datenmenge kann frühere Ergebnisse ungültig machen. Verknüpfen Sie die Übungsnachweise mit der Veröffentlichung und den Betriebsverantwortlichkeiten.
Übung bearbeiten
Ein fiktiver Dienst stoppt um 10:00. Die Erkennung dauert 8 Minuten, die Entscheidung 12, die Wiederherstellung 25 und die Validierung 10. Die neuesten nutzbaren Daten stammen von 09:40. Vergleichen Sie das Ergebnis mit RTO 60 Minuten und RPO 15 Minuten. Schlagen Sie für jedes Ziel eine Verbesserung vor.
Arbeitsblatt herunterladen (Markdown)Wenn Sie diese Auswahl aufheben, wird der gesamte in diesem Browser gespeicherte Fortschritt gelöscht.
Ihr Fortschritt bleibt in diesem Browser. Ohne Konto und Tracking.
Quellen und weiterführende Lektüre
- AWS: Define recovery objectives for downtime and data loss ↗
- AWS: Use defined recovery strategies ↗
- AWS: Testing disaster recovery ↗