Határozza meg és tesztelje az RTO-t és az RPO-t
ElvégezveHatározza meg az elfogadható kiesést és adatvesztést. Hasonlítsa össze a helyreállítási stratégiákat, és a teljes helyreállítási gyakorlat mért eredményeit vesse össze az üzleti követelményekkel.
Kiadó TaigaHogyan írunk
Ellenőrizze, mit értett megA helyreállítási gyakorlat 55 perc alatt állítja vissza a használható szolgáltatást. A visszaállított adatok a kiesés előtti 20. percből származnak. A cél 60 perces RTO és 15 perces RPO. Mi az eredmény?Végezze el a gyakorlatot
Amit megtanulhat
- Megkülönböztetni az RTO-t az RPO-tól és a rendelkezésre állástól.
- Kiszámítani az eltelt helyreállítási időt és az adatvesztési időrést.
- Meghatározni egy helyreállítási gyakorlatot bizonyítékokkal és szolgáltatásfelelőssel.
Határozzon meg két külön célt
A Recovery Time Objective (RTO) a maximálisan elfogadható kiesést határozza meg, amelyen belül a használható szolgáltatásnak vissza kell állnia. A Recovery Point Objective (RPO) az időben mért, maximálisan elfogadható adatvesztést adja meg. Ezekről meghatározott szolgáltatásra és hibahelyzetre állapodjon meg az üzleti felelőssel.
A rendelkezésre állási cél a szolgáltatás teljesítményét írja le egy időszak során. Az RTO és az RPO a helyreállítási elvárásokat adja meg. Különböző kérdésekre válaszolnak.
Egy fiktív rendelési szolgáltatásnál a felelős 60 perces RTO-t és 15 perces RPO-t határoz meg. Ezek példaértékek, nem általános ajánlások. Más szolgáltatásnak más korlátokra lehet szüksége, mert az elveszett rendeléseknek és a késő riportoknak eltérő következményei vannak.
Mérje a teljes helyreállítást
A szolgáltatás 10:00-kor leáll. A csapat ezt rögzíti a gyakorlat során:
| Szakasz | Időtartam | Időpont |
|---|---|---|
| A kiesés észlelése | 8 perc | 10:08 |
| Értékelés és a helyreállítás engedélyezése | 12 perc | 10:20 |
| A szolgáltatás és az adatok visszaállítása | 25 perc | 10:45 |
| A használható működés validálása | 10 perc | 10:55 |
Az eltelt helyreállítási idő 55 perc. A gyakorlat teljesíti a 60 perces RTO-t. Ha csak a 25 perces visszaállítási műveletet számolnák, a kiesés nagy része rejtve maradna.
A legfrissebb használható helyreállítási pont 09:40. A 10:00-kor kezdődő kiesésig 20 perc telt el. Ez 5 perccel meghaladja a 15 perces RPO-t. Ugyanazon adatok gyorsabb visszaállítása nem csökkentené ezt a rést.
Vizsgálja meg a ténylegesen hiányzó vagy inkonzisztens rekordokat. Az időrés a kitettséget írja le, nem az érintett rendelések számát. A normál feldolgozás folytatása előtt egyeztesse a külső fizetési és teljesítési nyilvántartásokat. Próbáljon ki eltérő feltételezéseket a helyreállítási gyakorlatban.
Válasszon helyreállítási stratégiát
A stratégiának le kell fednie a szükséges szolgáltatást, adatokat és függőségeket. A mért célok alapján hasonlítsa össze ezeket a mintákat:
| Minta | Mi áll készen az esemény előtt? |
|---|---|
| Mentés és visszaállítás | Helyreállítható adatok és a környezet újralétrehozásának módja |
| Pilot light | Alapvető adatszolgáltatások; a többi komponenst aktiválni vagy létrehozni kell |
| Warm standby | Működő környezet csökkentett kapacitással |
| Active/active | Egynél több környezet már kiszolgál forgalmat |
Ezekhez a mintákhoz nem tartoznak általánosan érvényes helyreállítási idők. Az eredményt a megvalósítás, az adatmennyiség, a függőségek és a tesztfeltételek határozzák meg. A döntésbe vegye fel az üzemeltetési költséget és a csapat képességeit is.
Ne csak a kiesés ellen védekezzen
A replika a nem kívánt törlést vagy sérült rekordot is átmásolhatja. Ahol szükséges, őrizzen meg helyreállítható verziókat, vagy biztosítson időpontra történő visszaállítást. Ellenőrizze a megőrzést, a visszaállítási jogosultságokat és a titkosítási kulcsokhoz való hozzáférést. A mentések elkülönítését igazítsa a helyzethez, az elsődleges fiókhoz való hozzáférés elvesztését is beleértve.
Régiók közötti helyreállításnál ellenőrizze az engedélyezett adathelyet és a teljes függőségi láncot. Vegye fel az identitást, a DNS-t, a tanúsítványokat, a titkos értékeket, a telepítési artifactokat, a kvótákat és a hálózati hozzáférést. Egyetlen szükséges kulcs hiánya használhatatlanná teheti a helyreállítási környezetet.
Határozza meg, ki hirdetheti ki az eseményt, ki végzi a helyreállítást, és ki fogadja el a visszaállított szolgáltatást. Tervezze meg a visszatérést vagy a helyreállítási környezetben folytatott üzemet. Akadályozza meg, hogy a különböző komponensek írásai ütközzenek, és az újabb átváltás előtt egyeztesse az adatokat.
Alakítsa a tervet bizonyítékká
Írjon runbookot, és gyakorolja ellenőrzött körülmények között. Rögzítse a helyzetet, az adatkészlet méretét, a kezdési és befejezési időt, a helyreállított adatok időpontját, a sikertelen lépéseket és a felelősöket. Biztonságos tesztrekordokkal ellenőrizzen egy valós üzleti műveletet.
Ismételje meg a gyakorlatot a releváns változások után és a megállapodott ütemezés szerint. Egy sémamódosítás, új külső függőség vagy eltérő adatmennyiség érvénytelenítheti a korábbi eredményeket. Kapcsolja a gyakorlat bizonyítékait a kiadáshoz és az üzemeltetési felelősségekhez.
Végezze el a gyakorlatot
Egy fiktív szolgáltatás 10:00-kor leáll. Az észlelés 8 perc, a döntés 12, a visszaállítás 25, a validálás 10 perc. A legfrissebb használható adat 09:40-ből származik. Vesse össze az eredményt a 60 perces RTO-val és a 15 perces RPO-val. Mindkét célhoz javasoljon egy javítást.
Munkalap letöltése (Markdown)A kijelölés megszüntetése törli az ebben a böngészőben mentett összes haladást.
A haladás ebben a böngészőben marad. Nincs fiók, nincs követés.
Források és további olvasnivaló
- AWS: Define recovery objectives for downtime and data loss ↗
- AWS: Use defined recovery strategies ↗
- AWS: Testing disaster recovery ↗