Nustatykite ir išbandykite RTO bei RPO
BaigtaApibrėžkite priimtiną pertrūkį ir duomenų praradimą. Palyginkite atkūrimo strategijas ir visą atkūrimo pratimą įvertinkite pagal verslo reikalavimus.
Leidžia TaigaKaip rašome
Patikrinkite, ar supratoteAtkūrimo pratimas grąžina naudingą paslaugą per 55 minutes. Atkuriami duomenys iš 20 minučių prieš pertrūkį. Tikslai: RTO 60 minučių ir RPO 15 minučių. Koks rezultatas?Atlikite užduotį
Ko išmoksite
- Atskirkite RTO nuo RPO ir prieinamumo.
- Apskaičiuokite visą atkūrimo trukmę ir duomenų atkūrimo spragą.
- Apibrėžkite atkūrimo pratimą su įrodymais ir už paslaugą atsakingu asmeniu.
Apibrėžkite du atskirus tikslus
Recovery Time Objective (RTO) nustato didžiausią priimtiną pertrūkį, per kurį turi grįžti naudinga paslauga. Recovery Point Objective (RPO) nustato didžiausią priimtiną duomenų praradimą, matuojamą laiku. Dėl šių tikslų susitarkite su verslo savininku apibrėžtai paslaugai ir gedimo scenarijui.
Prieinamumo tikslas aprašo paslaugos veikimą per laikotarpį. RTO ir RPO aprašo atkūrimo lūkesčius. Jie atsako į skirtingus klausimus.
Išgalvotai užsakymų paslaugai atsakingas asmuo nustato 60 minučių RTO ir 15 minučių RPO. Tai pavyzdinės reikšmės, o ne bendros rekomendacijos. Kitai paslaugai gali reikėti kitų ribų, nes dingę užsakymai ir vėluojančios ataskaitos turi skirtingas pasekmes.
Išmatuokite visą atkūrimą
Paslauga sustoja 10:00. Komanda užfiksuoja tokį pratimą:
| Etapas | Trukmė | Laikrodžio laikas |
|---|---|---|
| Aptikti pertrūkį | 8 minutės | 10:08 |
| Įvertinti ir leisti atkūrimą | 12 minučių | 10:20 |
| Atkurti paslaugą ir duomenis | 25 minutės | 10:45 |
| Patikrinti naudingą veikimą | 10 minučių | 10:55 |
Visas atkūrimas trunka 55 minutes. Pratimas atitinka 60 minučių RTO. Skaičiuojant tik 25 minučių atkūrimo operaciją būtų paslėpta didžioji pertrūkio dalis.
Naujausias tinkamas atkūrimo taškas yra 09:40. Iki pertrūkio 10:00 lieka 20 minučių spraga. Ji viršija 15 minučių RPO 5 minutėmis. Greitesnis tų pačių duomenų atkūrimas šios spragos nesumažintų.
Išnagrinėkite tikrus trūkstamus ar nenuoseklius įrašus. Laiko spraga aprašo galimą duomenų praradimą; ji nesuskaičiuoja paveiktų užsakymų. Prieš grįždami prie įprasto apdorojimo, suderinkite išorinius mokėjimų ir užsakymų vykdymo įrašus. Išbandykite skirtingas prielaidas atkūrimo pratime.
Pasirinkite atkūrimo strategiją
Strategija turi apimti reikiamą paslaugą, duomenis ir priklausomybes. Palyginkite šiuos modelius su išmatuotais tikslais:
| Modelis | Kas parengiama prieš įvykį |
|---|---|
| Atsarginės kopijos ir atkūrimas | Atkuriami duomenys ir būdas iš naujo sukurti aplinką |
| Pilot light | Būtinos duomenų paslaugos; kitus komponentus reikia aktyvinti ar sukurti |
| Warm standby | Veikianti sumažinto pajėgumo aplinka |
| Active/active | Daugiau nei viena aplinka jau aptarnauja srautą |
Šie modeliai neturi universalių atkūrimo laikų. Rezultatą lemia įgyvendinimas, duomenų apimtis, priklausomybės ir testo sąlygos. Į sprendimą įtraukite eksploatavimo kainą ir komandos gebėjimus.
Apsaugokite ne tik nuo neveikimo
Replika gali nukopijuoti nepageidaujamą ištrynimą ar sugadintą įrašą. Kur reikia, išlaikykite atkuriamas versijas ar atkūrimą į konkretų laiko tašką. Patikrinkite saugojimą, atkūrimo teises ir prieigą prie šifravimo raktų. Atsarginių kopijų izoliavimą pritaikykite scenarijui, įskaitant prieigos prie pagrindinės paskyros praradimą.
Atkūrimui po regiono gedimo patikrinkite leidžiamą duomenų vietą ir visą priklausomybių grandinę. Įtraukite tapatybes, DNS, sertifikatus, paslaptis, diegimo artefaktus, kvotas ir tinklo prieigą. Atkūrimo aplinka, kuriai trūksta vieno būtino rakto, gali būti netinkama naudoti.
Apibrėžkite, kas gali paskelbti įvykį, kas atlieka atkūrimą ir kas priima atkurtą paslaugą. Suplanuokite grįžimą į pirminę aplinką arba tolesnį darbą atkūrimo aplinkoje. Prieš persijungdami dar kartą, užkirskite kelią konfliktuojantiems įrašymams ir suderinkite duomenis.
Paverskite planą įrodymais
Parašykite veiksmų vadovą ir išbandykite jį kontroliuojamomis sąlygomis. Užrašykite scenarijų, duomenų rinkinio dydį, pradžios ir pabaigos laiką, atkurtų duomenų tašką, nepavykusius žingsnius ir atsakingus asmenis. Patikrinkite tikrą verslo operaciją su saugiais testiniais įrašais.
Pakartokite pratimą po susijusių pakeitimų ir pagal sutartą tvarkaraštį. Schemos pakeitimas, nauja išorinė priklausomybė ar kita duomenų apimtis gali panaikinti ankstesnių rezultatų galiojimą. Susiekite pratimo įrodymus su išleidimu ir eksploatavimo atsakomybėmis.
Atlikite užduotį
Išgalvota paslauga sustoja 10:00. Aptikimas trunka 8 minutes, sprendimas – 12, atkūrimas – 25, o patikrinimas – 10. Naujausi tinkami duomenys yra iš 09:40. Palyginkite rezultatą su 60 minučių RTO ir 15 minučių RPO. Pasiūlykite po vieną kiekvieno tikslo pagerinimą.
Atsisiųsti užduoties lapą (Markdown)Atšaukus šį pasirinkimą ištrinama visa šioje naršyklėje išsaugota pažanga.
Pažanga lieka šioje naršyklėje. Be paskyros ir stebėjimo.
Šaltiniai ir papildoma literatūra
- AWS: Define recovery objectives for downtime and data loss ↗
- AWS: Use defined recovery strategies ↗
- AWS: Testing disaster recovery ↗