Definiu i proveu l'RTO i l'RPO
CompletadaDefiniu la interrupció i la pèrdua de dades acceptables. Compareu estratègies de recuperació i mesureu un exercici complet respecte dels requisits de negoci.
Publicat per TaigaCom escrivim
Comproveu què heu entèsUn exercici de recuperació restaura el servei útil en 55 minuts. Recupera dades de 20 minuts abans de la interrupció. Els objectius són un RTO de 60 minuts i un RPO de 15 minuts. Quin és el resultat?Feu l'exercici
Què aprendreu
- Distingir l'RTO de l'RPO i de la disponibilitat.
- Calcular el temps de recuperació transcorregut i l'interval de dades no recuperades.
- Especificar un exercici de recuperació amb evidències i un responsable del servei.
Definiu dos objectius separats
L’objectiu de temps de recuperació (RTO, Recovery Time Objective) fixa la interrupció màxima acceptable abans que torni un servei útil. L’objectiu de punt de recuperació (RPO, Recovery Point Objective) fixa la pèrdua màxima de dades acceptable, mesurada en temps. Acordeu aquests objectius amb el responsable de negoci per a un servei i un escenari de fallada definits.
Un objectiu de disponibilitat descriu el rendiment del servei durant un període. L’RTO i l’RPO descriuen les expectatives de recuperació. Responen preguntes diferents.
Per a un servei fictici de comandes, el responsable fixa l’RTO en 60 minuts i l’RPO en 15 minuts. Són valors d’exemple, no recomanacions generals. Un altre servei pot necessitar límits diferents perquè les comandes perdudes i els informes endarrerits tenen conseqüències diferents.
Mesureu tota la recuperació
El servei s’atura a les 10:00. L’equip registra aquest exercici:
| Fase | Durada | Hora |
|---|---|---|
| Detectar la interrupció | 8 minuts | 10:08 |
| Avaluar i autoritzar la recuperació | 12 minuts | 10:20 |
| Restaurar el servei i les dades | 25 minuts | 10:45 |
| Validar una operació útil | 10 minuts | 10:55 |
El temps de recuperació transcorregut és de 55 minuts. L’exercici compleix l’RTO de 60 minuts. Comptar només els 25 minuts de l’operació de restauració amagaria la major part de la interrupció.
El punt de recuperació utilitzable més recent correspon a les 09:40. L’interval fins a la interrupció de les 10:00 és de 20 minuts. Això supera l’RPO de 15 minuts en 5 minuts. Restaurar les mateixes dades més de pressa no reduiria aquest interval.
Inspeccioneu els registres reals absents o incoherents. Un interval temporal descriu l’exposició; no compta les comandes afectades. Concilieu els registres externs de pagament i de tramitació de comandes abans de reprendre el processament normal. Proveu altres hipòtesis a l’exercici de recuperació.
Trieu una estratègia de recuperació
Una estratègia ha de cobrir el servei, les dades i les dependències necessaris. Compareu aquests patrons amb els objectius mesurats:
| Patró | Què es prepara abans de l’esdeveniment |
|---|---|
| Còpia de seguretat i restauració | Dades recuperables i una manera de recrear l’entorn |
| Pilot light | Serveis de dades essencials; cal activar o crear els altres components |
| Warm standby | Un entorn que funciona amb capacitat reduïda |
| Actiu/actiu | Més d’un entorn ja atén trànsit |
No hi ha temps universals de recuperació per a aquests patrons. La implementació, el volum de dades, les dependències i les condicions de prova determinen el resultat. Incloeu en la decisió el cost operatiu i la capacitat de l’equip.
Protegiu-vos de més coses que una interrupció
Una rèplica pot copiar una eliminació no desitjada o un registre corrupte. Manteniu versions recuperables o recuperació a un punt en el temps quan calgui. Verifiqueu la conservació, els permisos de restauració i l’accés a les claus de xifratge. Adapteu l’aïllament de les còpies de seguretat a l’escenari, inclosa la pèrdua d’accés al compte principal.
Per a la recuperació regional, comproveu la ubicació permesa de les dades i tota la cadena de dependències. Incloeu la identitat, el DNS, els certificats, els secrets, els artefactes de desplegament, les quotes i l’accés de xarxa. Un entorn de recuperació al qual falti una clau necessària pot ser inutilitzable.
Definiu qui pot declarar l’esdeveniment, qui fa la recuperació i qui accepta el servei restaurat. Planifiqueu el retorn a l’entorn original o la continuïtat a l’entorn de recuperació. Eviteu escriptures incompatibles des de components diferents i concilieu les dades abans de tornar a canviar d’entorn.
Convertiu el pla en evidències
Escriviu un procediment operatiu i practiqueu-lo en condicions controlades. Registreu l’escenari, la mida del conjunt de dades, les hores d’inici i final, el punt de dades recuperat, els passos fallits i els responsables. Verifiqueu una operació de negoci real amb registres de prova segurs.
Repetiu l’exercici després dels canvis pertinents i segons el calendari acordat. Un canvi d’esquema, una dependència externa nova o un volum de dades diferent poden invalidar resultats anteriors. Vinculeu les evidències de l’exercici a la versió publicada i a les responsabilitats operatives.
Feu l'exercici
Un servei fictici s'atura a les 10:00. La detecció dura 8 minuts, la decisió 12, la restauració 25 i la validació 10. Les dades utilitzables més recents són de les 09:40. Compareu el resultat amb un RTO de 60 minuts i un RPO de 15 minuts. Proposeu una millora per a cada objectiu.
Descarrega la fitxa (Markdown)Desmarcar aquesta opció elimina tot el progrés desat en aquest navegador.
El progrés es queda en aquest navegador. Sense compte ni seguiment.
Fonts i lectures addicionals
- AWS: Define recovery objectives for downtime and data loss ↗
- AWS: Use defined recovery strategies ↗
- AWS: Testing disaster recovery ↗