Itinerario 04Lección 7 / 10

Define y prueba RTO y RPO

Define la interrupción y la pérdida de datos aceptables. Compara estrategias de recuperación y mide un ejercicio completo frente a los requisitos del negocio.

Práctica profesional14 minRevisado

Publicado por Cómo escribimos

Qué aprenderás

  • Distinguir RTO de RPO y de disponibilidad.
  • Calcular el tiempo transcurrido de recuperación y la diferencia hasta el punto de datos recuperado.
  • Definir un ejercicio de recuperación con pruebas y una persona responsable del servicio.

Define dos objetivos independientes

El Recovery Time Objective (RTO), u objetivo de tiempo de recuperación, fija la interrupción máxima aceptable antes de restablecer un servicio útil. El Recovery Point Objective (RPO), u objetivo de punto de recuperación, fija la pérdida máxima aceptable de datos medida en tiempo. Acuerda estos objetivos con el responsable del negocio para un servicio y un escenario de fallo definidos.

Un objetivo de disponibilidad describe el rendimiento del servicio durante un periodo. RTO y RPO describen las expectativas de recuperación. Responden a preguntas distintas.

Para un servicio ficticio de pedidos, el responsable fija un RTO de 60 minutos y un RPO de 15 minutos. Son valores de ejemplo, no recomendaciones generales. Otro servicio puede necesitar límites diferentes, porque perder pedidos y retrasar informes tienen consecuencias distintas.

Mide la recuperación completa

El servicio se detiene a las 10:00. El equipo registra este ejercicio:

EtapaDuraciónHora
Detectar la interrupción8 minutos10:08
Evaluar y autorizar la recuperación12 minutos10:20
Restaurar el servicio y los datos25 minutos10:45
Validar una operación útil10 minutos10:55

El tiempo transcurrido de recuperación es de 55 minutos. El ejercicio cumple el RTO de 60 minutos. Contar solo los 25 minutos de restauración ocultaría la mayor parte de la interrupción.

El punto de recuperación utilizable más reciente es de las 09:40. La diferencia hasta la interrupción de las 10:00 es de 20 minutos. Supera el RPO de 15 minutos en 5 minutos. Restaurar los mismos datos más deprisa no reduciría esa diferencia.

Inspecciona los registros que realmente faltan o son incoherentes. Una diferencia temporal describe la exposición; no cuenta los pedidos afectados. Concilia los registros externos de pagos y preparación de pedidos antes de reanudar el procesamiento normal. Prueba otros supuestos en el ejercicio de recuperación.

Elige una estrategia de recuperación

La estrategia debe cubrir el servicio, los datos y las dependencias necesarios. Compara estos patrones con objetivos medidos:

PatrónQué se prepara antes del evento
Copia de seguridad y restauraciónDatos recuperables y una forma de recrear el entorno
Pilot lightServicios de datos esenciales; otros componentes necesitan activarse o crearse
Warm standbyUn entorno funcional con capacidad reducida
Activo/activoMás de un entorno ya atiende tráfico

Estos patrones no tienen tiempos universales de recuperación. La implementación, el volumen de datos, las dependencias y las condiciones de prueba determinan el resultado. Incluye el coste operativo y la capacidad del equipo en la decisión.

Protege frente a algo más que una caída

Una réplica puede copiar un borrado no deseado o un registro corrupto. Conserva versiones recuperables o recuperación a un punto en el tiempo cuando haga falta. Verifica conservación, permisos de restauración y acceso a las claves de cifrado. Ajusta el aislamiento de las copias al escenario, incluida la pérdida de acceso a la cuenta principal.

Para una recuperación regional, comprueba la ubicación permitida de los datos y toda la cadena de dependencias. Incluye identidad, DNS, certificados, secretos, artefactos de despliegue, cuotas y acceso de red. Un entorno de recuperación al que le falte una clave necesaria puede ser inutilizable.

Define quién puede declarar el evento, quién realiza la recuperación y quién acepta el servicio restaurado. Planifica el retorno al entorno original o la continuidad en el entorno de recuperación. Evita escritores en conflicto y concilia los datos antes de volver a cambiar.

Convierte el plan en pruebas

Escribe un runbook y ejecútalo en condiciones controladas. Registra escenario, tamaño del conjunto de datos, horas de inicio y fin, punto de datos recuperado, pasos fallidos y responsables. Verifica una operación real de negocio con registros de prueba seguros.

Repite el ejercicio tras cambios pertinentes y según el calendario acordado. Un cambio de esquema, una nueva dependencia externa o un volumen de datos distinto pueden invalidar los resultados anteriores. Vincula las pruebas del ejercicio a la publicación y a las responsabilidades operativas.

Haz el ejercicio

Un servicio ficticio se detiene a las 10:00. Detectarlo tarda 8 minutos; decidir, 12; restaurar, 25; y validar, 10. Los datos utilizables más recientes son de las 09:40. Compara el resultado con un RTO de 60 minutos y un RPO de 15 minutos. Propón una mejora para cada objetivo.

Descargar hoja de ejercicios (Markdown)

Comprueba lo que has aprendido

Un ejercicio recupera un servicio útil en 55 minutos. Recupera datos de 20 minutos antes de la interrupción. Los objetivos son RTO de 60 minutos y RPO de 15 minutos. ¿Cuál es el resultado?

Fuentes y lecturas adicionales

Lecturas relacionadas de Taiga