Определете и тествайте RTO и RPO
ЗавършеноОпределете приемливото прекъсване и загуба на данни. Сравнете стратегии за възстановяване и измерете пълно упражнение спрямо бизнес изискванията.
Проверете разбирането сиУпражнение за възстановяване връща полезната работа на услугата за 55 минути. Възстановява данни от 20 минути преди прекъсването. Целите са RTO 60 минути и RPO 15 минути. Какъв е резултатът?Направете упражнението
Какво ще научите
- Разграничете RTO от RPO и наличност.
- Изчислете изминалото време за възстановяване и интервала на невъзстановените данни.
- Определете упражнение за възстановяване с доказателства и отговорник за услугата.
Определете две отделни цели
Recovery Time Objective (RTO) задава максималното приемливо прекъсване, преди услугата да възстанови полезната си работа. Recovery Point Objective (RPO) задава максималната приемлива загуба на данни, измерена като време. Договорете тези цели с бизнес отговорника за определена услуга и сценарий на отказ.
Цел за наличност описва работата на услугата за период. RTO и RPO описват очакванията за възстановяване. Те отговарят на различни въпроси.
За измислена услуга за поръчки отговорникът задава RTO от 60 минути и RPO от 15 минути. Това са примерни стойности, а не общи препоръки. Друга услуга може да се нуждае от различни граници, защото липсващи поръчки и забавени отчети имат различни последствия.
Измерете цялото възстановяване
Услугата спира в 10:00. Екипът записва това упражнение:
| Етап | Продължителност | Час |
|---|---|---|
| Откриване на прекъсването | 8 минути | 10:08 |
| Оценка и разрешаване на възстановяването | 12 минути | 10:20 |
| Възстановяване на услугата и данните | 25 минути | 10:45 |
| Проверка на полезната работа на услугата | 10 минути | 10:55 |
Изминалото време за възстановяване е 55 минути. Упражнението изпълнява 60-минутната RTO. Отчитане само на 25-минутната операция за възстановяване би скрило по-голямата част от прекъсването.
Последният използваем момент за възстановяване на данните е 09:40. Интервалът до прекъсването в 10:00 е 20 минути. Това надвишава 15-минутната RPO с 5 минути. По-бързо възстановяване на същите данни не би затворило този интервал.
Прегледайте действително липсващите или несъгласувани записи. Времевият интервал описва излагането на загуба, но не брои засегнатите поръчки. Съгласувайте външните записи за плащания и изпълнение на поръчки, преди да възобновите нормалната обработка. Опитайте различни предположения в упражнението за възстановяване.
Изберете стратегия за възстановяване
Стратегията трябва да покрива необходимата услуга, данни и зависимости. Сравнете тези подходи спрямо измерените цели:
| Подход | Подготвено преди събитието |
|---|---|
| Резервно копие и възстановяване | Възстановими данни и начин за повторно създаване на средата |
| Pilot light | Основните услуги за данни; другите компоненти изискват активиране или създаване |
| Warm standby | Работеща среда с намален капацитет |
| Active/active | Повече от една среда вече обслужва трафик |
Няма универсални времена за възстановяване за тези подходи. Реализацията, обемът на данните, зависимостите и тестовите условия определят резултата. Включете разходите за експлоатация и способностите на екипа в решението.
Защитете се от повече от прекъсване
Реплика може да копира нежелано изтриване или повреден запис. Пазете възстановими версии или възстановяване до момент във времето, когато е необходимо. Проверете сроковете за съхранение, правата за възстановяване и достъпа до ключовете за криптиране. Съобразете изолацията на резервните копия със сценария, включително загуба на достъп до основния акаунт.
За регионално възстановяване проверете разрешеното местоположение на данните и цялата верига от зависимости. Включете идентичност, DNS, сертификати, тайни стойности, артефакти за внедряване, квоти и мрежов достъп. Среда за възстановяване без един необходим ключ може да е неизползваема.
Определете кой може да обяви събитието, кой извършва възстановяването и кой приема възстановената услуга. Планирайте връщане към основната среда или продължаване на работата в средата за възстановяване. Предотвратете конфликтни операции за запис и съгласувайте данните, преди да превключите отново.
Превърнете плана в доказателства
Напишете оперативна процедура и я упражнете при контролирани условия. Запишете сценария, размера на набора данни, началното и крайното време, възстановения момент на данните, неуспешните стъпки и отговорниците. Проверете реална бизнес операция с безопасни тестови записи.
Повтаряйте упражнението след относими промени и по договорения график. Промяна на схема, нова външна зависимост или различен обем данни може да обезсили по-ранни резултати. Свържете доказателствата от упражнението с пусканата версия и отговорностите за експлоатация.
Направете упражнението
Измислена услуга спира в 10:00. Откриването отнема 8 минути, решението — 12, възстановяването — 25, а проверката — 10. Последните използваеми данни са от 09:40. Сравнете резултата с RTO 60 минути и RPO 15 минути. Предложете по едно подобрение за всяка цел.
Изтеглете работния лист (Markdown)Премахването на тази отметка изтрива целия напредък, запазен в този браузър.
Напредъкът остава в този браузър. Без акаунт и проследяване.
Източници и допълнително четене
- AWS: Define recovery objectives for downtime and data loss ↗
- AWS: Use defined recovery strategies ↗
- AWS: Testing disaster recovery ↗