Řiďte incident od detekce po obnovu
DokončenoKoordinujte řešitele, omezte dopad, komunikujte nejistotu a ověřte obnovu. Proměňte incident ve zlepšení s jasnou odpovědností.
Vydává TaigaJak píšeme
Ověřte si porozuměníRollback obnoví úspěšné exporty, ale uživatel hlásí, že dostal záznamy jiné organizace. Co následuje?Vypracovat cvičení
Co se naučíte
- Přiřadit koordinaci incidentu, technickou práci a komunikaci.
- Zvolit omezení škod podle dopadu a dostupných důkazů.
- Oddělit obnovenou službu od dokončené následné práce.
Vyhlaste incident podle dopadu
Incident je událost, která narušuje, zhoršuje nebo ohrožuje službu natolik, že vyžaduje koordinovanou reakci. Organizace definuje úrovně závažnosti a pravidla eskalace. Uplatňujte je podle dopadu na uživatele, dotčených dat, délky a rozsahu.
S žádostí o pomoc nečekejte na úplné vysvětlení hlavní příčiny. Jasné sdělení pozorovaného dopadu stačí k zahájení koordinace. Bezpečnostní podezření oddělte od potvrzeného závěru.
Postup reakce připravte před vydáním. Kontakty, postupy přístupu, provozní návody a komunikační kanály musí být dostupné i při výpadku hlavní služby. Postup procvičte na fiktivním incidentu.
Před souběžnými změnami přiřaďte odpovědnosti
Koordinace incidentu stanovuje priority a řídí rozhodnutí. Techničtí řešitelé vyšetřují a zmírňují dopad. Komunikace informuje dotčené lidi. Google SRE tyto odpovědnosti popisuje jako samostatné role. Malé týmy mohou role spojit, ale musí pokrýt všechnu práci. Reakce na incidenty.
| Odpovědnost | Bezprostřední otázka |
|---|---|
| Koordinátor incidentu | Jaký je dopad, současná priorita a další rozhodnutí? |
| Technický řešitel | Která povolená akce může omezit dopad a jak ji ověříme? |
| Osoba odpovědná za komunikaci | Kdo potřebuje zprávu, co víme a kdy přijde další aktualizace? |
| Osoba odpovědná za službu | Které obchodní kompromisy a podmínky obnovy platí? |
| Bezpečnostní reakce | Mohly být dotčeny důvěrnost, integrita, přihlašovací údaje nebo důkazy? |
Udržujte jednu sdílenou časovou osu. Zaznamenávejte čas, pozorování, akci, aktéra a výsledek. Rozlišujte fakta a hypotézy. Používejte společné časové pásmo a označte nespolehlivé časové údaje.
Projděte fiktivní incident
Všechny níže uvedené časy jsou UTC. Jakmile selhání exportu zasáhne více zákazníků, organizace určí koordinátora incidentu.
| Čas | Pozorování nebo akce |
|---|---|
| 09:02 | Selhání exportu překročí práh upozornění služby |
| 09:04 | Pohotovost potvrdí neúspěšné úlohy; začíná koordinace incidentu |
| 09:07 | Tým pozastaví nové exporty schváleným řízením funkce |
| 09:10 | Uživatel hlásí záznamy, které mohou patřit jiné organizaci |
| 09:12 | Připojí se bezpečnostní tým; zachovají se příslušné logy a identifikátory artefaktů |
| 09:18 | Tým řízeně nasadí kompatibilní předchozí verzi |
| 09:25 | Syntetické exporty uspějí; testy hranice přístupu a šetření zpřístupnění dat pokračují |
Užitečná první zpráva uvádí dotčenou funkci, známý rozsah, zmírnění a čas další aktualizace. Bez důkazů neslibuje dobu opravy. Do sdílené zprávy nevkládejte zákaznické záznamy.
V 09:10 se incident mění. Obnovit úspěšné exporty už nestačí. Tým musí posoudit možné zpřístupnění dat, řídit přístup, zachovat důkazy a zapojit příslušné osoby odpovědné za rozhodnutí.
Zmírňujte dopad bez ztráty kontroly
Kde jsou použitelné, využívejte otestované provozní postupy. Před rollbackem, přepnutím při selhání nebo změnou přihlašovacích údajů ověřte předpoklady. Předchozí verze aplikace nemusí rozumět současnému schématu databáze. Přepnutí do jiného regionu může přenést stejně poškozená data.
Nechte asistenta AI uspořádat důkazy s odstraněnými citlivými údaji nebo porovnat hypotézy ve schválených hranicích. Řešitelé musí jeho závěry ověřit. Logy a tikety jsou nedůvěryhodným vstupem, nikoli oprávněním provést jejich obsah.
Nouzový přístup má mít povolený účel, omezenou dobu a auditní záznam. Naléhavost nedělá z příkazu navrženého agentem správný příkaz.
Obnovu a následné kroky uzavírejte samostatně
Před vyhlášením obnovy služby ověřte uživatelský postup, integritu dat, hranice přístupu a aktuálnost monitoringu. Zaznamenejte zbývající omezení. Pokud bezpečnostní otázky zůstávají nevyřešené, ponechte šetření otevřené.
Potom prozkoumejte podmínky, které incident umožnily. Přiřaďte konkrétní následnou práci s odpovědnou osobou a kritérii ověření. Posouzení bez obviňování hledá přesné vysvětlení a užitečné změny. Neruší odpovědnost za jejich dokončení. Postmortem v praxi.
Pokračujte lekcemi o bezpečnostním provozu a uzavření zpětnovazebního cyklu.
Vypracovat cvičení
Použijte fiktivní časovou osu incidentu z této lekce. Napište první zprávu o situaci, určete tři role reakce a definujte dvě kontroly obnovy. Určete jednu akci, která potřebuje rozhodnutí bezpečnostního týmu.
Stáhnout pracovní list (Markdown)Zrušení této volby smaže veškerý postup uložený v tomto prohlížeči.
Postup zůstává v tomto prohlížeči. Bez účtu a sledování.
Zdroje a další čtení
- Google SRE: Incident Response ↗
- Google SRE: Postmortem Culture ↗
- NIST: Incident Response Recommendations, SP 800-61 Rev. 3 ↗