Riaďte incident od odhalenia po obnovu
DokončenéKoordinujte zasahujúcich, obmedzte dosah, komunikujte neistotu a overte obnovu. Premeňte incident na zlepšenia s určenou zodpovednosťou.
Vydáva TaigaAko píšeme
Overte si porozumenieRollback obnoví úspešné exporty, ale používateľ hlási prijatie záznamov inej organizácie. Čo nasleduje?Vykonajte cvičenie
Čo sa naučíte
- Prideliť koordináciu incidentu, technickú prácu a komunikáciu.
- Vybrať obmedzenie následkov podľa dosahu a dostupných dôkazov.
- Oddeľovať obnovenú službu od dokončenej následnej práce.
Vyhláste incident podľa jeho dosahu
Incident je udalosť, ktorá narúša, zhoršuje alebo ohrozuje službu natoľko, že vyžaduje koordinovanú reakciu. Úrovne závažnosti a pravidlá eskalácie definuje vaša organizácia. Uplatňujte ich podľa dosahu na používateľov, dotknutých údajov, trvania a rozsahu.
Pred žiadosťou o pomoc nečakajte na úplné vysvetlenie hlavnej príčiny. Jasný opis pozorovaného dosahu stačí na začatie koordinácie. Bezpečnostné podozrenie posudzujte oddelene od potvrdeného záveru.
Postup reagovania pripravte pred vydaním. Kontakty, postupy prístupu, runbooky a komunikačné kanály udržujte dostupné aj pri nedostupnosti hlavnej služby. Postup precvičte na fiktívnom incidente.
Rozdeľte povinnosti pred protichodnými zmenami
Koordinácia incidentu určuje priority a riadi rozhodnutia. Technickí zasahujúci skúmajú a zmierňujú následky. Komunikácia informuje dotknutých ľudí. Google SRE opisuje tieto povinnosti ako samostatné roly. Malé tímy ich môžu spájať, ale musia pokryť celú prácu. Reagovanie na incidenty.
| Zodpovednosť | Bezprostredná otázka |
|---|---|
| Koordinátor incidentu | Aký je dosah, aktuálna priorita a ďalšie rozhodnutie? |
| Technický zasahujúci | Ktorá povolená akcia môže znížiť dosah a ako ju overíme? |
| Osoba zodpovedná za komunikáciu | Kto potrebuje informácie, čo je známe a kedy bude ďalšia aktualizácia? |
| Osoba zodpovedná za službu | Aké kompromisy medzi obchodnými cieľmi a kritériá obnovy platia? |
| Bezpečnostné reagovanie | Môže byť dotknutá dôvernosť, integrita, prihlasovacie údaje alebo dôkazy? |
Udržujte jednu spoločnú časovú os. Zaznamenávajte čas, pozorovanie, akciu, vykonávateľa a výsledok. Oddeľujte fakty od hypotéz. Používajte spoločné časové pásmo a označte nespoľahlivé časové údaje.
Prejdite fiktívnym incidentom
Všetky nasledujúce časy sú UTC. Organizácia určí koordinátora incidentu, keď zlyhanie exportu zasiahne viacerých zákazníkov.
| Čas | Pozorovanie alebo akcia |
|---|---|
| 09:02 | Zlyhania exportu prekročia prah upozornenia služby |
| 09:04 | Pohotovostná služba potvrdí neúspešné úlohy; začína koordinácia incidentu |
| 09:07 | Tím pozastaví nové exporty cez schválený mechanizmus riadenia funkcie |
| 09:10 | Používateľ hlási záznamy, ktoré môžu patriť inej organizácii |
| 09:12 | Pripája sa bezpečnostné reagovanie; relevantné logy a identifikátory artefaktov sa zachovajú |
| 09:18 | Tím obnoví kompatibilnú predchádzajúcu verziu riadeným nasadením |
| 09:25 | Syntetické exporty uspejú; testy hraníc prístupu a vyšetrovanie sprístupnenia údajov pokračujú |
Užitočná prvá aktualizácia uvádza dotknutú funkciu, známy rozsah, zmiernenie následkov a čas ďalšej aktualizácie. Nesľubuje čas opravy bez dôkazov. Do zdieľanej aktualizácie nezahŕňajte zákaznícke záznamy.
O 09:10 sa incident mení. Obnovenie úspešných exportov už nestačí. Tím potrebuje posúdiť možné sprístupnenie údajov, riadiť prístup, zachovať dôkazy a zapojiť príslušné osoby zodpovedné za rozhodnutia.
Zmierňujte následky bez straty kontroly
Používajte otestované runbooky tam, kde sa dajú uplatniť. Pred rollbackom, prepnutím na záložné zdroje alebo zmenou prihlasovacích údajov overte predpoklady. Predchádzajúca verzia aplikácie nemusí rozumieť aktuálnej databázovej schéme. Prepnutie do iného regiónu môže preniesť tie isté poškodené údaje.
Umožnite AI asistentovi usporiadať dôkazy s odstránenými citlivými údajmi alebo porovnať hypotézy v schválených hraniciach. Zasahujúci musia overiť jeho závery. Logy a tickety sú nedôveryhodné vstupy, nie oprávnenie vykonať ich obsah.
Núdzový prístup má mať povolený účel, obmedzené trvanie a auditný záznam. Naliehavosť nerobí príkaz navrhnutý agentom správnym.
Uzavrite obnovu a následnú prácu samostatne
Pred vyhlásením obnovy služby overte pracovný postup používateľa, integritu údajov, hranice prístupu a aktuálnosť monitorovania. Zaznamenajte zostávajúce obmedzenia. Bezpečnostné vyšetrovanie ponechajte otvorené, ak jeho otázky nie sú vyriešené.
Potom preskúmajte podmienky, ktoré umožnili incident. Prideľte konkrétnu následnú prácu so zodpovednou osobou a kritériami overenia. Rozbor bez hľadania vinníkov hľadá presné vysvetlenie a užitočné zmeny. Neodstraňuje zodpovednosť za dokončenie týchto zmien. Postup postmortem.
Pokračujte lekciami bezpečnostnej prevádzky a uzavretia spätnej väzby.
Vykonajte cvičenie
Použite fiktívnu časovú os incidentu z tejto lekcie. Napíšte prvú aktualizáciu situácie, pomenujte tri roly reagovania a definujte dve kontroly obnovy. Určte jednu akciu, ktorá potrebuje rozhodnutie bezpečnostného reagovania.
Stiahnuť pracovný list (Markdown)Zrušenie tohto výberu vymaže celý postup uložený v tomto prehliadači.
Postup zostáva v tomto prehliadači. Bez účtu a sledovania.
Zdroje a ďalšie čítanie
- Google SRE: Incident Response ↗
- Google SRE: Postmortem Culture ↗
- NIST: Incident Response Recommendations, SP 800-61 Rev. 3 ↗