Upravljajte incident od zaznave do obnove
DokončanoUskladite odzivne ekipe, omejite vpliv, sporočajte negotovost in preverite obnovo. Incident pretvorite v izboljšave z odgovornimi osebami.
Izdajatelj TaigaKako pišemo
Preverite razumevanjePovrnitev na prejšnjo različico obnovi uspešne izvoze, uporabnik pa poroča, da je prejel zapise druge organizacije. Kaj sledi?Opravite vajo
Kaj se boste naučili
- Dodelite usklajevanje incidenta, tehnično delo in komunikacijo.
- Omejitev posledic izberite glede na vpliv in razpoložljive dokaze.
- Ločite obnovljeno storitev od dokončanega nadaljnjega dela.
Incident razglasite glede na vpliv
Incident je dogodek, ki prekine, poslabša ali ogrozi storitev dovolj, da zahteva usklajen odziv. Vaša organizacija določa stopnje resnosti in pravila eskalacije. Uporabite jih glede na vpliv na uporabnike, prizadete podatke, trajanje in obseg.
Preden zaprosite za pomoč, ne čakajte na popolno razlago glavnega vzroka. Jasna navedba opaženega vpliva zadostuje za začetek usklajevanja. Varnostni sum obravnavajte ločeno od potrjenega sklepa.
Pot odziva pripravite pred izdajo. Kontaktni podatki, postopki dostopa, operativna navodila in komunikacijski kanali naj bodo na voljo tudi ob nedostopnosti glavne storitve. Pot preizkusite z izmišljenim incidentom.
Pred nasprotujočimi si spremembami dodelite odgovornosti
Usklajevanje incidenta določa prednosti in upravlja odločitve. Tehnične odzivne ekipe preiskujejo in omejujejo posledice. Komunikacija obvešča prizadete ljudi. Google SRE opisuje te odgovornosti kot različne vloge. Majhne ekipe jih lahko združijo, vendar morajo še vedno pokriti delo. Odziv na incidente.
| Odgovornost | Takojšnje vprašanje |
|---|---|
| Koordinator incidenta | Kakšen je vpliv, trenutna prednost in naslednja odločitev? |
| Odgovorni za tehnični odziv | Katero odobreno dejanje lahko zmanjša vpliv in kako ga bomo preverili? |
| Odgovorni za komunikacijo | Kdo potrebuje obvestilo, kaj je znano in kdaj sledi naslednje obvestilo? |
| Odgovorni za storitev | Kateri poslovni kompromisi in merila obnove veljajo? |
| Varnostni odziv | Ali so lahko prizadeti zaupnost, celovitost, poverilnice ali dokazi? |
Vodite eno skupno časovnico. Zabeležite čas, opažanje, dejanje, izvajalca in rezultat. Dejstva ločite od hipotez. Uporabljajte skupni časovni pas in označite nezanesljive časovne žige.
Obravnavajte izmišljeni incident
Vsi spodnji časi so UTC. Organizacija določi koordinatorja incidenta, ko napaka izvoza prizadene več strank.
| Čas | Opažanje ali dejanje |
|---|---|
| 09:02 | Neuspešni izvozi presežejo prag opozorila storitve |
| 09:04 | Dežurni potrdi neuspešna opravila; začne se usklajevanje incidenta |
| 09:07 | Ekipa z odobrenim ukrepom za nadzor funkcije začasno ustavi nove izvoze |
| 09:10 | Uporabnik prijavi zapise, ki bi lahko pripadali drugi organizaciji |
| 09:12 | Pridruži se varnostni odziv; ustrezni dnevniki in identifikatorji artefaktov so ohranjeni |
| 09:18 | Ekipa z nadzorovano namestitvijo obnovi združljivo prejšnjo različico |
| 09:25 | Sintetični izvozi uspejo; testi meje dostopa in preiskava razkritja se nadaljujejo |
Uporabno prvo obvestilo navaja prizadeto funkcijo, znani obseg, ukrep za omejitev posledic in čas naslednjega obvestila. Brez dokazov ne obljublja časa popravka. V skupno obvestilo ne vključujte zapisov strank.
Ob 09:10 se incident spremeni. Obnova uspešnih izvozov ne zadostuje več. Ekipa mora oceniti možno razkritje, nadzorovati dostop, ohraniti dokaze in vključiti ustrezne odgovorne za odločitve.
Omejite posledice brez izgube nadzora
Uporabite preizkušena operativna navodila, kjer so ustrezna. Pred povrnitvijo na prejšnjo različico, preklopom ali spremembo poverilnic preverite predpogoje. Prejšnja različica aplikacije morda ne razume trenutne sheme podatkovne zbirke. Preklop v drugo regijo lahko prenese iste poškodovane podatke.
Pomočnik AI lahko znotraj odobrenih mej uredi dokazila, iz katerih so odstranjeni občutljivi podatki, ali primerja hipoteze. Odzivne ekipe morajo preveriti njegove sklepe. Dnevniki in zahtevki so nezaupanja vreden vhod, ne pooblastilo za izvajanje njihove vsebine.
Nujni dostop naj ima odobren namen, omejeno trajanje in revizijski zapis. Nujnost ne naredi predlaganega agentovega ukaza pravilnega.
Obnovo in nadaljnje delo zaključite ločeno
Pred razglasitvijo obnovljene storitve preverite uporabniški delovni tok, celovitost podatkov, meje dostopa in svežino spremljanja. Zabeležite preostale omejitve. Varnostno preiskavo pustite odprto, če njena vprašanja ostajajo nerešena.
Nato preglejte pogoje, ki so omogočili incident. Dodelite konkretno nadaljnje delo z odgovorno osebo in merili preverjanja. Pregled brez obtoževanja išče natančno razlago in koristne spremembe. Ne odpravi odgovornosti za dokončanje teh sprememb. Praksa pregleda po incidentu.
Nadaljujte z varnostnimi operacijami in sklenitvijo povratne zanke.
Opravite vajo
Uporabite izmišljeno časovnico incidenta iz te lekcije. Napišite prvo obvestilo o stanju, navedite tri odzivne vloge in določite dve preverjanji obnove. Prepoznajte eno dejanje, ki potrebuje odločitev varnostnega odziva.
Prenesi delovni list (Markdown)Če počistite to izbiro, izbrišete ves napredek, shranjen v tem brskalniku.
Napredek ostane v tem brskalniku. Brez računa in sledenja.
Viri in nadaljnje branje
- Google SRE: Incident Response ↗
- Google SRE: Postmortem Culture ↗
- NIST: Incident Response Recommendations, SP 800-61 Rev. 3 ↗