Halda intsidenti tuvastamisest taastamiseni
Koordineeri reageerijaid, piira mõju, edasta ebakindlust ja kontrolli taastumist. Muuda intsident vastutajatega parandustööks.
Avaldaja TaigaKuidas me kirjutame
Mida õpid
- Määra intsidendi koordineerimise, tehnilise töö ja suhtluse vastutajad.
- Vali tõkestamine mõju ja olemasolevate tõendite järgi.
- Erista taastatud teenust lõpetatud järeltegevustest.
Kuuluta intsident välja mõju põhjal
Intsident on sündmus, mis katkestab, halvendab või ohustab teenust piisavalt, et vajada koordineeritud reageerimist. Sinu organisatsioon määrab raskusastmed ja eskalatsioonireeglid. Rakenda neid kasutajamõju, mõjutatud andmete, kestuse ja ulatuse järgi.
Ära oota abi küsimiseks täielikku algpõhjuse selgitust. Koordineerimise alustamiseks piisab täheldatud mõju selgest kirjeldusest. Erista turvakahtlust kinnitatud järeldusest.
Valmista reageerimistee ette enne väljalaset. Hoia kontaktandmed, juurdepääsuprotseduurid, käitusjuhendid ja suhtluskanalid kättesaadavana ka põhiteenuse katkestuse ajal. Harjuta seda teed väljamõeldud intsidendiga.
Määra vastutused enne vastuoluliste muudatuste tegemist
Intsidendi koordineerija seab prioriteedid ja haldab otsuseid. Tehnilised reageerijad uurivad ja leevendavad. Suhtlus hoiab mõjutatud inimesed kursis. Google SRE kirjeldab neid vastutusi eri rollidena. Väikesed meeskonnad võivad rolle ühendada, kuid peavad kogu töö katma. Intsidendile reageerimine.
| Vastutus | Vahetu küsimus |
|---|---|
| Intsidendi koordineerija | Milline on mõju, praegune prioriteet ja järgmine otsus? |
| Tehniline reageerija | Milline lubatud tegevus saab mõju vähendada ja kuidas seda kontrollime? |
| Suhtluse vastutaja | Kes vajab teadet, mida teatakse ja millal tuleb järgmine teade? |
| Teenuse vastutaja | Millised ärilised kompromissid ja taastumiskriteeriumid kehtivad? |
| Turvaintsidendi lahendajad | Kas konfidentsiaalsus, terviklus, autentimisandmed või tõendid võivad olla mõjutatud? |
Hoia üht ühist ajajoont. Pane kirja aeg, tähelepanek, tegevus, tegutseja ja tulemus. Erista fakte hüpoteesidest. Kasuta ühist ajavööndit ja märgi ebausaldusväärsed ajatemplid.
Vaata läbi väljamõeldud intsident
Kõik järgnevad ajad on UTC järgi. Organisatsioon nimetab intsidendi koordineerija, kui eksporditõrge mõjutab mitut klienti.
| Aeg | Tähelepanek või tegevus |
|---|---|
| 09:02 | Eksporditõrked ületavad teenuse häirelävendi |
| 09:04 | Valvevastutaja kinnitab ebaõnnestunud tööd; intsidendi koordineerimine algab |
| 09:07 | Meeskond peatab uued ekspordid heaks kiidetud funktsioonikontrolliga |
| 09:10 | Kasutaja teatab kirjetest, mis võivad kuuluda teisele organisatsioonile |
| 09:12 | Liituvad turvaintsidendi lahendajad; säilitatakse asjakohased logid ja artefaktiidentifikaatorid |
| 09:18 | Meeskond taastab ühilduva eelmise versiooni kontrollitud juurutusega |
| 09:25 | Sünteetilised ekspordid õnnestuvad; juurdepääsupiiri testid ja avaldamise uurimine jätkuvad |
Kasulik esimene teade kirjeldab mõjutatud funktsiooni, teadaolevat ulatust, leevendust ja järgmise teate aega. See ei luba ilma tõenditeta parandusaega. Ära lisa ühisesse teatesse kliendikirjeid.
Kell 09:10 intsident muutub. Edukate eksportide taastamisest enam ei piisa. Meeskond peab hindama võimalikku avaldamist, kontrollima juurdepääsu, säilitama tõendid ja kaasama asjakohaste otsuste vastutajad.
Leevenda kontrolli kaotamata
Kasuta katsetatud käitusjuhendeid seal, kus need sobivad. Kontrolli eeltingimusi enne rollback’i, ümberlülitumist või autentimisandmete muutmist. Eelmine rakenduse versioon ei pruugi praegust andmebaasiskeemi mõista. Regioonidevaheline ümberlülitumine võib liigutada samu rikutud andmeid.
Lase AI-assistendil heaks kiidetud piirides korraldada tundlikust teabest puhastatud tõendeid või võrrelda hüpoteese. Reageerijad peavad tema järeldusi kontrollima. Logid ja tööülesanded on ebausaldusväärne sisend, mitte volitus nende sisu käivitamiseks.
Hädaolukorra juurdepääsul peab olema lubatud eesmärk, piiratud kestus ja auditikirje. Kiireloomulisus ei muuda agendi pakutud käsku õigeks.
Lõpeta taastamine ja järeltegevused eraldi
Enne teenuse taastumise väljakuulutamist kontrolli kasutaja töövoogu, andmete terviklust, juurdepääsupiire ja monitooringu värskust. Pane kirja allesjäänud piirangud. Hoia turvauurimine avatuna, kui selle küsimused on lahendamata.
Seejärel uuri tingimusi, mis tegid intsidendi võimalikuks. Määra konkreetsed järeltegevused koos vastutaja ja kontrollikriteeriumidega. Süüdistusteta ülevaatus otsib täpset selgitust ja kasulikke muudatusi. See ei kõrvalda vastutust nende muudatuste lõpetamise eest. Intsidendijärgse ülevaatuse praktika.
Jätka turbe käituse ja tagasisideahela sulgemisega.
Tee harjutus
Kasuta selle õppetunni väljamõeldud intsidendi ajajoont. Kirjuta esimene olukorrateade, nimeta kolm reageerimisrolli ja määra kaks taastumise kontrolli. Leia üks tegevus, mis vajab turvaintsidendi lahendajate otsust.
Laadi tööleht alla (Markdown)Kontrolli oma arusaamist
Allikad ja lisalugemine
- Google SRE: Incident Response ↗
- Google SRE: Postmortem Culture ↗
- NIST: Incident Response Recommendations, SP 800-61 Rev. 3 ↗
Seotud lugemine Taigalt
Selle valiku tühjendamine kustutab kogu selles brauseris salvestatud edenemise.
Edenemine jääb sellesse brauserisse. Kontot ega jälgimist pole.