Prevzemite odgovornost za storitev po namestitvi
DokončanoDoločite uporabne signale storitve, odločitve ob incidentih, obnovo in vzdrževanje. Operativna odgovornost naj ostane jasna tudi po koncu ustvarjanja kode.
Izdajatelj TaigaKako pišemo
Preverite razumevanjePreverjanje dosegljivosti vrne HTTP 200, izvozi pa zaradi napačne avtorizacije ne vsebujejo zapisov. Kaj to pokaže?Opravite vajo
Kaj se boste naučili
- Določite signal storitve z uporabniškega vidika.
- Ločite usklajevanje incidenta od tehnične preiskave.
- Vzdrževanje in obnovo načrtujte kot stalni odgovornosti.
Določite storitev, od katere so odvisni uporabniki
Namestitev omogoči dostop do programske opreme. Upravljanje jo ohranja uporabno ob spremembah uporabnikov, odvisnosti, prometa in zahtev. Generator kode ne odpravi tega stalnega dela.
Pri izmišljenem izvozu podatkov strank uporabniki potrebujejo več kot dosegljivo stran. Potrebujejo dovoljene zapise v zahtevani obliki v sprejemljivem času. Potrebujejo tudi storitev, ki prepreči dostop do podatkov druge organizacije.
Odgovorno osebo določite pred izdajo. Zabeležite, kdo se odziva zunaj običajnega delovnega časa, če je to del zaveze storitve. Dobavitelj lahko opravi del dela, vendar organizacija še vedno potrebuje jasno pot za odločitve in komunikacijo.
Izberite signale, ki podpirajo ukrepanje
Kazalnik ravni storitve oziroma SLI meri določeno lastnost delovanja storitve. Cilj ravni storitve oziroma SLO določa cilj za ta kazalnik v navedenem obdobju. Cilj izberite glede na potrebe uporabnikov in operativne zmožnosti.
Googlove smernice SRE pojasnjujejo ta pristop in uporabo proračuna napak pri odločitvah o zanesljivosti. Cilja druge storitve ne kopirajte brez preverjanja njegovega pomena. Smernice za SLO, primer pravil za proračun napak.
Za izvoz določite, kaj šteje kot uspešna upravičena zahteva. Pričakovane zavrnitve ločite od sistemskih napak. Dokumentirajte izključitve, da se metrika ne more izboljšati zgolj s skrivanjem zahtevnih zahtev.
| Signal | Kaj pomaga zaznati | Pomembna omejitev |
|---|---|---|
| Javno preverjanje razpoložljivosti | Storitev ni dosegljiva | Ne preveri delovnega toka prijavljenega uporabnika |
| Dokončanje izvoza in zakasnitev | Upravičene zahteve ne uspejo ali trajajo predolgo | Potrebna je natančna definicija uspeha |
| Preverjanja zavrnitve avtorizacije | Poslabšanje ključnega nadzora dostopa | Pokriva preizkušene pogoje |
| Signali virov in odvisnosti | Verjeten notranji vzrok | Sami ne opisujejo vpliva na uporabnike |
Za boljši vpogled ne beležite celotnih izvozov. Zberite najmanjši obseg informacij, potreben za diagnozo težave, in zaščitite dostop do njih.
Pripravite odziv na incident
Določite, kdo usklajuje, kdo preiskuje in kdo komunicira. V majhni ekipi lahko te vloge združite, odgovornosti pa morajo ostati jasne. Vodite zapis opažanj in dejanj.
Googlove smernice za odziv na incidente poleg tehničnega omejevanja posledic poudarjajo usklajevanje in komunikacijo. Tudi ob tehnično pravilnem popravku lahko uporabniki ostanejo brez informacij, sodelujoči pri odzivu pa izvajajo nasprotujoče si spremembe. Odziv na incidente.
Agent lahko znotraj odobrenih podatkovnih mej povzema dnevnike ali primerja hipoteze. Nujnost incidenta mu ne sme dati neomejenih pooblastil za produkcijo. Za izredni dostop uporabite določeno pot eskalacije.
Vadite obnovo in financirajte vzdrževanje
Postopek obnove preizkusite z reprezentativnimi izmišljenimi podatki. Določite, česa povrnitev kode ne more razveljaviti, vključno z izbrisanimi zapisi ali že poslanimi sporočili. Zabeležite čas in informacije, potrebne za obnovo storitve.
Dodelite stalno delo: posodobitve odvisnosti, preglede dostopa, obnovo potrdil, kjer je potrebna, spremembe zmogljivosti in popravke dokumentacije. Storitev brez zmogljivosti za vzdrževanje kopiči obveznosti po porabi začetnega proračuna.
Po incidentu izberite izboljšave, ki obravnavajo opažene vzroke. Povežite jih z izvedbo in preverjanjem. Tako sklenete življenjski cikel: dokazila iz delovanja spremenijo, kaj ekipa določi in zgradi naslednje.
Opravite vajo
Napišite enostranski operativni zapis za izmišljeni izvoz podatkov strank. Vključite en signal delovanja za uporabnike, njegov cilj, prejemnika opozorila, varen prvi odziv, omejitev obnove in odgovornega za vzdrževanje. Navedite, česa spremljanje ne more zaznati.
Prenesi delovni list (Markdown)Če počistite to izbiro, izbrišete ves napredek, shranjen v tem brskalniku.
Napredek ostane v tem brskalniku. Brez računa in sledenja.
Viri in nadaljnje branje
- Google SRE: Implementing SLOs ↗
- Google SRE: Incident Response ↗
- Google SRE: Example Error Budget Policy ↗