Ta ansvar för tjänsten efter driftsättning
Definiera användbara tjänstesignaler, incidentbeslut, återställning och underhåll. Håll driftansvaret synligt efter att kodgenereringen är klar.
Publicerad av TaigaSå skriver vi
Det här lär du dig
- Definiera en tjänstesignal ur användarens perspektiv.
- Skilj incidentsamordning från teknisk undersökning.
- Planera underhåll och återställning som löpande ansvar.
Definiera tjänsten som användarna förlitar sig på
Driftsättning gör programvara tillgänglig. Drift håller den användbar när användare, beroenden, trafik och krav ändras. En kodgenerator tar inte bort det löpande arbetet.
För en fiktiv kundexport behöver användarna mer än en nåbar sida. De behöver tillåtna poster i nödvändigt format inom acceptabel tid. De behöver också att tjänsten förhindrar åtkomst till en annan organisations data.
Utse ansvarig före release. Dokumentera vem som reagerar utanför ordinarie arbetstid om det ingår i åtagandet. En leverantör kan utföra viss del, men organisationen behöver fortfarande en tydlig väg för beslut och kommunikation.
Välj signaler som stöder åtgärder
En servicenivåindikator, SLI, mäter en definierad egenskap hos tjänstens beteende. Ett servicenivåmål, SLO, sätter ett mål för indikatorn under en angiven period. Välj målet utifrån användarbehov och driftförmåga.
Googles SRE-vägledning förklarar metoden och användning av felbudget för tillförlitlighetsbeslut. Kopiera inte en annan tjänsts mål utan att kontrollera betydelsen. SLO-vägledning, exempel på felbudgetpolicy.
Definiera vad som räknas som en lyckad kvalificerad exportförfrågan. Skilj förväntade nekanden från systemfel. Dokumentera undantag så att ett mått inte förbättras bara genom att dölja svåra förfrågningar.
| Signal | Vad den hjälper upptäcka | Viktig begränsning |
|---|---|---|
| Offentlig tillgänglighetskontroll | Tjänsten går inte att nå | Verifierar inte ett inloggat arbetsflöde |
| Slutförda exporter och svarstid | Kvalificerade förfrågningar misslyckas eller tar för lång tid | Kräver exakt definition av framgång |
| Kontroller av nekad auktorisering | En kritisk gräns försämras | Täcker testade villkor |
| Resurs- och beroendesignaler | En sannolik intern orsak | Beskriver inte ensam användarpåverkan |
Undvik att logga fullständiga exporter för bättre insyn. Samla minsta information som behövs för diagnos och skydda åtkomsten till den.
Förbered incidentresponsen
Bestäm vem som samordnar, undersöker och kommunicerar. Roller kan kombineras i ett litet team, men ansvaret måste vara tydligt. För en logg över observationer och åtgärder.
Googles incidentvägledning betonar samordning och kommunikation tillsammans med tekniska motåtgärder. En tekniskt korrekt rättning kan ändå lämna användare ovetande eller flera personer göra motstridiga ändringar. Incidentrespons.
En agent kan sammanfatta loggar eller jämföra hypoteser inom godkända datagränser. Den ska inte få obegränsad produktionsbefogenhet för att incidenten är brådskande. Använd en definierad eskaleringsväg för särskild åtkomst.
Öva återställning och finansiera underhåll
Testa återställningsproceduren med representativa fiktiva data. Identifiera vad kodrollback inte kan ångra, inklusive raderade poster och redan skickade meddelanden. Dokumentera tid och information som behövs för återställning.
Tilldela löpande arbete: beroendeuppdateringar, åtkomstgranskningar, certifikatförnyelse där det behövs, kapacitetsändringar och dokumentationsrättningar. En tjänst utan underhållskapacitet samlar skyldigheter efter att lanseringsbudgeten tagit slut.
Välj efter en incident förbättringar som hanterar observerade orsaker. Koppla dem till implementation och verifiering. Det sluter livscykeln: driftunderlag ändrar vad teamet specificerar och bygger härnäst.
Gör övningen
Skriv en ensidig driftanteckning för den fiktiva kundexporten. Ta med en användarnära signal, dess mål, larmmottagare, säker första respons, återställningsgräns och underhållsansvarig. Ange vad övervakningen inte kan upptäcka.
Ladda ned övningsblad (Markdown)Kontrollera din förståelse
Källor och vidare läsning
- Google SRE: Implementing SLOs ↗
- Google SRE: Incident Response ↗
- Google SRE: Example Error Budget Policy ↗
Relaterad läsning från Taiga
Om du avmarkerar valet raderas alla framsteg som sparats i den här webbläsaren.
Framstegen stannar i webbläsaren. Inget konto, ingen spårning.