Opazujte storitev in njene uporabnike
DokončanoMetrike, dnevnike in sledi povežite s cilji storitve. Zasnujte opozorila, meje podatkov in preverjanja manjkajoče telemetrije.
Izdajatelj TaigaKako pišemo
Preverite razumevanjeZakasnitev izvoza se poveča. Vzorčene sledi pokažejo počasne odseke podatkovne zbirke. Kaj lahko sklenete?Opravite vajo
Kaj se boste naučili
- Izberite telemetrijo, ki odgovarja na določeno operativno vprašanje.
- Ločite simptom storitve od notranjega vzroka.
- Zaščitite telemetrijo ter zaznajte manjkajoča ali zastarela dokazila.
Začnite z vprašanjem
Spremljanje preverja znane pogoje. Opazljivost pomaga raziskovati delovanje sistema, vključno z napakami, ki jih niste predvideli. Več nadzornih plošč ne zagotovi samodejno boljših odgovorov.
Pri izmišljeni storitvi izvoza začnite z uporabniškim vprašanjem: ali lahko pooblaščeni uporabnik prejme pravilen izvoz v dogovorjenem času? Nato izberite signale, ki podpirajo to vprašanje in pomagajo pojasniti napake.
OpenTelemetry zagotavlja instrumentacijo in standarde za telemetrijo. Signale lahko pošilja združljivim zalednim sistemom. Še vedno potrebujete shranjevanje, poizvedbe, nadzor dostopa, hrambo in ljudi, ki ukrepajo na podlagi dokazil. Uvod v opazljivost.
Povežite različne oblike dokazil
Metrika meri količino skozi čas. Dnevnik zabeleži dogodek. Sled povezuje sorodne operacije, ko zahteva potuje skozi sistem. Odsek oziroma span predstavlja eno operacijo znotraj sledi.
| Operativno vprašanje | Primer dokazila | Omejitev, ki jo morate upoštevati |
|---|---|---|
| Koliko upravičenih izvozov ne uspe? | Število neuspehov in število upravičenih zahtev | Napačen imenovalec daje zavajajoč delež |
| Kaj se je zgodilo z enim izvozom? | Strukturiran dnevnik z ID-jem opravila, rezultatom in različico | Manjkajoči dogodki puščajo vrzeli |
| Za kaj se je porabil čas? | Sled skozi API, čakalno vrsto, delovni proces in podatkovno zbirko | Vzorčenje in pokvarjen prenos konteksta lahko skrijeta delo |
| Kaj se je spremenilo pred simptomom? | Zapisi namestitve in konfiguracije | Samo časovno sosledje ne dokazuje vzroka |
Pri asinhronem delu ohranite varno povezavo med oddanim opravilom in izvajanjem delovnega procesa. Odgovor HTTP 202 lahko pomeni, da je bilo delo sprejeto. Ne dokazuje, da se je izvoz dokončal.
Opozorite, ko je potrebno ukrepanje
Pred določitvijo SLO opredelite SLI in njegov imenovalec. V primeru štejte upravičene izvoze, pravilno dokončane v dogovorjenem času. Določite, kako v meritev vključite dolgotrajna in opuščena opravila.
Proračun napak opisuje dovoljeni obseg neuspehov v obdobju SLO. Stopnja porabe opisuje, kako hitro neuspehi porabljajo ta proračun. Googlove smernice uporabljajo več časovnih oken za ravnovesje med pravočasno zaznavo in odvečnimi opozorili. Opozarjanje na podlagi SLO.
Dežurno osebo obvestite, ko stanje zahteva pravočasno dejanje. Manj nujno delo pošljite v čakalno vrsto. Vsako opozorilo potrebuje odgovorno osebo, opis vpliva, povezavo za preiskavo in navodilo za odziv. Preglejte opozorila, ki vedno znova ne vodijo do ukrepanja.
Za vse storitve ne uporabljajte enega splošnega praga. Na odločitev vplivajo uporabniške posledice, promet, poslovni čas in odzivne zmogljivosti.
Zaščitite cevovod telemetrije
Telemetrija lahko vsebuje osebne podatke, žetone, parametre zahtev in zaupne dokumente. Pred zbiranjem določite dovoljena polja. Omejite dostop in hrambo. Pred izvozom v zunanje zaledje odstranite skrivnosti. Občutljiva telemetrija.
E-poštnega naslova stranke ali enoličnega ID-ja opravila ne uporabljajte kot oznake metrike. Neomejene oznake povečajo število časovnih vrst in lahko razkrijejo identifikatorje. Za metrike uporabljajte nadzorovane dimenzije. Odobrene povezovalne identifikatorje shranite v dnevnike ali sledi z nadzorovanim dostopom.
Merite sam cevovod. Preverite napake pri zajemu, zavržene podatke in starost zadnjega opažanja. Raven graf napak lahko pomeni odsotnost napak ali odsotnost prihajajoče telemetrije. Pokažite to razliko.
Raziščite konkretno napako
Izmišljena storitev za vsako zahtevo vrne HTTP 202. Starost opravil v njeni čakalni vrsti naraste s sekund na 15 minut. Dnevniki delovnih procesov pokažejo ponavljajoče se prekoračitve časovne omejitve podatkovne zbirke. Vzorčene sledi pokažejo, da delovni proces večino časa porabi za klice podatkovne zbirke.
Ta dokazila podpirajo osredotočeno preiskavo. Ne dokazujejo, ali je vzrok sprememba poizvedbe, izčrpano število povezav ali obdelovalna zmogljivost podatkovne zbirke. Hipoteze primerjajte z metodo odpravljanja napak.
Taiga Monitoring zagotavlja pregled stanja izdelka s signali razpoložljivosti in izkušnje v brskalniku. Dopolnjuje opazljivost infrastrukture in aplikacije; teh sistemov ne nadomesti. Monitoring.
Opravite vajo
Za izmišljeni izvoz iz te lekcije določite en SLI, eno opozorilo, na podlagi katerega je mogoče ukrepati, tri dovoljena telemetrijska polja in dve prepovedani. Navedite, kako bi zaznali okvaro cevovoda telemetrije.
Prenesi delovni list (Markdown)Če počistite to izbiro, izbrišete ves napredek, shranjen v tem brskalniku.
Napredek ostane v tem brskalniku. Brez računa in sledenja.
Viri in nadaljnje branje
- OpenTelemetry: Observability primer ↗
- OpenTelemetry: Handling sensitive data ↗
- Google SRE: Alerting on SLOs ↗
- Taiga docs: Monitoring ↗