Cesta 05Lekcia 4 / 8

Pozorujte službu a jej používateľov

Prepojte metriky, logy a traces s cieľmi služby. Navrhnite upozornenia, hranice údajov a kontroly chýbajúcej telemetrie.

Praktická úroveň11 minSkontrolované

Vydáva Ako píšeme

Overte si porozumenieLatencia exportu rastie. Vzorkované traces ukazujú pomalé databázové spans. Čo z toho môžete vyvodiť?Vykonajte cvičenie
Latencia exportu rastie. Vzorkované traces ukazujú pomalé databázové spans. Čo z toho môžete vyvodiť?

Čo sa naučíte

  • Vybrať telemetriu, ktorá odpovedá na konkrétnu prevádzkovú otázku.
  • Rozlišovať príznak služby od vnútornej príčiny.
  • Chrániť telemetriu a odhaľovať chýbajúce alebo zastarané dôkazy.

Začnite otázkou

Monitorovanie kontroluje známe podmienky. Observability pomáha skúmať správanie systému vrátane zlyhaní, ktoré ste nepredvídali. Viac dashboardov automaticky neprináša lepšie odpovede.

Pri fiktívnej exportnej službe začnite otázkou používateľa: môže oprávnený používateľ dostať správny export v dohodnutom čase? Potom vyberte signály, ktoré túto otázku podporia a pomôžu vysvetliť zlyhania.

OpenTelemetry poskytuje nástroje na inštrumentáciu a štandardy telemetrie. Môže odosielať signály do kompatibilných backendov. Stále potrebujete úložisko, dotazy, kontrolu prístupu, uchovávanie a ľudí, ktorí konajú podľa dôkazov. Úvod do observability.

Prepojte rôzne formy dôkazov

Metrika meria veličinu v čase. Log zaznamenáva udalosť. Trace prepája súvisiace operácie pri prechode požiadavky systémom. Span predstavuje jednu operáciu v rámci trace.

Prevádzková otázkaPríklad dôkazuObmedzenie, ktoré treba pamätať
Koľko oprávnených exportov zlyhá?Počet zlyhaní a počet oprávnených požiadaviekNesprávny menovateľ dáva zavádzajúci pomer
Čo sa stalo s jedným exportom?Štruktúrovaný log s ID úlohy, výsledkom a verziouChýbajúce udalosti nechávajú medzery
Na čo sa spotreboval čas?Trace cez API, front, worker a databázuVzorkovanie a porušené šírenie kontextu môžu skryť prácu
Čo sa zmenilo pred príznakom?Záznamy nasadenia a konfigurácieSamotná časová súvislosť nepreukazuje príčinu

Pri asynchrónnej práci zachovajte bezpečné prepojenie medzi odoslanou úlohou a vykonaním workerom. Odpoveď HTTP 202 môže znamenať prijatie práce. Nepreukazuje dokončenie exportu.

Upozorňujte, keď treba konať

Pred stanovením SLO definujte SLI a jeho menovateľ. V príklade počítajte oprávnené exporty dokončené správne v dohodnutom čase. Definujte, ako do merania vstupujú dlho bežiace a opustené úlohy.

Rozpočet chýb opisuje povolené zlyhania v časovom okne SLO. Burn rate opisuje, ako rýchlo zlyhania tento rozpočet spotrebúvajú. Odporúčania Googlu používajú viacero časových okien na vyváženie včasnej detekcie a nadbytočných upozornení. Upozornenia podľa SLO.

Privolajte zodpovednú osobu, keď podmienka vyžaduje včasnú akciu. Menej naliehavú prácu zaraďte do frontu. Každé upozornenie potrebuje zodpovednú osobu, opis dosahu, odkaz na skúmanie a pokyn na reakciu. Preskúmajte upozornenia, ktoré opakovane nevedú k žiadnej akcii.

Nepoužívajte jeden všeobecný prah pre každú službu. Rozhodnutie ovplyvňujú dosah na používateľov, prevádzka, pracovný čas a kapacita reagovania.

Chráňte pipeline telemetrie

Telemetria môže obsahovať osobné údaje, tokeny, parametre požiadaviek a dôverné dokumenty. Pred zberom definujte povolené polia. Obmedzte prístup a uchovávanie. Pred exportom do externého backendu odstráňte tajné údaje. Citlivá telemetria.

Nepoužívajte e-mail zákazníka ani jedinečné ID úlohy ako štítok metriky. Neobmedzené štítky zvyšujú počet časových radov a môžu odhaliť identifikátory. Pre metriky používajte kontrolované dimenzie. Schválené korelačné identifikátory ukladajte do logov alebo traces s riadeným prístupom.

Merajte aj samotnú pipeline. Kontrolujte zlyhania príjmu, zahodené údaje a vek posledného pozorovania. Rovný graf chýb môže znamenať neprítomnosť chýb alebo neprítomnosť prichádzajúcej telemetrie. Ukážte tento rozdiel.

Preskúmajte konkrétne zlyhanie

Fiktívna služba vracia HTTP 202 pri každej požiadavke. Vek úloh vo fronte rastie zo sekúnd na 15 minút. Logy workerov ukazujú opakované prekročenia časového limitu databázy. Vzorkované traces ukazujú, že väčšina času workera sa spotrebuje v databázových volaniach.

Tieto dôkazy podporujú cielené skúmanie. Nepreukazujú, či je príčinou zmena databázového dotazu, vyčerpanie spojení alebo kapacita databázy. Porovnajte hypotézy pomocou metódy hľadania chýb.

Taiga Monitoring poskytuje pohľad na stav produktu so signálmi dostupnosti a používateľskej skúsenosti v prehliadači. Dopĺňa observability infraštruktúry a aplikácie; nenahrádza tieto systémy. Monitoring.

Vykonajte cvičenie

Pre fiktívny export z tejto lekcie definujte jedno SLI, jedno upozornenie vyžadujúce akciu, tri povolené polia telemetrie a dve zakázané polia. Uveďte, ako odhalíte poruchu pipeline telemetrie.

Stiahnuť pracovný list (Markdown)
Overte si porozumenie ↑

Pokračovať v učení

Zdroje a ďalšie čítanie

Súvisiace čítanie od Taigy

← Predchádzajúca lekcia: Priebežne hľadajte a opravujte zraniteľnosti