Cesta 05Lekce 4 / 8

Pozorujte službu a její uživatele

Propojte metriky, logy a traces s cíli služby. Navrhněte upozornění, hranice dat a kontroly chybějící telemetrie.

Praxe11 minZkontrolováno

Vydává Jak píšeme

Ověřte si porozuměníLatence exportu roste. Vzorkované traces ukazují pomalé databázové spany. Co můžete vyvodit?Vypracovat cvičení
Latence exportu roste. Vzorkované traces ukazují pomalé databázové spany. Co můžete vyvodit?

Co se naučíte

  • Zvolit telemetrii, která odpovídá na konkrétní provozní otázku.
  • Odlišit příznak služby od vnitřní příčiny.
  • Chránit telemetrii a odhalovat chybějící nebo zastaralé důkazy.

Začněte otázkou

Monitoring kontroluje známé podmínky. Observabilita pomáhá prozkoumat chování systému včetně nepředvídaných selhání. Více přehledů automaticky neznamená lepší odpovědi.

U fiktivní služby exportu začněte uživatelskou otázkou: může oprávněný uživatel dostat správný export v dohodnutém čase? Potom vyberte signály, které tuto otázku podpoří a pomohou vysvětlit selhání.

OpenTelemetry poskytuje instrumentaci a standardy telemetrie. Může odesílat signály do kompatibilních backendů. Stále potřebujete úložiště, dotazy, řízení přístupu, dobu uchování a lidi, kteří podle důkazů jednají. Úvod do observability.

Propojte různé podoby důkazů

Metrika měří veličinu v čase. Log zaznamenává událost. Trace propojuje související operace během průchodu požadavku systémem. Span představuje jednu operaci uvnitř trace.

Provozní otázkaPříklad důkazuOmezení, na které nezapomínat
Kolik oprávněných exportů selhává?Počet selhání a počet oprávněných požadavkůNesprávný jmenovatel dává zavádějící míru
Co se stalo s jedním exportem?Strukturovaný log s ID úlohy, výsledkem a verzíChybějící události zanechávají mezery
Kde se spotřeboval čas?Trace přes API, frontu, worker a databáziVzorkování a porušené předávání kontextu mohou skrýt práci
Co se změnilo před příznakem?Záznamy nasazení a konfiguraceSamotná časová souvislost neprokazuje příčinu

U asynchronní práce zachovejte bezpečné propojení odeslané úlohy s provedením workeru. Odpověď HTTP 202 může znamenat, že práce byla přijata. Neprokazuje dokončení exportu.

Upozorňujte, když je nutná akce

Před stanovením SLO definujte SLI a jeho jmenovatel. V příkladu počítejte oprávněné exporty dokončené správně v dohodnuté době. Definujte, jak do měření vstupují dlouho běžící a opuštěné úlohy.

Error budget popisuje povolené selhání v časovém okně SLO. Burn rate popisuje, jak rychle selhání tento rozpočet spotřebovávají. Pokyny Googlu používají více oken pro vyvážení včasné detekce a šumu upozornění. Upozorňování podle SLO.

Pohotovostní výzvu člověku posílejte, když podmínka vyžaduje včasný zásah. Méně naléhavou práci posílejte do fronty. Každé upozornění potřebuje odpovědnou osobu, popis dopadu, odkaz pro šetření a pokyn k reakci. Prověřte upozornění, která opakovaně nevedou k žádné akci.

Nepoužívejte jeden obecný práh pro každou službu. Rozhodnutí ovlivňují dopad na uživatele, provoz, pracovní doba a kapacita reakce.

Chraňte telemetrickou pipeline

Telemetrie může obsahovat osobní údaje, tokeny, parametry požadavků a důvěrné dokumenty. Povolená pole definujte před sběrem. Omezte přístup a uchování. Před exportem do externího backendu odstraňte tajné údaje. Citlivá telemetrie.

E-mail zákazníka ani jedinečné ID úlohy nepoužívejte jako štítek metriky. Neomezené štítky zvyšují počet časových řad a mohou odhalit identifikátory. Pro metriky používejte řízené dimenze. Schválené korelační identifikátory ukládejte do logů nebo traces s řízeným přístupem.

Měřte samotnou pipeline. Sledujte chyby příjmu, zahazovaná data a stáří posledního pozorování. Plochý graf chyb může znamenat žádné chyby nebo žádnou příchozí telemetrii. Tento rozdíl ukažte.

Prozkoumejte konkrétní selhání

Fiktivní služba hlásí HTTP 202 pro každý požadavek. Stáří položek ve frontě roste ze sekund na 15 minut. Logy workerů ukazují opakované překročení časového limitu databáze. Vzorkované traces připisují většinu času workeru databázovým voláním.

Tyto důkazy podporují cílené šetření. Neprokazují, zda je příčinou změna dotazu, vyčerpaná spojení nebo kapacita databáze. Hypotézy porovnejte pomocí metody hledání chyb.

Taiga Monitoring poskytuje pohled na stav produktu se signály dostupnosti a uživatelské zkušenosti v prohlížeči. Doplňuje infrastrukturní a aplikační observabilitu; nenahrazuje tyto systémy. Monitoring.

Vypracovat cvičení

Pro fiktivní export z této lekce definujte jedno SLI, jedno upozornění vyžadující akci, tři povolená a dvě zakázaná pole telemetrie. Uveďte, jak odhalíte nefunkční telemetrickou pipeline.

Stáhnout pracovní list (Markdown)
Ověřte si porozumění ↑

Pokračovat v učení

Zdroje a další čtení

Související čtení od Taigy

← Předchozí lekce: Průběžně vyhledávejte a opravujte zranitelnosti