Novērojiet pakalpojumu un tā lietotājus
PabeigtsSaistiet metrikas, žurnālus un trasējumus ar pakalpojuma mērķiem. Projektējiet brīdinājumus, datu robežas un pārbaudes trūkstošas telemetrijas noteikšanai.
Publicē TaigaKā mēs rakstām
Pārbaudiet savu izpratniEksporta aizkave pieaug. Izlasē atlasīti trasējumi rāda lēnus datubāzes posmus. Ko var secināt?Izpildiet uzdevumu
Ko apgūsiet
- Izvēlieties telemetriju, kas atbild uz konkrētu ekspluatācijas jautājumu.
- Atšķiriet pakalpojuma simptomu no iekšēja cēloņa.
- Aizsargājiet telemetriju un atklājiet trūkstošus vai novecojušus pierādījumus.
Sāciet ar jautājumu
Uzraudzība pārbauda zināmus apstākļus. Novērojamība palīdz izmeklēt sistēmas darbību, tostarp neparedzētas kļūmes. Vairāk informācijas paneļu automātiski nenodrošina labākas atbildes.
Izdomātam eksporta pakalpojumam sāciet ar lietotāja jautājumu: vai autorizēts lietotājs var saņemt pareizu eksportu saskaņotajā laikā? Tad izvēlieties signālus, kas palīdz atbildēt uz šo jautājumu un izskaidrot kļūmes.
OpenTelemetry nodrošina telemetrijas instrumentāciju un standartus. Tas var sūtīt signālus uz saderīgām apstrādes sistēmām. Jums joprojām vajag glabāšanu, vaicājumus, piekļuves kontroli, glabāšanas termiņus un cilvēkus, kas rīkojas pēc pierādījumiem. Ievads novērojamībā.
Saistiet dažādus pierādījumu veidus
Metrika mēra lielumu laikā. Žurnāls reģistrē notikumu. Trasējums saista saistītas operācijas, pieprasījumam virzoties caur sistēmu. Posms jeb span apzīmē vienu operāciju trasējumā.
| Ekspluatācijas jautājums | Pierādījumu piemērs | Ierobežojums, kas jāatceras |
|---|---|---|
| Cik atbilstošu eksportu neizdodas? | Kļūmju skaits un atbilstošo pieprasījumu skaits | Nepareizs saucējs rada maldinošu īpatsvaru |
| Kas notika ar vienu eksportu? | Strukturēts žurnāls ar uzdevuma ID, rezultātu un versiju | Trūkstoši notikumi atstāj plaisas |
| Kur tika patērēts laiks? | Trasējums caur API, rindu, izpildprocesu un datubāzi | Izlase un bojāta konteksta pārnese var paslēpt darbu |
| Kas mainījās pirms simptoma? | Izvietošanas un konfigurācijas ieraksti | Laika sakritība viena pati nepierāda cēloni |
Asinhronam darbam saglabājiet drošu sasaisti starp iesniegto uzdevumu un izpildprocesa izpildi. HTTP 202 atbilde var nozīmēt, ka darbs ir pieņemts. Tā nepierāda, ka eksports ir pabeigts.
Brīdiniet, kad vajadzīga rīcība
Definējiet SLI un tā saucēju pirms SLO noteikšanas. Šajā piemērā skaitiet atbilstošus eksportus, kas pareizi pabeigti saskaņotajā laikā. Definējiet, kā mērījumā iekļaujas ilgstoši un pamesti uzdevumi.
Kļūdu budžets apraksta SLO periodā pieļaujamo kļūmju apjomu. Budžeta patēriņa ātrums raksturo, cik ātri kļūmes šo budžetu iztērē. Google vadlīnijas izmanto vairākus laika logus, lai līdzsvarotu savlaicīgu atklāšanu un liekus brīdinājumus. Brīdinājumi pēc SLO.
Izsauciet atbildīgo, ja apstākļi prasa savlaicīgu rīcību. Mazāk steidzamu darbu nosūtiet uz rindu. Katram brīdinājumam vajag atbildīgo, ietekmes aprakstu, izmeklēšanas saiti un reaģēšanas norādi. Pārskatiet brīdinājumus, kas atkārtoti neizraisa nekādu rīcību.
Neizmantojiet vienu vispārīgu slieksni katram pakalpojumam. Lēmumu ietekmē lietotāju pieredze, datplūsma, darba laiks un reaģēšanas jauda.
Aizsargājiet telemetrijas pipeline
Telemetrija var saturēt personas datus, tokenus, pieprasījumu parametrus un konfidenciālus dokumentus. Definējiet atļautos laukus pirms vākšanas. Ierobežojiet piekļuvi un glabāšanas ilgumu. Aizklājiet slepenos datus pirms eksportēšanas uz ārēju apstrādes sistēmu. Sensitīva telemetrija.
Neizmantojiet klienta e-pastu vai unikālu uzdevuma ID kā metrikas etiķeti. Neierobežotas etiķetes palielina laikrindu skaitu un var atklāt identifikatorus. Metrikām izmantojiet kontrolētas dimensijas. Apstiprinātos sasaistes identifikatorus ievietojiet žurnālos vai trasējumos ar kontrolētu piekļuvi.
Mēriet arī pašu pipeline. Pārbaudiet ievades kļūmes, atmestos datus un jaunākā novērojuma vecumu. Plakans kļūdu grafiks var nozīmēt, ka kļūdu nav vai ka neienāk telemetrija. Parādiet šo atšķirību.
Izmeklējiet konkrētu kļūmi
Izdomātais pakalpojums katram pieprasījumam atgriež HTTP 202. Rindā gaidošo uzdevumu vecums pieaug no sekundēm līdz 15 minūtēm. Izpildprocesu žurnāli rāda atkārtotas datubāzes noildzes. Izlases trasējumi rāda, ka lielākā daļa izpildprocesa laika paiet datubāzes izsaukumos.
Šie pierādījumi atbalsta mērķētu izmeklēšanu. Tie nepierāda, vai cēlonis ir vaicājuma izmaiņa, izsmelti savienojumi vai datubāzes jauda. Salīdziniet šīs hipotēzes ar atkļūdošanas metodi.
Taiga Monitoring sniedz produkta darbspējas skatu ar pieejamības un pārlūka pieredzes signāliem. Tas papildina infrastruktūras un lietotnes novērojamību; tas neaizstāj šīs sistēmas. Monitoring.
Izpildiet uzdevumu
Šīs nodarbības izdomātajam eksportam definējiet vienu SLI, vienu brīdinājumu ar skaidru rīcību, trīs atļautus telemetrijas laukus un divus aizliegtus laukus. Norādiet, kā atklātu bojātu telemetrijas pipeline.
Lejupielādēt darblapu (Markdown)Noņemot šo atzīmi, tiek dzēsts viss šajā pārlūkā saglabātais progress.
Progress paliek šajā pārlūkā. Bez konta un izsekošanas.
Avoti un papildu lasāmviela
- OpenTelemetry: Observability primer ↗
- OpenTelemetry: Handling sensitive data ↗
- Google SRE: Alerting on SLOs ↗
- Taiga docs: Monitoring ↗