Ścieżka 05Lekcja 1 / 8

Odpowiadaj za usługę po wdrożeniu

Określ przydatne sygnały usługi, decyzje incydentowe, odtwarzanie i utrzymanie. Zachowaj odpowiedzialność operacyjną po zakończeniu generowania kodu.

Praktyka10 minSprawdzono

Wydawca Jak piszemy

Czego się nauczysz

  • Zdefiniuj sygnał usługi z perspektywy użytkownika.
  • Oddziel koordynację incydentu od badania technicznego.
  • Zaplanuj utrzymanie i odtwarzanie jako ciągłe obowiązki.

Określ usługę, na której polegają użytkownicy

Wdrożenie udostępnia oprogramowanie. Eksploatacja utrzymuje jego przydatność, gdy zmieniają się użytkownicy, zależności, ruch i wymagania. Generator kodu nie usuwa tej ciągłej pracy.

Przy fikcyjnym eksporcie klientów użytkownicy potrzebują więcej niż dostępnej strony. Potrzebują dozwolonych rekordów we właściwym formacie i akceptowalnym czasie. Usługa musi też uniemożliwiać dostęp do danych innej organizacji.

Wyznacz właściciela przed wydaniem. Zapisz, kto reaguje poza zwykłymi godzinami pracy, jeśli zobowiązanie usługi to obejmuje. Dostawca może wykonywać część pracy, ale organizacja nadal potrzebuje jasnej ścieżki decyzji i komunikacji.

Wybierz sygnały wspierające działanie

Service-level indicator, czyli SLI, mierzy określoną właściwość działania usługi. Service-level objective, czyli SLO, wyznacza cel tego wskaźnika w danym okresie. Wybierz cel na podstawie potrzeb użytkowników i możliwości operacyjnych.

Zalecenia Google SRE wyjaśniają to podejście i użycie budżetu błędów w decyzjach o niezawodności. Nie kopiuj celu innej usługi bez sprawdzenia jego znaczenia. Zalecenia SLO, przykładowa polityka budżetu błędów.

Dla eksportu określ, co jest udanym żądaniem kwalifikującym się do obsługi. Oddziel oczekiwane odmowy od awarii systemu. Udokumentuj wyłączenia, aby miara nie poprawiała się przez ukrywanie trudnych żądań.

SygnałCo pomaga wykryćWażne ograniczenie
Publiczna kontrola dostępnościUsługa jest nieosiągalnaNie sprawdza procesu po zalogowaniu
Ukończenie eksportu i opóźnienieUprawnione żądania zawodzą lub trwają zbyt długoWymaga precyzyjnej definicji sukcesu
Kontrole odmowy autoryzacjiRegresja krytycznej granicyObejmują testowane warunki
Sygnały zasobów i zależnościPrawdopodobna przyczyna wewnętrznaSame nie opisują wpływu na użytkownika

Nie zapisuj pełnych eksportów w logach dla lepszej widoczności. Zbieraj minimum informacji potrzebnych do diagnozy i chroń dostęp do nich.

Przygotuj reagowanie na incydenty

Ustal, kto koordynuje, kto bada i kto komunikuje. W małym zespole role można połączyć, ale obowiązki muszą pozostać jasne. Zachowuj zapis obserwacji i działań.

Zalecenia Google dotyczące incydentów podkreślają koordynację i komunikację obok technicznego ograniczania skutków. Technicznie poprawna naprawa może nadal pozostawić użytkowników bez informacji albo kilka osób wykonujących sprzeczne zmiany. Reagowanie na incydenty.

Agent może podsumować logi lub porównać hipotezy w zatwierdzonych granicach danych. Pilność incydentu nie powinna dawać mu nieograniczonych uprawnień produkcyjnych. Stosuj określoną ścieżkę eskalacji dla dostępu wyjątkowego.

Ćwicz odtwarzanie i finansuj utrzymanie

Przetestuj procedurę odtworzenia z reprezentatywnymi fikcyjnymi danymi. Wskaż, czego rollback kodu nie cofnie, w tym usuniętych rekordów i wysłanych wiadomości. Zapisz czas i informacje potrzebne do przywrócenia usługi.

Przypisz stałe prace: aktualizacje zależności, przeglądy dostępu, odnawianie certyfikatów tam, gdzie potrzebne, zmiany wydajności i poprawki dokumentacji. Usługa bez zasobów na utrzymanie gromadzi obowiązki po wyczerpaniu budżetu uruchomienia.

Po incydencie wybierz usprawnienia odpowiadające zaobserwowanym przyczynom. Powiąż je z implementacją i weryfikacją. To zamyka cykl życia: dowody z eksploatacji zmieniają to, co zespół następnie specyfikuje i buduje.

Wykonaj ćwiczenie

Napisz jednostronicową notatkę operacyjną dla fikcyjnego eksportu klientów. Uwzględnij sygnał widoczny dla użytkownika, jego cel, odbiorcę alertu, bezpieczną pierwszą reakcję, granicę odtwarzania i właściciela utrzymania. Określ, czego monitoring nie wykryje.

Pobierz arkusz (Markdown)

Sprawdź zrozumienie

Kontrola dostępności zwraca HTTP 200, ale eksporty nie zawierają rekordów z powodu błędnej autoryzacji. Co to pokazuje?

Źródła i dalsza lektura

Powiązana lektura od Taiga