경로 05강의 5 / 8

탐지부터 복구까지 사고 관리하기

대응자를 조율하고 영향을 억제하며 불확실성을 전달하고 복구를 검증하세요. 사고에서 얻은 교훈을 담당자가 있는 개선 작업으로 전환하세요.

실무11 min검토일

발행 콘텐츠 작성 방식

이해도 확인롤백으로 내보내기는 다시 성공하지만 사용자가 다른 조직의 레코드를 받았다고 신고합니다. 다음 조치는 무엇일까요?실습하기
롤백으로 내보내기는 다시 성공하지만 사용자가 다른 조직의 레코드를 받았다고 신고합니다. 다음 조치는 무엇일까요?

학습할 내용

  • 사고 대응 조율, 기술 작업, 소통의 역할을 배정합니다.
  • 영향과 확보한 증거를 바탕으로 확산 방지 조치를 선택합니다.
  • 서비스 복원과 후속 작업 완료를 구분합니다.

영향을 기준으로 사고를 선언하세요

사고는 조율된 대응이 필요할 만큼 서비스를 중단하거나 저하하거나 위협하는 사건입니다. 심각도 수준과 상위 보고 규칙은 조직이 정합니다. 사용자 영향, 영향받는 데이터, 기간, 범위를 기준으로 적용하세요.

도움을 요청하기 위해 완전한 근본 원인 설명을 기다리지 마세요. 관찰한 영향을 명확히 설명하면 조율을 시작할 수 있습니다. 보안 의심과 확정된 결론은 구분하세요.

릴리스 전에 대응 경로를 준비하세요. 주 서비스를 사용할 수 없는 상태에서도 연락처, 접근 절차, 운영 절차서, 소통 채널을 사용할 수 있게 하세요. 가상의 사고로 대응 경로를 훈련하세요.

서로 충돌하는 변경을 하기 전에 책임을 배정하세요

사고 대응 조율은 우선순위를 정하고 결정을 관리합니다. 기술 대응자는 조사하고 영향을 완화합니다. 소통 담당자는 영향받는 사람들에게 정보를 전달합니다. Google SRE는 이를 서로 다른 역할로 설명합니다. 작은 팀은 역할을 겸할 수 있지만 필요한 작업은 모두 맡아야 합니다. 사고 대응.

책임즉시 확인할 질문
사고 조율 담당자영향, 현재 우선순위, 다음 결정은 무엇인가?
기술 대응자어떤 허가된 조치가 영향을 줄일 수 있고 어떻게 검증할 것인가?
소통 담당자누구에게 업데이트가 필요하고 무엇이 알려져 있으며 다음 업데이트는 언제인가?
서비스 담당자어떤 비즈니스상 절충과 복구 기준이 적용되는가?
보안 대응기밀성, 무결성, 자격 증명, 증거가 영향받을 수 있는가?

하나의 공유 시간표를 유지하세요. 시각, 관찰, 조치, 수행자, 결과를 기록하세요. 사실과 가설을 구분하세요. 공통 시간대를 사용하고 신뢰할 수 없는 타임스탬프를 표시하세요.

가상의 사고를 따라가 보세요

아래 시각은 모두 UTC입니다. 내보내기 실패가 여러 고객에게 영향을 주자 조직이 사고 조율 담당자를 지정합니다.

시각관찰 또는 조치
09:02내보내기 실패가 서비스 알림 임계값 초과
09:04당직 담당자가 작업 실패 확인. 사고 조율 시작
09:07팀이 승인된 기능 통제로 새 내보내기 일시 중지
09:10사용자가 다른 조직의 것일 수 있는 레코드 신고
09:12보안 대응 담당자가 참여하고 관련 로그와 아티팩트 식별자 보존
09:18팀이 통제된 순차 배포로 호환되는 이전 버전 복원
09:25합성 데이터 내보내기 성공. 접근 경계 테스트와 정보 노출 조사 계속

유용한 첫 업데이트에는 영향받는 기능, 알려진 범위, 완화 조치, 다음 업데이트 시각이 들어갑니다. 증거 없이 수정 완료 시각을 약속하지 않습니다. 공유 업데이트에 고객 레코드를 넣지 마세요.

09:10에 사고의 성격이 바뀝니다. 내보내기 성공만 복원해서는 더 이상 충분하지 않습니다. 팀은 정보 노출 가능성을 평가하고 접근을 통제하며 증거를 보존하고 적절한 결정 담당자를 참여시켜야 합니다.

통제를 유지하면서 영향을 완화하세요

적용할 수 있는 경우 테스트한 운영 절차서를 사용하세요. 롤백, 장애 조치, 자격 증명 변경 전에 전제 조건을 확인하세요. 이전 애플리케이션 버전이 현재 데이터베이스 스키마를 이해하지 못할 수 있습니다. 리전 간 장애 조치는 같은 손상 데이터를 옮길 수 있습니다.

AI 어시스턴트가 승인된 경계 안에서 민감한 정보를 제거한 증거를 정리하거나 가설을 비교하게 하세요. 대응자는 결론을 검증해야 합니다. 로그와 티켓은 신뢰할 수 없는 입력이지 그 내용을 실행할 권한이 아닙니다.

긴급 접근에는 허가된 목적, 제한된 기간, 감사 기록이 있어야 합니다. 긴급하다고 에이전트가 제안한 명령이 올바르게 되는 것은 아닙니다.

복구와 후속 작업을 따로 종료하세요

서비스 복구를 선언하기 전에 사용자 작업 흐름, 데이터 무결성, 접근 경계, 모니터링의 최신 상태를 검증하세요. 남아 있는 제한을 기록하세요. 보안 조사의 질문이 해결되지 않았다면 조사를 계속하세요.

이후에는 사고를 가능하게 만든 조건을 살펴보세요. 담당자와 검증 기준이 있는 구체적인 후속 작업을 배정하세요. 비난하지 않는 회고는 정확한 설명과 유용한 변경을 찾습니다. 그 변경을 완료할 책임까지 없애지는 않습니다. 사후 분석 관행.

보안 운영과 피드백을 다음 작업에 연결하기에서 계속 학습하세요.

실습하기

이 강의의 가상 사고 시간표를 사용하세요. 첫 상황 업데이트를 작성하고 대응 역할 세 가지와 복구 검사 두 가지를 정하세요. 보안 대응 결정이 필요한 조치 하나를 찾으세요.

워크시트 다운로드(Markdown)
이해도 확인 ↑

계속 학습하기

출처 및 더 읽을 자료

Taiga의 관련 읽을거리

← 이전 강의: 서비스와 사용자의 동작 관찰하기