배움과 성장/DevOps·클라우드
관측 가능성이란: metrics·logs·traces를 하나의 질문으로 연결하기
service가 느려졌다는 alert를 받았을 때 dashboard 하나만 보고 원인을 알기는 어렵다. 오류율은 올랐지만 어느 요청에서 시작됐는지, 느린 구간이 database인지 외부 API인지, 배포와 관련 있는지는 다른 증거를 연결해야 보인다.관측 가능성(observability)은 metrics, logs, traces라는 도구를 설치한 상태 자체가 아니다. system이 밖으로 내보낸 telemetry를 이용해 내부 동작에 관한 새로운 질문에 답할 수 있는 능력에 가깝다.운영 질문 ↓필요한 telemetry와 context를 설계 ↓metrics·logs·traces를 서로 연결 ↓가설을 좁히고 확인이 순서를 거꾸로 해 수집 가능한 것을 모두 쌓으면 비용은 늘고, 정작 장애 때 필요한..