하얀잔디

  • 홈
  • 태그
  • 방명록
  • TIL

devops 1

텔레그램 장애 알림에 AI 로그 분석 붙여보기

1. 작업 배경서비스를 운영하다 보면 CPU나 메모리 사용률은 정상인데 실제로는 API 오류가 발생하거나 응답이 느려지는 경우가 있다.기존에는 Prometheus와 Grafana를 통해 서버 상태를 모니터링하고, 장애가 발생하면 OpenSearch에서 로그를 직접 검색해 원인을 확인했다.그런데 장애가 발생할 때마다 로그를 조회하고, 어떤 API에서 오류가 발생했는지 확인하고, 파드 상태까지 하나씩 살펴보는 과정이 생각보다 번거로웠다.그래서 장애를 자동으로 감지하고, 관련 로그와 메트릭을 AI가 분석해 원인까지 알려주는 기능을 만들어봤다. 2. 장애 감지 및 텔레그램 알림먼저 장애를 빠르게 인지하기 위해 모니터링 항목을 추가했다. Gateway 모니터링NGINX Gateway 로그를 기반으로 5xx 오류..

TIL 2026.10.08
이전
1
다음
더보기
프로필사진

하얀잔디

  • 분류 전체보기 N
    • TIL N
    • 코테공부

Tag

aws cloud practitioner, devops, aws practitioner 공부법, clf-c02, Telegram, grafana, aws 자격증, 모니터링, aws cloud practitioner 공부법, prometheus, OpenSearch, AIOps, 상태가 괜찮다., clf-c02 한글덤프, 장애대응, aws practitioner 덤프, 로그분석,

최근글과 인기글

  • 최근글
  • 인기글

최근댓글

공지사항

페이스북 트위터 플러그인

  • Facebook
  • Twitter

Archives

Calendar

«   2026/10   »
일 월 화 수 목 금 토
1 2 3
4 5 6 7 8 9 10
11 12 13 14 15 16 17
18 19 20 21 22 23 24
25 26 27 28 29 30 31

방문자수Total

  • Today :
  • Yesterday :

Copyright © Daum Corp. All rights reserved.

티스토리툴바