요즘 AIOps 관련해서 이것저것 보다가 간단하게 PoC 해봄.목표는 자동 장애조치 같은 거창한 건 아니고, Prometheus 메트릭이랑 OpenSearch 로그를 AI가 읽고 분석하게 해서 장애 확인할 때 도움받는 정도임.기존에는 장애나 성능 이슈가 생기면 Grafana에서 메트릭 확인하고, OpenSearch 들어가서 같은 시간대 로그 찾고, 다시 비교하는 식으로 봤음.이걸 조금 편하게 해보려고 자연어로 질문하면 필요한 데이터를 조회해서 정리해주는 형태로 만들어봄.예를 들면 이런 식으로 물어볼 수 있음.최근 30분 동안 API 쪽에 이상 있었는지 확인해줘15시 이후 응답시간이 느려진 원인 찾아줘CPU 올라간 시간대에 에러 로그도 같이 증가했는지 봐줘 구성은 로컬 PC에서 Python으로 간단하게 만..