아마존웹서비스(AWS)가 인공지능(AI)을 활용해 애플리케이션과 AI 에이전트의 상태를 한곳에서 관리하고 장애 원인까지 분석할 수 있는 옵저버빌리티 서비스를 선보였다. 서비스 간 복잡한 종속 관계와 장애 원인을 자동으로 파악해 엔지니어의 운영 부담을 줄인다는 목표다.
AWS는 아마존 클라우드워치에 AI 기반 옵저버빌리티 서비스 '아마존 클라우드워치 옴니'를 출시했다고 2일 밝혔다.
클라우드워치 옴니는 애플리케이션과 AI 에이전트의 옵저버빌리티를 하나의 환경에서 제공한다. 엔지니어들은 동일한 데이터와 장애 조사 맥락을 공유하며 협업할 수 있으며 AWS 관리 콘솔 접근 권한이 없어도 조직 전용 URL과 기존 계정을 이용해 접속할 수 있다.
기존에는 엔지니어들이 시스템 상태를 파악하기 위해 여러 대시보드를 관리하고 임계값을 직접 조정해야 했다. 장애 발생 시에는 여러 도구를 오가며 원인을 추적해야 하고 여러 팀이 함께 대응할 경우 조사 과정에서 확보한 정보가 제대로 공유되지 않는 문제도 있었다는 게 회사 측 설명이다.
AWS는 클라우드워치 옴니를 통해 개별 인프라 신호가 아닌 애플리케이션을 중심으로 옵저버빌리티 환경을 구성했다. 오픈텔레메트리를 기반으로 기존 클라우드워치에 전송하던 텔레메트리 데이터도 별도 재설정 없이 활용할 수 있다.
서비스 탐색과 종속 관계 매핑, 알람 조정도 자동화한다. 사용자가 가용성 목표와 지연 시간, 오류율 등 주요 기준을 설정하면 시스템 변화에 따라 알람을 자동으로 조정한다. 새로운 서비스를 배포하면 변경된 애플리케이션 구조도 자동으로 반영하는 구조다.
장애 분석에는 '아마존 데브옵스 에이전트'가 활용된다. AI 에이전트가 엔지니어와 동일한 텔레메트리 데이터를 기반으로 여러 신호의 상관관계를 분석하고 장애 원인을 추적한다. 서비스 전반에서 연관된 이벤트를 식별하고 종속 관계를 따라 근본 원인으로 이어지는 경로도 분석한다.
장애가 발생하면 관련 정보가 포함된 조사 세션도 자동으로 생성한다. 특정 서비스에서 오류율이 상승하면 최근 배포 내역이나 연계된 응용프로그램인터페이스(API)의 지연 시간 등 관련 신호를 한곳에 보여주고 데브옵스 에이전트의 초기 분석 결과도 제공한다.
장애 대응을 다른 팀에 넘겨야 할 경우 담당 엔지니어가 동일한 조사 세션에 참여해 이전 조사 과정을 그대로 확인할 수 있다. 장애 원인을 파악해 복구한 뒤에는 전체 조사 이력이 자동으로 기록돼 별도의 장애 보고서를 작성해야 하는 부담도 줄였다는 설명이다.
관련기사
- AWS, 서울 리전에 '클로드' 탑재…금융·공공 AI 확대2026.09.30
- AWS, 업계 최초로 NATO 국방 클라우드 문턱 넘었다2026.09.29
- AWS, AI 에이전트도 골라 쓰는 모델로…오픈소스 실행환경 공개2026.09.23
- AWS, 미-이란 전쟁 중 피격된 중동 데이터 일부 복구 실패2026.09.16
클라우드워치 옴니는 텔레메트리 데이터와 AWS 컨피그의 리소스 검색을 활용해 서비스를 자동으로 탐색하고 종속 관계를 파악한다. 각 팀에는 담당 애플리케이션을 관리하는 별도 공간을 제공하며 기존 클라우드워치의 로그와 메트릭, 트레이스, 알람을 그대로 활용할 수 있다.
아마존 클라우드워치 옴니는 현재 이용 가능하며 기존 클라우드워치 고객은 클라우드워치 콘솔에서 바로 사용할 수 있다.








