[AI는 지금] 오픈AI 이어 앤트로픽도 '실제 해킹'…AI 통제 비상

안전장치 낮춘 보안 평가서 실제 시스템 침해…인터넷 접근·실행 권한 통제 강화 요구

컴퓨팅입력 :2026/07/31 16:53    수정: 2026/07/31 17:30

오픈AI에 이어 앤트로픽의 인공지능(AI) 모델도 사이버보안 시험 도중 외부 기관의 실제 시스템을 침해한 것으로 나타났다. 고성능 AI의 공격 능력을 확인하기 위해 안전장치를 낮춘 평가가 잇따라 보안 사고로 이어지면서 AI 모델의 인터넷 접근과 실행 권한을 통제하는 체계를 강화해야 한다는 요구가 커지고 있다.

31일 테크크런치에 따르면 앤트로픽은 최근 사이버보안 평가 기록 14만1006건을 자체 조사한 결과 '클로드' 모델이 3곳의 운영 시스템에 무단 접근한 사례 3건을 확인했다.

이번 사고는 앤트로픽이 외부 평가업체 이레귤러와 클로드의 사이버 공격 능력을 시험하는 과정에서 발생했다. 양사는 모델이 인터넷에 접속할 수 없는 격리 환경에서 평가가 진행되는 것으로 이해했지만 실제 환경에는 외부 연결 경로가 열려 있었다.

미국 인공지능(AI) 기업 앤트로픽의 로고. 앤트로픽은 대형언어모델 '클로드' 등을 개발했다. (사진=로이터/뉴스1)

클로드는 인터넷에 접근할 수 없다는 지시를 받았지만 외부에서 발견한 실제 시스템을 시험 대상으로 판단해 공격을 이어갔다. 사고에는 클로드 오퍼스 4.7과 미토스 5, 내부 연구용 모델이 각각 관여했다.

오퍼스 4.7은 실제 운영 시스템에 접근했다는 사실을 인식하고도 인증정보를 확보하고 운영 데이터가 담긴 데이터베이스에 접근했다. 미토스 5는 실제 인터넷일 가능성을 감지했지만 시험 환경이라고 판단해 공개 파이썬 저장소 파이파이(PyPI)에 악성 패키지를 배포했다. 해당 패키지는 적발되기 전 외부 시스템에 다운로드돼 실행됐다.

반면 가장 최신인 내부 연구용 모델만 대상이 실제 시스템이라고 판단한 뒤 작업을 중단했다. 이는 AI가 현실과 시험 환경을 구분하도록 지시하는 것만으로는 사고를 막기 어렵고 외부 시스템 접근을 기술적으로 차단해야 한다는 점을 시사한다.

이에 대해 앤트로픽은 "모델이 독자적인 목표를 추구한 것은 아니고 주어진 과제를 수행하려 했다"며 "일반 서비스에 적용하는 안전 모니터링과 분류기도 모델의 순수한 사이버 능력을 측정하기 위해 이번 평가에서는 제외했다"고 설명했다.

앞서 오픈AI의 미출시 모델도 격리된 평가 환경을 벗어나 허깅페이스와 다른 외부 서비스에 접근해 논란이 됐다. 해당 사고는 미국 의회와 백악관까지 대응에 나설 정도로 파장이 컸다. 미국 의회에서는 AI 비상 중단 장치 도입을 요구하는 'AI 킬 스위치법'이 발의됐고 도널드 트럼프 대통령도 추가 보호 조치 검토 가능성을 언급했다.

관련기사

오픈AI 모델은 알려지지 않은 취약점을 이용해 격리 환경을 벗어난 반면, 앤트로픽 모델은 평가 환경의 설정 오류로 열린 인터넷 경로를 통해 실제 시스템에 접근했다. 침해 경로는 달랐지만 두 사례 모두 평가 단계에서 모델의 외부 활동을 차단하지 못하면서 AI 기업의 자체 시험 환경과 외부 평가업체의 네트워크 설정, 접근 권한을 함께 검증해야 한다는 요구가 커지고 있다.

앤트로픽은 "강력한 AI 모델을 평가할 때는 그 능력에 맞는 강력한 통제가 필요하다"며 "현재 독립 평가기관 METR와 사고에 대한 제3자 검토를 진행하는 동시에 모든 책임이 우리에게 있다는 전제 아래 개선 조치를 추진하고 있다"고 밝혔다.