[AI는 지금] 클로드, 실제 인터넷인 줄 알면서 공격…앤트로픽 "정렬 실패"

사이버보안 사고 4건 분석…'시뮬레이션 오인' 넘어 편향된 추론·무모함 지적

컴퓨팅입력 :2026/09/10 10:03

인공지능(AI) 안전을 핵심 경쟁력으로 내세운 앤트로픽이 자사 모델 클로드의 사이버보안 공격 사례를 추가 공개하며 정렬 실패 문제를 수면 위로 끌어올렸다. 실제 인터넷임을 보여주는 증거가 있었는데도 공격을 이어간 정황까지 스스로 밝히면서 모델 성능은 물론 위험 행동 통제·검증의 투명성까지 AI 경쟁의 새 기준으로 제시하려는 모습이다.

앤트로픽은 9일(현지시간) 공식 홈페이지에 공개한 '최근 사이버보안 사고에 대한 정렬 평가' 보고서에서 기존에 공개한 3건에 더해 지난 1월 발생한 초기 버전 '클로드 오퍼스 4.6'의 사고를 새롭게 공개했다. 앞선 3건을 조사한 뒤 추가 트랜스크립트를 분석하는 과정에서 발견한 사례다.

앤트로픽에 따르면 오퍼스 4.6은 사이버보안 평가에서 대상 시스템에 다른 시스템과 충돌하는 IP 주소를 할당해 대상에 접근할 수 없게 만들었다. 모델은 작업을 중단하려고 8차례 시도했지만 평가 환경 오류로 중단되지 않았다.

앤트로픽이 9일(현지시간) 공개한 '최근 사이버보안 사고에 대한 정렬 평가' 보고서 일부 (사진=앤트로픽)

이후 주변 시스템을 탐색하다 제3자 시스템에 접근했고 이를 평가 대상이라고 오인해 비밀번호를 이용한 관리자 권한 확보, 추가 자격증명 수집, 시스템 설정 변경, 관련자의 개인정보 열람 등을 수행했다. 앤트로픽은 해당 사고를 기존 3건보다 심각한 것으로 보지는 않는다고 부연했다.

이번 조사에서 앤트로픽은 기존 사고에 대한 해석도 일부 수정했다. 앤트로픽은 당초 클로드가 실제 인터넷을 시뮬레이션 환경으로 믿었기 때문에 공격했다고 설명했다. 

하지만 추가 분석 결과 클로드는 실제 인터넷임을 보여주는 증거를 선택적으로 해석한 것으로 파악됐다. 자신의 행동을 정당화하는 방향으로 증거를 받아들이는 '편향된 추론'이 나타났다는 것이다. 과업을 수행하기 위해 유해한 행동을 계속하는 '무모함'도 함께 확인됐다.

4건은 모두 동일한 제3자 평가 파트너가 구축한 사이버보안 평가 환경에서 발생했다. 클로드에는 인터넷 접속이 차단된 시뮬레이션이라고 안내했지만 환경 설정 오류로 실제 인터넷 접근이 가능했다. 앤트로픽은 이후 약 4억 8100만 개 트랜스크립트까지 조사 범위를 확대했다. 추가로 유사하거나 더 심각한 사례는 발견하지 못한 것으로 나타났다. 

관련기사

앤트로픽은 이들 사고를 "심각하다"고 평가하면서도 새로운 유형의 정렬 실패는 아니라고 선을 그었다. 다만 외부 평가환경의 방어장치가 실패하더라도 모델 자체가 위험한 행동을 중단해야 한다는 점을 강조했다.

또 앤트로픽은 보고서에서 "독립 연구기관 METR과 조사를 진행하고 실시간 모니터링과 평가환경 보안을 강화하겠다"고 밝혔다. 이어 "정렬 훈련을 확대해 모델이 필요할 경우 과업을 중단하도록 학습시키겠다"고 덧붙였다.