앤트로픽의 인공지능(AI) 모델이 사이버보안 테스트 과정에서 실제 외부 기관 3곳의 시스템에 침입한 사실이 확인됐다.
30일(현지시간) 블룸버그 등 외신에 따르면 앤트로픽은 이날 오픈AI의 사고 발표 이후 자체 사이버보안 테스트를 전수 점검한 결과, 이같은 사실을 발견했다고 밝혔다.
오픈AI와 같이 테스트용으로 격리돼 있어야 할 환경에서 AI 모델이 인터넷 환경에 접속할 수 있었던 것이 사고의 원인이다.
회사는 총 14만1006건의 평가 테스트를 검토한 결과 자사 AI 모델 ‘클로드’가 인터넷에 접속한 뒤 외부 기관의 실제 인프라를 해킹한 사례를 3건 확인했다고 말했다. 가장 먼저 일어난 사고는 지난 4월 발생했다.
피해를 입은 기관의 이름은 공개되지 않았으나 사안에 정통한 관계자는 허깅페이스와 클라우드 플랫폼 모달은 이번 피해 기관에 포함되지 않았다고 언급했다. 앞서 오픈AI 모델은 허깅페이스를 해킹한 데 이어 모달 고객사의 계정에도 접근한 바 있다.
앤트로픽과 피해 기관 모두 침입 사실을 사전에 인지하지 못했다. 회사는 네트워크 로그와 평가 기록을 보다 철저히 검토했어야 한다고 인정했다.
회사에 따르면 사고에는 제한된 테스트 환경을 벗어난 오퍼스 4.7, 미토스 5, 내부 연구용 테스트 모델 등 총 3개 AI 모델이 연관됐다. 이들은 일반 공개 서비스에 적용되는 안전 장치 없이 실행됐으며, 클로드는 취약한 비밀번호를 악용하는 등 기본적인 해킹 기법을 이용해 외부 기관 시스템에 침투했다.
모든 사고는 AI 보안 기업 ‘이레귤러’가 구축한 평가 환경에서 발생했다. 당시 앤트로픽은 클로드에 해당 환경이 시뮬레이션이며 인터넷에 연결돼 있지 않다고 안내했지만, 실제로는 그렇지 않았다.
관련기사
- 오픈AI 넘어서나…앤트로픽, 이르면 다음주 신규 투자 마무리2026.05.25
- "공개 미룬 앤트로픽 '미토스', 위험성 과장됐다"2026.04.24
- '안전쇼' 논쟁…오픈AI와 앤트로픽은 왜 다른 길을 가나2026.03.05
- 앤트로픽, 오픈AI 정면 비판…"국방부 계약은 안전쇼"2026.03.05
앤트로픽은 “우리와 평가 파트너 간 오해로 인해 실제 환경은 의도와 달랐다”고 설명했다. AI 모델은 무단으로 접근한 외부 기관들도 모두 테스트의 일부로 인식한 것으로 알려졌다.
이번 테스트는 다른 시스템에 침투해 숨겨진 정보를 찾아내는 ‘캡처 더 플래그’ 방식으로 진행됐다. 이는 사람과 AI 모두의 해킹 능력을 평가할 때 널리 활용되는 방식이다.











