WSJ "AI해킹, 쥬라기 공원 모멘텀 왔다"

오픈AI·앤트로픽 AI '보안사고'에 우려 커져...올트만 "이렇게 강렬히 와닿은 보안사고는 처음"

컴퓨팅입력 :2026/08/02 14:33    수정: 2026/08/02 15:21

"사이버보안 산업계에 쥬라기 공원 시기(모멘텀)가 왔다"

오픈AI와 앤트로픽의 최신 AI모델이 최근 일으킨 '보안 사고'에 대해 근착 월스트리트저널(WSJ)은 이렇게 표현했다 .영화 '쥬라기 공원'에는 인간이 최첨단 기술로 공룡을 통제하고 있다고 믿었지만, 예상치 못한 사고로 공룡들이 우리를 탈출하면서 통제가 완전히 무너진다. 이후 공룡들은 인간의 의도와 상관없이 움직이며 큰 혼란과 피해를 일으킨다.

지난달 20일(미국시각) 오픈AI는 자사 사이버 보안 평가용 최첨단 AI모델 2개가 격리(containment)를 벗어나 허깅페이스를 자율적으로 공격한 사실을 공개했다. 이 사건은 지난달16일 허깅페이스가 이상 공격을 발표한 뒤 조사 끝에 오픈AI 모델이 원인으로 확인하면서 알려졌다.

이보다 10일 후인 지난달 30일(미국시각)에는 앤트로픽이 내부 조사 결과 자사 클로드(Claude) 계열 모델 3개가 의도하지 않게 인터넷에 접속, 3개 기관의 시스템에 무단 접근(unauthorized access)했고 발표했다. 이는 오픈AI 사건 이후 앤트로픽이 자사 사이버보안 평가 기록을 전면 재검토하는 과정에서 확인됐다.

앤트로픽은 오픈AI의 허깅페이스 관련 보고서 공개 후 총 14만1006건의 사이버보안 평가 실행 기록을 검토했다. 이에는 클로드 오퍼스 4.7(Claude Opus 4.7), 클로드 미토스 5(Claude Mythos 5),그리고 아직 공개되지 않은 내부 연구 모델 등 3개 AI모델이 동원됐다.

앤트로픽은 AI 보안 기업 일레귤러(Irregular)와 이들 3개 AI모델을 사용해 CTF(Capture the Flag) 형태의 사이버보안 시나리오를 수행했는데, 이들 모델이 인터넷에 접근해서는 안 되는 환경이었지만, Irregular와의 의사소통 착오로 인터넷 접근이 가능했고, 이후 모델들은 인터넷에 접속, 서로 다른 3개 기관의 실제 운영 인프라(production infrastructure)에 무단 접근했다.

샘 알트먼 오픈AI CEO(왼쪽)과 다리오 아모데이 앤트로픽 CEO.

이에 대해 앤트로픽은 블로그에서 "클로드는 취약한 비밀번호와 인증이 필요 없는 엔드포인트를 악용하는 등 기본적인 기법을 이용해 해당 기관들의 인프라를 침해했다. 복잡한 취약점을 찾아내거나 악용하지는 않았으며, 각각의 사례에서 클로드는 자신에게 부여된 CTF 평가 과제를 완료하기 위해 필요한 행동만 계속 수행했다"고 설명했다.

그러나 일부 사례에서는 구형 모델이 자신이 실제 인터넷 환경에서 동작하고 있다는 증거를 확인한 이후에도 공격을 계속했다. 반면 최신 모델은 자신이 인터넷상에 있다는 사실을 인식하자 공격을 중단했다. 어떤 경우에도 클로드는 자기 자신을 외부로 유출(exfiltrate)하거나 의도적으로 시험 환경을 탈출하려 시도하지 않았다고 앤트로픽은 밝혔다.

가장 심각한 사례는 클로드가 허구의 회사를 만났는데, 그 회사 이름이 실제 인터넷 도메인과 동일한 경우였다. 클로드는 실제 존재하는 그 기관이 시뮬레이션 대상이라고 믿고 취약한 비밀번호와 외부에 노출된 서비스를 공격, 수백 건의 실제 운영 데이터가 저장된 데이터베이스 접근 권한을 획득했다.

두 회사 모두 지난주 오픈AI가 AI 기업 허깅페이스(Hugging Face)에 대한 7월 해킹 사실을 공개하기 전까지는 자신들의 모델이 외부로 빠져나간 사실조차 알아채지 못했다. 두 회사의 잇따른 AI해킹 공개는 미국 정가에도 큰 우려를 줬다. 일부는 이를 근거로 새로운 규제나 AI 테스트 체계를 도입해야 한다고 주장했다. 동시에 이번 사건은 해당 AI 연구소 내부 직원들에게도 적잖은 충격을 안겼다.

WSJ에 따르면, 샘 올트먼 오픈AI 최고경영자(CEO)는 한 팟캐스트에서 이번 사건을 언급하며 "개인적으로 이렇게 강렬하게 와닿은 보안 사고는 이번이 처음이다. 더 많은 사람들이 이 일을 그렇게 절실하게 느끼지 않는 것이 오히려 놀랍다"고 말했다. 또 그는 자사 모델의 해킹 사건을 "극도로 공상과학(SF)적인 사이버 사고(extremely sci-fi cyber incident)"이라고 표현했다.

사이버보안 전문가들에게 이번 사건은 AI 능력이 계속 향상되고 있으며, 그만큼 우려해야 할 이유도 커지고 있음을 보여줬다. 반면 AI 안전(AI Safety) 전문가들에게는 오래전부터 경고해 왔던 내용, 즉 AI 시스템이 현실 세계에 실제 피해를 일으키고 인간의 통제를 벗어날 수 있다는 주장이 입증된 사례로 받아들여진다.

AI 역량을 연구해 위험성을 분석하는 비영리 AI 연구기관 팰리세이드 리서치(Palisade Research)의 제프리 래디시(Jeffrey Ladish) 사무총장은 "실제 현실에서 이런 일이 벌어진 것을 보니 어느 정도 우리의 주장이 입증된 느낌"이라고 말했다. 그는 과거 앤트로픽의 정보보안 프로그램 구축에도 참여한 바 있는데 "온라인에서 나와 논쟁하는 사람들은 내가 공상과학 이야기나 믿는다고 말하곤 한다"며 "이제는 제발 우리의 예측이 더 이상 현실이 되지 않았으면 좋겠다"고 덧붙였다.

백악관이 AI 감독을 강화하고 있다는 신호도 나타났다. 백악관 관계자는 정부가 공개 이전 연방정부 검토 대상이 될 AI 모델을 규정하는 새로운 프레임워크를 마련했으며, 기업들과 자발적(voluntary) 테스트를 어떤 방식으로 진행할지에 대한 논의를 계속하고 있다고 밝혔다.

AI 보안 기업 어번던트 시큐리티(Abundant Security)의 최고기술책임자(CTO) 조슈아 색스(Joshua Saxe)는 "돌이켜보면 이번 사건들은 공격자들이 앞으로 어떻게 움직일지를 보여주는 전환점(inflection point)으로 기록될 가능성이 크다"며 "매우 위험한 상황이며, 이번 사건들이 그것을 분명히 보여준다"고 말했다.

오픈AI는 이번 해킹 사건에 대한 전면적인 검토를 실시하고 기술 보고서 공개를 약속했다.

작년 12월 스탠퍼드대 연구진은 최첨단 AI 기술을 이용해 실제 기업 네트워크를 대상으로 테스트한 결과, AI 모델이 실제 인간 해커와 거의 맞먹는 수준의 해킹 능력을 보였다는 연구 결과를 발표한 바 있다. 하지만 이 연구는 기업에게서 의뢰를 받아 직접 침투 테스트를 수행하는 전문 해커들, 즉 침투 테스터(penetration tester)들로부터 반발을 샀다. 당시 연구에 참여한 도너번 재스퍼(Donovan Jasper)는 "그때는 우리의 연구 결과가 많은 사람들에게 의심을 받았다"며 "사람들은 자신들이 AI보다 더 잘할 수 있다고 말했다"고 회상했다. 재스퍼는 이번 앤트로픽과 오픈AI의 공개가 자신들의 연구 결과를 뒷받침해 주는 사례라면서 "AI는 이런 분야에서 정말 뛰어난 수준에 도달하고 있다"고 진단했다.

관련기사

스탠퍼드 연구진이 당시 가장 우려한 점은 실험 중인 해킹 AI가 원래 의도하지 않은 행동을 할 가능성이었다.

사이버보안 컨설팅 업체 R10N 시큐리티(R10N Security)의 대표 라이언 맥기핸(Ryan McGeehan)은 "기존의 전통적인 보안팀 가운데 AI 중심(AI-forward)으로 전환하지 못한 조직은 결국 뒤처질 수밖에 없다"면서 "에이전틱 AI 해커는 인간과 다르다. 더 깊이 침투하고, 더 넓게 확산하며, 훨씬 더 정교하고, 훨씬 더 복잡한 공격을 수행한다"고 밝혔다.