최근 허깅페이스를 해킹한 외부 인공지능(AI) 에이전트 실체가 오픈AI 모델인 것으로 드러났다.
21일(현지시간) 테크크런치 등 외신에 따르면 오픈AI는 자사 모델이 격리 환경을 벗어나 허깅페이스 시스템에 무단 접근한 사실을 인정했다. 허깅페이스는 오픈AI와 별도 관계 없는 기업으로 당초 공격 주체를 외부 AI 에이전트로 추정했다.
이번 사고에는 'GPT-5.6 솔'을 비롯한 오픈AI 미출시 버전 모델이 관여한 것으로 나타났다. 해당 모델들은 사이버 공격 능력을 평가받기 위해 안전 거부 기능이 완화된 상태로 내부 시험에 투입됐다.
시험에는 기존 보안 취약점을 이용한 공격 능력을 측정하는 공개 벤치마크 '익스플로잇짐'이 사용됐다. 모델들은 벤치마크 문제 정답을 찾는 과정에서 허깅페이스 시스템까지 침입·공격한 것으로 조사됐다.
해당 모델은 원칙적으로 외부 인터넷에 접속할 수 없도록 격리돼 있었다. 다만 시험에 필요한 소프트웨어(SW)를 설치할 수 있도록 패키지 설치 도구에는 접근할 수 있었다.
모델은 패키지 설치 프로그램에서 공개되지 않은 취약점을 찾아 인터넷 접속 제한을 우회했다. 이후 허깅페이스에 익스플로잇짐 관련 모델과 데이터셋, 문제 해결 정보가 저장돼 있을 가능성이 있다고 판단했다.
해당 모델은 허깅페이스 인프라 취약점도 추가로 찾아냈다. 이를 통해 허깅페이스 운영 데이터베이스(DB)에 접근하고 익스플로잇짐 시험 문제 정답을 직접 확보한 것으로 파악됐다.
허깅페이스는 "이번 공격은 단순한 일회성 침입이 아니었다"며 "AI 모델은 여러 임시 실행 환경을 옮겨 다니며 수천 건 공격을 수행했다"고 밝혔다. 이어 "공개 인터넷 서비스를 공격 명령을 전달하는 중간 거점으로 활용한 정황도 포착됐다"고 덧붙였다.
오픈AI는 패키지 설치 도구와 허깅페이스 인프라에서 발견된 취약점을 신고했다. 현재 허깅페이스와 추가 조사를 진행하고 있으며, 모델 시험과 관련 인프라에 새로운 통제 장치를 적용할 방침이다.
관련기사
- 허깅페이스, 데이터·인증정보 털려…"이용자에 보안키 교체 권고"2026.07.21
- [ZD SW 투데이] 깃허브, 오픈소스 후원금 1억 달러 모았다 外2026.07.21
- [SW키트] 엔타이어, 깃허브에 몰린 AI 트래픽 분산…"보완재에서 경쟁사로"2026.07.13
- "당신들이 교사를 못 버티게 만들었다"…오픈AI 사옥서 쏟아진 소설가의 작심 발언2026.07.21
이번 사건으로 오픈AI가 법적 책임을 질지는 확인되지 않았다. 다만 외신은 모델 무단 시스템 접근이 미국 '컴퓨터 사기 및 남용 방지법'을 위반했을 가능성이 있다고 분석했다.
오픈AI는 "모델들은 익스플로잇짐의 해결책을 찾는 데 지나치게 몰두했고 매우 제한적인 시험 목표를 달성하기 위해 극단적인 수단까지 동원했다"며 "인터넷에 접근한 뒤 평가에서 부정행위를 하는 데 이용할 수 있는 비밀 정보를 찾아냈다"고 밝혔다.











