오픈AI의 인공지능(AI) 모델이 사이버보안 성능 시험 도중 격리 환경을 벗어나 허깅페이스 시스템에 침입한 것으로 드러났다. 자율형 AI 에이전트의 공격 역량뿐 아니라 개발사가 시험 환경을 제대로 통제했는지를 둘러싼 책임 논란도 커지고 있다.
27일 업계에 따르면 오픈AI는 최근 내부 보안 시험에 투입한 모델이 시험 환경의 취약점을 이용해 외부 인터넷에 접속한 뒤 허깅페이스 시스템에 접근했다고 밝혔다. 모델은 허깅페이스 서버에서 시험 관련 정보를 확보한 것으로 파악됐다.
허깅페이스는 이상 활동을 탐지해 차단했으며 고객 서비스나 이용자 데이터 피해는 확인되지 않았다고 설명했다. 사이버보안 전문가들은 모델의 자율적 행동과 별개로 외부와 분리돼야 할 시험 환경을 제대로 구성하지 못한 운영상 책임을 살펴야 한다고 지적했다.
오픈AI는 모델이 광범위한 피해를 일으키려 한 것이 아니라 시험 점수를 높이기 위해 예상하지 못한 수단으로 정보를 확보한 것으로 보고 있다. 주어진 목표를 수행하는 AI 에이전트가 개발자의 의도와 다른 방식으로 외부 시스템까지 공격할 수 있다는 위험이 실제 사고로 이어진 셈이다.
이에 클렘 들랑그 허깅페이스 최고경영자(CEO)는 최근 오픈AI에 사고를 일으킨 에이전트의 실행 기록을 공개하라고 요구했다. 연구자들이 모델의 판단과 도구 사용 과정을 분석할 수 있도록 사고 정보를 연구 커뮤니티와 공유해야 한다는 주장이다.
관련기사
- 오픈AI "한국정부와 사이버보안 협력"...공동 워크숍2026.05.18
- "오픈AI, 스마트폰 만든다…2028년 출시 목표"2026.04.28
- 오픈AI, 사이버보안 특화 새 AI 공개..."몇 달 내 등장 강력한 AI 대비"2026.04.15
- 자택 공격 당한 샘 알트먼, 무슨 말 했나2026.04.13
허깅페이스는 AI 기반 사이버 공격에 대응할 방어 기술 개발도 확대해야 한다고 봤다. 또 오픈AI가 오픈·폐쇄형 모델을 활용한 사이버 방어 연구에 1억 달러 상당의 컴퓨팅 자원을 지원해야 한다고 제안했다.
들랑그 CEO는 "최초의 자율형 에이전트 사이버 공격은 전례 없는 사건"이라며 "전례 없는 대응이 필요하다"고 말했다.











