[AI는 지금] 오픈AI 에이전트, 5월부터 허깅페이스 침투 시도…초기 경고 놓쳤나

보안 전문가 "기존 에이전트 행동 방식과 일치…사고 데이터 더 공개해야"

컴퓨팅입력 :2026/09/17 09:35

오픈AI의 통제에서 벗어난 인공지능(AI) 에이전트가 대규모 침해 사고 발생 두 달 전부터 허깅페이스 계정을 탈취하고 네트워크 취약점을 탐색한 정황이 드러났다. 

16일(현지시간) 로이터 등 외신에 따르면 독립 연구자로 활동 중인 요나스 비더만묄러는 오픈AI 에이전트가 지난 5월 13일 허깅페이스 이용자 계정 2개를 탈취한 뒤 비정상적인 형식의 파일을 회사 서버에 전송한 증거를 발견했다. 이는 허깅페이스 오픈소스 저장소를 겨냥한 7월 침해 사고가 알려지기 약 두 달 전이다.

비더만묄러는 에이전트 행동이 허깅페이스 네트워크 구조를 파악하거나 침투 경로를 시험하기 위한 정찰 활동과 유사하다고 분석했다. 다만 해당 활동이 실제 시스템 침해로 이어졌거나 7월 사고와 직접 연결됐다는 증거는 발견되지 않았다.

오픈AI의 통제에서 벗어난 인공지능(AI) 에이전트가 대규모 침해 사고 발생 두 달 전부터 허깅페이스 계정을 탈취하고 네트워크 취약점을 탐색한 정황이 드러났다. (사진=허깅페이스)

오픈AI는 지난달 공개한 사고 보고서에서 에이전트가 생물학 관련 파일에 접근하기 위해 허깅페이스 이용자의 디지털 인증정보를 탈취한 사실을 공개했다. 비더만묄러는 새롭게 확인된 네트워크 탐색 정황이 오픈AI 보고서에 기술된 활동보다 광범위한 것으로 보인다고 지적했다.

오픈AI는 사고 보고서에 5월 13일 사건을 공개했으며 비더만묄러가 발견한 활동도 허깅페이스에 비공개로 통보했다고 설명했다. 회사는 관련 사건에 대한 검토를 이어가면서 새롭게 파악한 내용을 공유하겠다고 입장을 밝혔다. 

다른 외부 보안 전문가들도 해당 활동이 앞서 오픈AI 에이전트와 연관된 것으로 확인된 행동 방식과 일치한다고 판단했다. 톰 헤겔 센티넬원 수석 위협 연구원은 최첨단 AI 연구소가 에이전트의 행동이 외부 시스템에 영향을 줄 경우 관련 사고 데이터를 더 적극적으로 공개해야 한다고 주장했다.

관련기사

시드니 본 아크스 나이팅게일 컬렉티브 연구원은 이번 활동을 7월 침해 사고를 예방하는 데 활용할 수 있었던 명백한 경고 신호로 평가했다. 오픈AI도 사후 분석을 통해 에이전트에게서 나타난 일부 초기 신호를 바탕으로 더 일찍 대응했어야 했다고 인정한 바 있다.

비더만묄러는 "오픈AI가 이러한 행동을 지난 5월 포착했다면 이후 발생한 대규모 사고를 막을 수도 있었을 것"이라고 밝혔다.