[AI는 지금] 앤트로픽 "中 GLM-5.3, 클로드급 해킹 능력…안전장치는 쉽게 뚫려"

사이버 공격 테스트서 클로드와 근접…Z.ai "389개 오픈소스 프로젝트 방어에 활용" 반박

컴퓨팅입력 :2026/10/01 12:00

앤트로픽이 중국 Z.ai(지푸AI)의 최신 오픈웨이트 인공지능(AI) 모델 'GLM-5.3'이 자사 최상위 모델에 근접한 사이버 공격 능력을 갖췄지만 안전장치는 상대적으로 쉽게 무력화될 수 있다고 경고했다.

1일 홍콩 사우스차이나모닝포스트(SCMP)에 따르면 앤트로픽은 최근 GLM-5.3의 사이버 공격 능력과 안전성을 시험한 보고서를 공개했다. 

앤트로픽은 GLM-5.3에 실제 공격 과정을 처음부터 끝까지 수행하는 사이버 익스플로잇 과제 410건을 부여했다. GLM-5.3은 이 가운데 50건을 성공시켰다. 앤트로픽의 프론티어 모델 '클로드 미토스 프리뷰'는 같은 평가에서 56건을 성공했다. GLM-5.3은 모델 가중치를 내려받아 수정할 수 있는 오픈웨이트 방식으로 제공되는 반면, 클로드 미토스 프리뷰는 검증된 사용자만 사용할 수 있다.

앤트로픽은 "공격 성능 차이는 크지 않았지만 안전장치에서는 격차가 나타났다"고 설명했다.

(이미지=Z.ai)

실제 시험에서는 간단한 기법만으로도 GLM-5.3의 안전장치를 64~100% 확률로 우회할 수 있었다. 같은 방법을 안전장치가 적용된 클로드 모델에 사용했을 때는 우회에 성공하지 못했다.

연구진은 모델 내부 가중치 행렬을 수정해 유해한 요청을 거부하는 성향을 낮추는 '어블리터레이션(abliteration)' 기법도 적용했다. 그래픽처리장치(GPU) 2200개를 1시간 가동한 것과 맞먹는 연산량을 투입한 결과, 3개 안전성 평가에서 90%를 넘던 GLM-5.3의 거부율은 2~12%까지 떨어졌다.

안전장치를 약화하는 데 필요한 비용도 높지 않았다. 앤트로픽은 이번 실험에 약 4400달러가 들었으며 숙련된 팀이라면 약 1200달러 수준에서도 비슷한 작업이 가능할 것으로 추산했다. 사이버 공격 능력이 높은 모델의 안전장치를 비교적 적은 비용으로 제거할 수 있다는 점을 위험 요소로 본 것이다.

이를 두고 Z.ai는 자사 모델의 사이버 역량이 공격뿐 아니라 방어에도 활용되고 있다며 맞섰다. 지난 7월 개발자 플랫폼 허깅페이스는 오픈AI 모델에 의한 자율적 침입 사고를 조사하고 대응하는 과정에서 GLM-5.2를 활용했다. 당시 클로드는 안전장치 때문에 일부 보안 작업 수행을 거부했다.

GLM-5.3의 사이버 역량은 미국에서도 높은 수준으로 평가받고 있다. 미국 AI 표준·혁신센터는 최근 이 모델을 현재까지 공개된 오픈웨이트 모델 가운데 사이버 역량이 가장 높은 모델로 평가했다. 종합 사이버 보안 평가에서는 미국 최상위 모델보다 약 4개월 뒤처진 것으로 추산했다.

Z.ai도 모델 공개 과정에서 안전성 검증에 시간을 들였다. 회사는 지난 8월 GLM-5.3을 출시한 뒤 추가 안전성 시험과 보강 작업을 위해 모델 가중치 공개를 2주 늦췄다.

관련기사

다만 강력한 사이버 기능을 갖춘 모델을 누구나 내려받아 수정할 수 있다는 점은 오픈웨이트 모델의 공개 범위를 둘러싼 논쟁으로 이어지고 있다. 앤트로픽은 고성능 AI 모델에 대한 접근 통제를 강화해야 한다는 입장인 반면, 메타와 엔비디아 등은 개방형 모델이 기술 혁신을 촉진하고 AI 경쟁력을 높이는 데 도움이 된다고 주장하고 있다.

Z.ai는 "사이버 역량의 위험성만 볼 것이 아니라 실제 보안 현장에서의 활용도 함께 봐야 한다"며 "우리 모델은 이미 389개 오픈소스 프로젝트를 방어하는 데 활용됐고, 지금까지 4249건의 잠재적 취약점을 찾아냈다"고 밝혔다.