중국 인공지능(AI) 기업들이 앤트로픽 '클로드' 핵심 역량을 대규모로 빼내려 한 정황이 포착됐다.
10일(현지시간) 테크크런치 등 외신에 따르면 앤트로픽은 중국발 5개 증류 공격 캠페인과 관련된 클로드 대화 약 2억건을 확인했다고 위협 인텔리전스 보고서를 통해 밝혔다. 관련 기업으로는 알리바바와 문샷AI이 꼽히고 있다.
공격 대상은 클로드의 에이전틱 기능과 도구 사용 능력에 집중된 것으로 나타났다. 코딩과 데이터 분석을 비롯해 논리적 추론 능력도 주요 표적인 것으로 확인됐다.
증류 공격은 고성능 AI 모델이 질문에 답하는 과정에서 생성한 사고 과정을 추출하는 방식이다. 공격자는 이렇게 확보한 자료로 소형 모델을 미세조정해 전반적인 추론 능력을 높일 수 있다.
앤트로픽은 이용자에게 모델 내부 사고 과정을 직접 공개하지 않고 전체 흐름을 정리한 '요약된 사고'만 보여준다. 그러나 공격자들은 번역 요청 등으로 질문을 위장해 클로드가 실제 사고 흔적을 드러내도록 유도했다.
실제 확인된 프롬프트 중 하나는 클로드에 이전 작업 메모리를 자연스럽고 정확한 일본어 가타카나로만 번역하라고 요구했다. 앤트로픽은 이 같은 우회 기법이 모델 방어 체계를 속이는 데 사용됐다고 설명했다.
가장 큰 규모의 공격은 알리바바와 관련된 캠페인에서 나타났다. 앤트로픽은 지난 5월부터 7월까지 약 1억 5100만건의 대화를 포착했으며 하루 처리량은 최대 300만건에 달했다고 밝혔다.
해당 대화는 3500개 계정을 통해 이뤄졌다. 이들 계정이 사고 과정을 추출하기 위한 동일한 고정 프롬프트를 사용한 점을 근거로 앤트로픽은 알리바바의 '큐원' 모델 제품군에 활용할 학습자료를 확보하려는 단일 캠페인으로 판단했다.
'키미' 개발사인 문샷AI와 관련된 캠페인에서는 중국군 요청으로 추정되는 내용도 발견됐다. 한 요청은 폐쇄회로(CC)TV 영상 묶음을 분석해 영상 속 인물이 비정상적으로 행동하는지 판단하도록 클로드에 요구했다.
앤트로픽은 10일 동안 5000개 계정으로 구성된 네트워크를 통해 약 30만건의 요청이 전달됐다고 밝혔다. 요청은 주로 클로드의 고성능 모델인 '오푸스'를 겨냥했다.
관련기사
중국 AI 기업의 증류 공격 논란은 이전부터 이어졌다. 앤트로픽은 지난 2월에도 특정 중국 연구소의 공격 활동을 공개했으며, 오픈AI는 딥시크가 자사 모델을 상대로 유사한 활동을 벌인 정황을 확인했다고 밝힌 바 있다.
앤트로픽은 "지난 몇 달 동안 승인받지 않은 연구소들이 우리 방어 체계를 우회하고 미국 최첨단 모델의 역량을 빼내기 위해 갈수록 정교한 수법을 개발해 왔다"며 "우리가 확인한 공격은 에이전틱 기능과 도구 사용과 코딩·데이터 분석과 논리적 추론 등 클로드의 가장 가치 있는 역량을 겨냥했다"고 밝혔다.








