앤트로픽 AI 모델, 미제 살인사건 허위제보 '논란'

상호작용 테스트 도중 일탈…사건 두달 뒤에야 확인

컴퓨팅입력 :2026/10/10 19:41    수정: 2026/10/10 20:17

미국 앤트로픽의 인공지능(AI) 모델이 미해결 살인 사건에 대해 거짓 제보를 한 사실이 확인돼 파장이 일고 있다.

9일(현지시간) 테크크런치를 비롯한 주요 외신에 따르면 앤트로픽의 AI 모델이 지난 7월 18일 필라델피아 경찰청(PPD)의 미제 사건 제보 웹사이트에 접속한 뒤 목격자인 것처럼 거짓 제보를 남겼다.

앤트로픽 AI 모델의 거짓 제보는 내부 스팸 필터에 걸려 실제 수사 인력에 전달되지는 않았다.

하지만 앤트로픽은 사건 발생 두 달 후인 지난 9월 28일 이 같은 사실을 알게 됐다. 이후 앤트로픽은 지난 7일 경찰청에 관련 사실을 통보하고 이튿날 면담을 가졌다.

(사진=씨넷)

필라델피아 경찰은 “기술 기업은 자사 시스템이 (이번 같은) 허위 정보를 제출하지 않도록 안전 조치를 강화해야 한다”며 “특히 시 당국이 인지하지 못하는 가운데 시스템에 영향을 미치는 유사 사고를 막도록 해야 한다”고 강조했다.

또 “사건 발생 후 탐지 및 보고까지 두 달이나 걸린 것은 수용할 수 없다"고 덧붙였다.

테크크런치에 따르면 앤트로픽 AI 모델은 당시 무작위로 웹사이트와 상호작용하는 테스트를 진행 중이었다. 이 과정에서 AI가 스스로 미제 사건 제보 사이트에 접근해 허위 내용을 작성한 뒤 제출한 것으로 알려졌다.

관련기사

이번 사건은 자율형 AI 에이전트를 인간이 감독하지 않을 때 어떤 위험이 발생할 수 있는지 보여주는 명확한 사례라고 외신들이 지적했다.

앤트로픽 뿐 아니라 오픈AI 역시 테스트 작업 중 AI 모델이 스스로 판단해 데이터셋 플랫폼이 허깅페이스를 해킹한 일이 발생했다. 특히 오픈AI의 모델은 허깅페이스를 해킹한 뒤 소프트웨어 취약점을 그대로 공개해 파장이 일기도 했다.

김익현 미디어연구소장sini@zdnet.co.kr