AI 안전, 선언보단 검증으로…국제표준도 달라진다

AI 공격해 숨은 위험 찾는 레드팀 표준화…안전성 입증 기준도 마련

컴퓨팅입력 :2026/09/22 15:44    수정: 2026/09/22 16:02

인공지능(AI) 기술이 빠르게 발전하면서 국제표준도 안전 원칙을 세우는 데서 나아가 실제 위험을 찾아내고 검증하는 쪽으로 기준이 바뀌고 있다.

전종홍 한국전자통신연구원(ETRI) 표준연구본부 책임연구원은 22일 서울대 인공지능신뢰성연구센터 월례세미나에서 "AI 안전과 신뢰성에 대한 국제표준 논의가 원칙 중심에서 이를 입증할 수 있는 증거 중심으로 이동하고 있다"고 밝혔다.

최근 AI는 질문에 답하는 도구에서 스스로 판단하고 행동하는 단계로 빠르게 넘어가고 있다. AI가 직접 도구를 사용하고 여러 작업을 수행하면서 성능과 정확도를 넘어 예상하지 못한 행동과 피해 가능성까지 검증해야 할 필요성이 커졌다.

전종홍 ETRI 표준연구본부 책임연구원은 "AI 안전과 신뢰성에 대한 국제표준 논의가 원칙 중심에서 이를 입증할 수 있는 증거 중심으로 이동하고 있다"고 밝혔다. (사진=지디넷코리아)

이에 따라 AI 안전을 확인하는 방법도 달라지고 있다. AI를 직접 공격해 취약점을 찾는 레드팀 테스트와 어떤 안전·신뢰 기준을 충족했는지 근거와 함께 보여주는 신뢰성 사실 라벨(TFL) 등이 국제표준으로 개발되고 있다.

전 책임연구원은 이 같은 AI 안전·신뢰성 분야 국제표준 개발을 주도해온 전문가다. ISO와 IEC의 AI 국제표준화위원회 'ISO/IEC JTC1 SC42'에서 AI 시험·평가와 레드팀 테스트, 신뢰성 표시 관련 표준 개발에 참여하고 있다. 대통령 직속 국가인공지능전략위원회 글로벌협력 분과위원으로도 활동 중이다.

일부러 AI 속여본다…안전 검증도 '레드팀'으로

AI 안전성을 확인하는 대표 방법이 레드팀 테스트다. AI를 일부러 속이거나 공격해 정상적인 사용 과정에서는 드러나지 않는 취약점을 찾는다.

AI는 기존 소프트웨어와 달리 모든 상황에서 어떤 결과를 내놓을지 미리 정하기 어렵다. 위험한 답변을 유도하거나 안전장치를 우회하는 등 다양한 공격을 가해 예상하지 못한 행동을 확인하는 이유다.

전 책임연구원이 국제표준 에디터를 맡은 'ISO/IEC 42119-7'은 이러한 레드팀 테스트의 절차와 방법을 정한다. 공격 시나리오 설계부터 시험 수행, 결과 분석과 개선까지 다루며 2027년 5월 제정을 목표로 하고 있다.

그는 "이미 알려진 공격만 반복해서 시험해서는 새로운 취약점을 찾기 어렵다"며 "악의적인 공격뿐 아니라 일반 이용자가 AI를 사용하는 과정에서 우연히 발생하는 문제까지 찾아낼 수 있어야 한다"고 강조했다.

AI 공격에 에이전트 30개…평가에도 AI 쓴다

레드팀 테스트에도 AI가 활용되고 있다. 사람이 직접 공격 문장을 만드는 대신 여러 AI 에이전트가 동시에 다양한 공격을 시도하는 방식이다.

실제로 올해 국내 AI 레드팀 챌린지에서는 한 참가자가 AI 에이전트 약 30개를 동시에 가동했다. 참가자 수는 지난해와 비슷했지만 제출된 공격 사례는 약 4900건에서 1만 7500건으로 3배 이상 늘었다.

AI를 활용하면서 짧은 시간에 훨씬 많은 공격을 시도할 수 있게 됐다. 동시에 사람이 확인해야 할 결과도 크게 늘었다.

결국 평가에도 AI가 투입됐다. 사람이 수많은 공격 결과를 하나씩 확인하기 어려워지자 AI가 결과를 분석하고 평가하는 데 활용됐다.

전 책임연구원은 "AI를 활용하면서 공격 규모가 크게 늘었다"며 "사람이 모든 결과를 확인하기 어려워져 평가에도 AI를 활용하게 됐다"고 설명했다.

AI 안전, 말로 보증 안 된다…증거 보여주는 '신뢰 라벨'

AI를 시험하는 것만큼 중요한 것은 그 결과를 어떻게 보여주느냐다. 국제표준화 현장에서는 AI가 어떤 안전·신뢰 기준을 충족했는지 근거와 함께 표시하는 TFL을 개발하고 있다.

TFL은 환경 라벨과 비슷하다. 기업이 말로 AI가 안전하다고 주장하는 대신 어떤 시험과 평가를 거쳤는지 확인할 수 있도록 한다. ▲위험관리 체계를 갖췄는지 ▲편향이나 취약점을 시험했는지 ▲사람이 중요한 결정을 통제할 수 있는지 등을 표시하고 이를 뒷받침하는 시험·인증 결과를 연결한다.

전 책임연구원은 "AI가 신뢰할 만하다는 것을 검증 가능한 방법으로 증명할 수 있는 체계를 만들자는 것"이라며 "환경 라벨과 비슷한 개념이라고 보면 된다"고 설명했다.

라벨은 사람뿐 아니라 AI가 읽을 수 있는 형태도 검토되고 있다. 향후 AI 에이전트가 다른 서비스에 접속하기 전에 해당 시스템이 어떤 안전 기준을 충족했는지 자동으로 확인하는 데 활용할 수 있다.

그는 "약 2년간 관련 작업을 진행했다"며 "현재 기본 개념과 요구사항을 담은 표준안이 국제표준 절차를 밟고 있다"고 밝혔다.

답변 넘어 직접 행동하는 AI…새 안전 기준 필요

표준화가 아직 따라가지 못한 영역도 있다. 스스로 판단하고 행동하는 AI 에이전트다.

AI 에이전트는 목표를 받아 작업 순서를 정하고 외부 도구를 이용해 직접 행동한다. AI에 어떤 권한을 줄지, 어떤 행동에 사람의 승인을 받도록 할지, 잘못된 행동을 어떻게 중단하거나 되돌릴지 등 새로운 기준이 요구된다.

여러 AI가 역할을 나눠 일하는 멀티에이전트에서는 각각의 권한과 행동을 추적하는 문제까지 더해진다. 하지만 이를 모두 포괄하는 국제표준은 아직 마련되지 않았다.

전 책임연구원은 "신원 확인과 권한 위임, 도구 사용 통제부터 사람의 승인과 검증, 문제가 생겼을 때 되돌리는 기준까지 필요하다"며 "현재 이를 모두 지원하는 표준은 없는 상황"이라고 지적했다.

프런티어 AI도 표준화 논의가 시작된 단계다. 어느 정도 능력이나 연산 규모를 갖춰야 프런티어 AI로 볼지 합의된 정의가 없고 빠르게 높아지는 능력을 어떻게 평가할지도 과제로 남아 있다.

관련기사

AI 발전 속도를 국제표준이 따라갈 수 있느냐는 숙제도 있다. 표준 제정에 수년이 걸리는 만큼 특정 기술에 맞춘 세부 기준은 완성될 때쯤 뒤처질 수 있어서다.

전 책임연구원은 "기술 트렌드에 종속되는 내용은 많이 다루지 않는다"며 "시간이 지나 기술이 변해도 필요성이 없어지지 않는 내용을 주로 다룬다"고 말했다.