오픈AI '아스트라', 보안·안전 기능도 막강...7대 기능 살펴보니

"첫 '치명적' 수준 도달 모델...사람 지시 없이도 새로운 공격과 악용 방법 발견"

컴퓨팅입력 :2026/09/06 14:24

미국 오픈AI가 3일(현지 시간) 자사 최신 인공지능(AI) 모델 'GPT-6 아스트라(Astra)'를 공개했다. 

 이 모델에 대해 오픈AI는 범용인공지능(AGI)으로 간주될 수 있다고 밝혀 시선을 모았다. 실제 오픈AI 그렉 브록먼 사장은 제품 브리핑에서 "세계 최고 컴퓨터 사용자 모델(The world’s best computer use model)이라면서 “이 새로운 모델이 언젠가는 인공 일반 지능(AGI)의 초기 단계로 여겨질 것”이라고 밝혔다. AGI(Artificial General Intelligence)는 챗GPT처럼 특정 작업을 잘하는게 아니라 사람처럼 다양한 분야를 이해하고 배우며 문제를 해결할 수 있는 AI를 말한다.

'아스트라(Astra)'는 사이버보안과 안전 측면에서도 주목할만 하다. 아스트라의 보안 능력에 대해 오픈AI는 "우리의 Preparedness FRAMEwork에서 사이버보안 역량이 처음으로 ‘Critical(치명적)’ 도달한 모델"이라고 밝혔다.

 'Preparedness FRAMEwork(준비성 평가 프레임워크)'는 오픈AI가 AI 모델의 능력이 어느 수준까지 올라갔을 때 심각한 위험이 발생할 수 있는지를 사전에 측정, 그 수준에 맞춰 안전장치를 강화하기 위해 만든 자체 위험관리 기준이다. 2023년 12월 처음 공개했다. 이후 모델 능력이 높아지면서 계속 개정하고 있다. 실제, 오픈AI는 최근 몇 주간 '아스트라' 출시를 늦추며 사이버 악용과 승인되지 않은 모델 행동을 막기 위한 안전장치를 강화했다. '아스트라'의 보안 및 안전 능력은 어느정도일까. 

아래는 오픈AI가 자체 발표한 아스트라의 중요한 7대 보안 및 안전 기능.

<1> 사이버 역량 크게 도약...‘크리티컬' 기준 첫 충족

오픈AI는 '아스트라'가 사이버 역량에서 상당한 수준의 발전을 이뤘다고 강조했다. 회사가 설정한 Critical 임계치를 충족했다는 것이다. 이는 아스트라가 Astra가 적절한 도구와 접근 권한을 갖게 될 경우, 이전에 알려지지 않았던 보안 취약점을 찾아내고 새로운 공격과 악용 방법을 개발할 수 있으며, 보안이 잘 갖춰진 다양한 시스템에서도 사람이 매 단계마다 직접 지시하지 않더라도 이러한 작업을 수행할 수 있다는 것을 의미한다고 오픈AI는 설명했다.

오픈AI는 "이에 따라 우리는 모델이 유해한 사이버 행위를 수행하는 것을 막기 위한 보호장치를 대폭 강화했다. 이러한 유해 행위가 악의적인 사용(misuse)에 의해 발생하는 경우뿐 아니라 모델 자체의 비정렬(misalignment) 때문에 발생하는 경우까지 고려했다"면서 "또한 아스트라와 유사한 모델을 오픈AI 내부에서 개발하고 배포하는 과정 자체를 안전하게 보호하기 위한 조치도 취했다"고 말했다. 

실제 오픈AI는 더 엄격한 격리(isolation)와 체크포인트 암호화(checkpoint encryption), 사고 과정(CoT·Chain of Thought)을 포함한 전체 실행 경로(trajectory)에 대한 전면적인 모니터링을 실시했다. 또 모델을 내부적으로 사용하기 전에 차단형 정렬 평가(blocking alignment evaluation) 절차를 거치게 했다.

<2>이전 모델보다 훨씬 강력한 견고성(robustness) 

AI의 견고성은 예상하지 못한 입력이나 작은 변화가 생겨도 성능과 판단을 안정적으로 유지하는 능력을 말한다. 오픈AI는 아스트라가 새로운 견고성 안전 훈련 기법(robustness safety training techniques)을 적용, 이전 모델인 GPT-5.6 Sol보다 탈옥(jailbreak) 공격에 훨씬 더 강한 견고성을 갖게 됐다고 밝히며 "이러한 차이는 특히 더 긴 실행 경로(longer trajectories)에서도 확인됐다. 우리는 오프라인 테스트뿐 아니라 엄격한 내부·외부 탈옥 테스트와 그에 따른 문제 개선 프로그램을 통해 이러한 사실을 확인했다"고 설명했다.

이어 "또한 잠재적으로 고위험 사용자로 분류한 사용자에 대해 모델의 거부 기준(refusal boundary)을 더욱 보수적으로 조정하고, 이중용도(dual-use) 위험의 더 광범위한 영역을 포괄하도록 거부 범위를 확대하는 능력을 추가로 학습시켰다"면서 "우리는 과거 테스트 기간에 발견한 탈옥 공격에 대해서도 아스트라가 계속 견고한지를 확인하기 위해 회귀 테스트(regression testing)를 실시했다. 

또한 최신 내부 레드팀 공격자(red-teaming attackers)를 활용해 새로운 차례의 자동화된 레드팀 테스트(automated red-teaming)를 수행, 이를 통해 모델의 개선 사항을 검증했다"고 밝혔다.

<3> 정렬(aligned) 기능도 이전모델보다 우수

오픈AI는 아스트라가 모델 정렬(alignment) 측면에서도 중요한 진전을 이뤘다고 밝혔다. 여기에는 사전학습 데이터 구성 방식부터 강화학습 과정 평가(grading)에 이르기까지 정렬을 개선하기 위한 다양한 조치가 포함됐다. 오픈AI는 새로운 일련의 정렬 평가(alignment evaluations)를 공개하며 "아스트라가 안전 및 보안상의 경계를 더 잘 준수하고, 자신에게 허용된 범위(scope)를 벗어나지 않고 행동하는 능력이 더 뛰어난 것으로 나타났다"고 전했다.

실제, 오픈AI 내부에서 수행한 5만4000건 이상의 코덱스(Codex) 작업을 대상으로 한 시뮬레이션에서 아스트라는 GPT-5.6 Sol에 비해 높은 심각도의 비정렬 행동(misaligned behavior)으로 분류된 경고가 약 절반 수준에 그쳤다.

<4> 비정렬 행동 광범위하게 모니터링...상당한 컴퓨팅 비용 발생

오픈AI는 모델에서 발생할 수 있는 잠재적인 비정렬 행동을 방지하는 가장 중요한 수단으로 모델 정렬(alignment)을 꼽았다. 이와함께 모니터링 역시 최첨단 모델의 행동을 폭넓게 관찰할 수 있도게 해주는 중요한 수단이라고 밝혔다.

 실제 오픈AI는 "모니터링을 통해 모델이 실제로 어떻게 행동하는지를 파악할 수 있고, 이를 바탕으로 정렬과 안전성을 추가로 개선할 수 있는 지점을 찾아낼 수 있다"면서 "뿐만 아니라 모니터링은 이미 발견된 비정렬 행동에 대응하기 위한 추가적인 보호 계층(layer of protection) 역할도 한다. 이런 이유로 우리는 아스트라를 외부에 배포하면서 도구를 사용하는 모든 추론(tool-using inference) 과정에 비정렬 행동 모니터링 기능을 추가했다. 이 시스템을 운영하는 데에는 상당한 컴퓨팅 비용(compute cost)이 발생한다. 이 모니터링 시스템은 오픈AI가 내부적으로 구축해 운영하는 시스템과 동일한 방식으로 구성돼 있다"고 밝혔다.

<5>모니터링 가능성(monitorability)은 더 낮아져

오픈AI는 아스트라의 모니터링 가능성(monitorability)과 통제 가능성(controllability)에 대해 상당한 규모의 조사를 수행했다. 그 결과, 아스트라는 GPT-5.6 Sol보다 자신의 사고 과정(CoT)을 스스로 통제하는 능력이 더 뛰어난 것으로 나타났으며, 자신의 CoT 안에 자신에게 불리하거나 문제를 드러낼 수 있는 정보(incriminating information)를 포함할 가능성도 더 낮은 것으로 확인됐다고 전했다.

특히 모델에게 자신의 행동이 모니터링되는 것을 회피하도록 유도하는 적대적 환경(adversarial settings)에서 테스트한 결과, 아스트라는 평가 과정에서 의도적으로 성능을 낮추는 방식인 '샌드배깅(sandbagging)'을 전략적으로 사용, 탐지되지 않은 채 남아 있을 수 있다고 오픈AI는 밝혔다.

또 특정 사보타주(sabotage) 작업을 수행하도록 요청했을 때에는 아스트라가 오픈AI의 내부 모니터를 때때로 회피할 수 있는 것으로 나타났다. 다만 스테가노그래픽 CoT 추론(steganographic CoT reasoning), 즉 겉보기에는 평범하고 서로 관련 없어 보이는 텍스트 속에 숨겨진 추론 내용을 은밀하게 감추는 방식의 사고 과정은 발견하지 못했다고 덧붙였다. 

오픈AI는 "이는 현재 확인된 모니터링 회피 위험이 주로 상대적으로 낮은 수준의 추론 작업에 한정될 가능성을 보여준다. 이러한 연구 결과는 아스트라 계열 모델이 적대적인 조건에서는 CoT 모니터를 회피할 수 있다는 것을 의미한다"면서 "다만 현재까지의 이러한 연구 결과는 대부분 모델에게 모니터링을 회피하라고 직접 지시하는 적대적 평가(adversarial evaluations)에 기반하고 있다. 전체적인 정렬 평가 결과를 보면, 아스트라가 GPT-5.6 Sol보다 안전 및 보안상의 제한을 전반적으로 위반할 가능성은 오히려 더 낮은 것으로 나타났다. 그럼에도 오픈AI는 이러한 추세를 심각하게 받아들이고 있다. 모델의 능력이 더욱 강력해짐에 따라 이러한 현상이 모니터링 가능성에 어떤 의미를 갖는지 계속해서 조사하고 있다"고 전했다. 이어 "이번 연구 결과는 모델의 CoT를 들여다보는 것만으로는 충분하지 않으며, CoT 분석을 넘어서는 새로운 정렬 감사(alignment auditing) 기법을 개발하는 것이 중요하다는 점을 보여준다"고 전했다.

<6> 웹 브라우징과 업무 환경에서 더 책임감 있게 행동

오픈AI는 아스트라가 GPT-5.6 Sol보다 프롬프트 인젝션(prompt injection) 공격에 훨씬 더 강한 견고성을 갖췄다고 밝혔다. OpenAI는 실제와 유사한 웹 브라우징 환경과 전문적인 컴퓨터 업무 환경에서 아스트라의 행동을 테스트했다. 그 결과, 아스트라는 GPT-5.6 Sol과 비교했을 때 비정렬된 행동이나 잠재적으로 파괴적인 행동을 수행할 가능성이 크게 낮은 것으로 나타났다.

여기서 말하는 위험한 행동에는 허가받지 않은 거래를 실행하는 행위, 데이터 손실을 일으키는 행위, 필요 이상의 접근 권한을 사용하는 행위, 통제 장치를 우회하는 행위 등이 포함됐다. 또 아스트라는 에이전트형(agentic) 환경에서 유해한 요청을 처리할 때도 더욱 안전하게 행동한다고 회사는 밝혔다. 예를 들어 폭력적인 공격 계획을 세우는 데 도움을 달라는 요청이나 사기를 저지르도록 요구하는 요청과 같은 경우에 보다 안전히 대응하는 것으로 나타났다고 설명했다.

<7>"고위험 상황에서 훨씬 더 안전"

오픈AI는 아스트라가 더 높은 위험이 따르는 상황에서 이전 모델보다 훨씬 더 안전하다고 진단했다. 실제 서비스 환경에서 발생하는 요청과 적대적 방식으로 진행된 인간 레드팀 테스트에서 도출된 난이도 높은 요청에 대해 GPT-5.6 Sol보다 더 안전하게 대응했다고 설명했다. 

즉, '파레토 개선(Pareto improvement)'을 통해 안전하지 않은 요청을 안전한 방식으로 처리하면서도, 아무런 문제가 없는 요청을 불필요하게 거부하는 것은 줄였다고 덧붙였다. 이러한 개선은 명시적인 요청 자체가 아니라, 보다 광범위한 맥락에서 피해가 발생할 위험이 나타나는 고위험 상황에도 적용다면서 "아스트라는 18세 미만 사용자에게 연령에 적합한 안전 기준을 보다 일관되게 적용한다"고 밝혔다. 

많이 거부하는 방식으로 안전성을 높인 것이 아니라, 유해한 요청에는 보다 안전하게 대응하면서 동시에 정상적이고 무해한 요청에 대한 불필요한 거부는 줄이는 방향으로 안전성과 유용성을 함께 개선했다는 것이다.

관련기사

회사는 "이러한 개선은 위험한 행동의 가능성이 명시적인 요청 자체에서 드러나는 것이 아니라, 요청을 둘러싼 더 넓은 맥락에서 발생하는 고심각도(high-severity) 상황까지 확대됐다. 또한 아스트라는 18세 미만 사용자를 대상으로 할 때 연령에 적합한 안전 경계(age-appropriate safety boundaries)를 이전보다 더 일관되게 적용한다"고 말했다.


◆ 아스트라의 여러 보안&안전 기능 지수