[AI는 지금] 영화 속 AI 비서 '자비스' 현실로…오픈AI, '아스트라'로 AGI 시대 여나

컴퓨터 직접 조작·과학 난제 해결까지…브록먼 "훗날 AGI 초기 단계로 볼 수도"

컴퓨팅입력 :2026/09/04 10:06    수정: 2026/09/04 10:32

오픈AI가 차세대 인공지능(AI) 모델 'GPT-6 아스트라'를 공개하며 범용인공지능(AGI) 경쟁이 새로운 국면을 맞게 됐다. AI가 질문에 답하는 수준을 넘어 사람을 대신해 복잡한 업무를 수행하고 새로운 과학적 성과까지 만들어내는 단계로 진화하면서 빅테크 간 경쟁도 모델 성능에서 실제 업무 수행 능력으로 빠르게 확산될 전망이다.

4일 오픈AI에 따르면 GPT-6 아스트라는 컴퓨터 사용과 웹 브라우징, 소프트웨어 개발, 과학, 사이버보안, 전문 업무 전반에서 기존 모델보다 성능을 높였다. 오픈AI는 아스트라를 자사 모델 중 가장 높은 지능과 정렬 성능을 갖췄다고 설명했다. 

특히 이용자가 작업 과정을 하나씩 지시하지 않아도 목표를 이해하고 필요한 도구를 사용해 여러 단계의 업무를 이어가는 능력이 크게 강화됐다. 영화 '아이언맨'에서 토니 스타크의 지시를 받아 각종 시스템을 넘나들며 일을 처리하는 AI 비서 '자비스'에 가까운 모습이 현실로 다가온 셈이다.

챗봇 넘어 '실행형 AI'로…컴퓨터·전문SW 직접 조작

아스트라는 온라인 양식을 작성하고 고객관계관리(CRM) 정보를 갱신하거나 일정을 정리할 수 있다. 웹에서 자료를 조사한 뒤 이메일이나 문서를 작성하고 소프트웨어를 설치·시험하거나 화면을 확인하면서 오류를 해결하는 작업도 수행한다.

오픈AI 'GPT-6 아스트라' (영상=오픈AI)

아스트라는 전문가용 프로그램까지 직접 다룬다. 오픈AI가 공개한 시연에서는 전자설계 프로그램 '키캐드'로 회로도를 실제 제작 가능한 인쇄회로기판(PCB) 설계로 바꿨다. 블렌더에서 주택을 모델링한 뒤 이를 언리얼 엔진5로 옮겨 이용자가 내부를 이동할 수 있는 3차원 환경도 만들었다.

실제 소프트웨어에서 금융 모델링과 엔지니어링, 미디어 제작 등을 수행하는 '에이전츠 라스트 이그잼'에서는 59.3%를 기록했다. GPT-5.6 솔은 53.6%, 클로드 오푸스 5는 55.5%였다. 운영체제에서 여러 단계의 작업을 수행하는 OS월드 2.0에서도 아스트라는 72.6%로 GPT-5.6 솔의 65.7%를 앞섰으며 작업 시간은 약 75분에서 40분으로 줄었다.

처음 접하는 환경에 적응하는 능력에서도 큰 폭의 변화가 나타났다. 아스트라는 낯선 환경을 탐색해 규칙을 찾아내고 목표를 달성하는 'ARC-AGI-3'에서 오픈AI 평가 기준 99.9%를 기록했다. 'GPT-5.6 솔'은 7.8%였다.

다만 99.9%라는 수치만으로 AGI에 도달했다고 판단하기는 어렵다. 오픈AI는 자사 리스폰스 API 하네스를 사용해 실제 모델 사용 방식에 가까운 조건에서 평가했으며 일부 설정도 조정했다고 밝혔다. 모델의 추론 능력뿐 아니라 이를 실행하는 에이전트 환경의 영향도 반영된 결과다.

오픈AI도 아스트라를 설명하면서 단일 벤치마크 점수보다 실제 업무 수행 능력을 앞세웠다. 사용자가 목표를 제시하면 작업에 필요한 도구를 스스로 활용해 여러 단계의 업무를 수행할 수 있다는 점을 강조한 것이다. 이에 따라 기존 생성형 AI가 질문에 답하거나 업무를 보조하는 역할에 머물렀다면, 아스트라는 복잡한 업무를 직접 맡아 처리하는 범용 에이전트에 한층 가까워졌다는 평가다.

그레그 브록먼 오픈AI 사장은 "AGI의 정의는 사람마다 다르고 경계가 흐릿하다"면서도 "훗날 돌이켜보면 사람들은 지금 이 시점과 이 모델을 AGI의 초기 단계로 여길 수 있다"고 말했다.

과학 난제 풀고 사이버 공격까지…AGI 시대, 통제 부담 커져

과학 분야에서는 AI가 기존 지식을 설명하는 수준에서 연구에 직접 참여하는 단계로 영역을 넓혔다. 아스트라는 고난도 수학 평가인 프런티어매스 티어4에서 97.6%, 대학원 수준 과학 추론 평가인 GPQA 다이아몬드에서 96.0%를 기록했다. 코드와 터미널을 활용해 데이터 분석과 시뮬레이션, 모델 피팅을 수행하는 터미널벤치 사이언스에서는 64.6%로 GPT-5.6 솔의 22.4%를 크게 웃돌았다.

새로운 수학 성과에도 기여했다. 오픈AI에 따르면 아스트라는 10년 넘게 246에 머물렀던 무한히 많은 소수쌍 사이 간격의 상한을 186으로 낮추는 연구에 참여했다. 80년 넘게 개선되지 않았던 큰 소수 간격 관련 경계값의 한 항도 개선했다.

오픈AI가 'GPT-6 아스트라'를 공개했다. (이미지=오픈AI)

능력이 커지면서 위험 관리 필요성도 높아졌다. 아스트라는 오픈AI의 자체 안전 평가 체계인 '프리페어드니스 프레임워크'에서 사이버보안 분야 처음으로 최고 위험 수준인 '크리티컬(심각)' 기준을 충족했다. 적절한 도구와 시스템 접근 권한이 주어질 경우 사람의 단계별 지시 없이 알려지지 않은 취약점을 찾아 공격 방법을 개발할 수 있는 수준인 것이다.

평가 과정에서는 기존에 알려지지 않았던 제로데이 취약점 2개도 발견했다. 이에 오픈AI는 고급 사이버 공격 기능을 일반 이용자에게 그대로 공개하지 않고 방어 목적의 보안 작업을 중심으로 이용 범위를 확대할 계획이다.

오픈AI가 아스트라를 AGI와 연결해 언급했지만 현재 성능만으로 인간 수준의 범용성을 갖췄다고 평가하기에는 이르다. 전문 업무 평가인 '에이전츠 라스트 이그잼' 성공률은 59.3%, 터미널 기반 복합 작업을 평가하는 터미널벤치 4.0은 57.9%, 과학 연구 작업은 64.6%에 머물렀다. 일부 종합 지능과 코딩 평가에서도 클로드 계열 모델보다 낮은 성능을 기록해 복잡한 업무를 안정적으로 맡기기에는 아직 한계가 남아 있다.

관련기사

다만 아스트라의 등장으로 글로벌 AI 경쟁의 기준도 달라질 가능성이 커졌다. 얼마나 많은 질문에 정확히 답하는지를 넘어, 사람이 목표를 주면 여러 소프트웨어와 서비스를 오가며 얼마나 많은 일을 빠르고 안정적으로 끝낼 수 있는지가 새로운 경쟁 기준으로 떠오르고 있는 것이다. 이에 오픈AI와 앤트로픽, 구글 등의 경쟁도 '더 똑똑한 챗봇'에서 실제 일을 대신할 수 있는 범용 AI 에이전트 개발로 빠르게 옮겨갈 것으로 보인다.

브록먼 사장은 "아직 개선해야 할 부분이 많지만 사람들이 AI에 위임할 수 있는 업무의 종류와 AI가 사람들에게 제공할 수 있는 역량에서 진정한 변화가 일어나고 있다"고 말했다.