GPT-5.6 14배 빨라졌다…오픈AI '울트라패스트'의 정체

컴퓨팅입력 :2026/08/14 19:49

오픈AI(OpenAI)가 자사 최상위 모델을 기존보다 최대 14배 빠르게 구동하는 새 서비스 등급 '울트라패스트(Ultrafast)'를 공개했다. 테크크런치(TechCrunch)에 따르면 오픈AI는 8월 13일 이 기능을 API에 우선 도입한다고 밝혔으며, 대상 모델은 최신 GPT-5.6 솔(GPT-5.6 Sol)이다.

울트라패스트는 초당 최대 750개의 토큰을 생성한다. 표준 처리 방식과 비교해 최대 14배 빠른 속도지만, 지능 수준은 표준 버전과 똑같이 유지된다는 것이 오픈AI의 설명이다. 표준 등급과 나란히 제공되는 새로운 서비스 계층으로, 지연 시간을 크게 줄이면서도 GPT-5.6 솔의 완전한 지능을 그대로 활용할 수 있다는 점이 특징이다.

속도의 비결은 반도체 기업 세레브라스(Cerebras)의 웨이퍼 스케일 엔진(Wafer-Scale Engine)이다. 세레브라스에 따르면 이 칩은 44GB에 달하는 SRAM을 칩 위에 직접 올려 모델 가중치를 저장한다. GPU 기반 추론이 칩 안팎의 저장장치를 오가며 겪는 메모리 대역폭 병목을 없앤 것이 핵심이다. 프런티어 모델의 추론 속도를 옥죄던 하드웨어 한계를 정면으로 우회한 셈이다.

오픈AI는 음성, 고객 지원, 커머스, 개발자 에이전트, 금융 리서치, 보안 대응처럼 촌각을 다투는 실시간 작업을 주된 활용처로 꼽았다. 응답 속도가 조금만 개선돼도 곧바로 실제 서비스에 투입할 수 있는 영역이다. 특히 여러 단계를 잇달아 처리하는 에이전트 작업에서는 단계마다 쌓이는 지연이 큰 부담이었던 만큼, 속도 개선의 체감 효과가 클 것으로 보인다.

실제 성능도 뒷받침됐다. 경제적 가치가 높은 지식 노동을 평가하는 GDP-Val 벤치마크에서 울트라패스트는 품질 저하 없이 5.6배의 종단 간 속도 향상을 기록했다. 서비스는 우선 일부 고객을 대상으로 한 제한적 프리뷰로 제공되며, 오픈AI API에서 가장 먼저 선보인다.

세레브라스에 따르면 울트라패스트는 가장 똑똑한 모델을 매 순간이 중요한 제품과 워크플로에 그대로 가져다주는 것을 목표로 한다. 표준 등급 서비스는 종전대로 유지되며, 사용자는 작업 성격에 맞춰 속도와 비용을 저울질해 등급을 고를 수 있다. 실시간 응답이 곧 경쟁력인 음성 비서나 고객 상담, 금융 리서치 같은 분야에서 특히 파급력이 클 것으로 예상된다.

자세한 내용은 테크크런치에서 확인할 수 있다.

이미지 출처: AI 생성 이미지

관련기사

■ 이 기사는 AI 전문 매체 ‘AI 매터스’와 제휴를 통해 제공됩니다. 기사는 클로드 3.5 소네트와 챗GPT를 활용해 작성되었습니다. (☞ 기사 원문 바로가기)