[AI 고속도로] AI 시대 다시 뜨는 '쿠버네티스'…GPU·서비스 운영 핵심으로

GPU 자원 배분부터 AI 모델 추론까지…AI 네이티브 플랫폼 기반으로 부상

컴퓨팅입력 :2026/09/23 10:43

생성형 인공지능(AI) 확산으로 기업들이 대규모 그래픽처리장치(GPU)를 확보하면서 이를 효율적으로 나누고 관리하는 기술의 중요성이 커지고 있다. 클라우드 시대 수많은 애플리케이션을 관리하는 표준으로 자리 잡았던 '쿠버네티스'가 이제는 GPU부터 AI 모델의 학습·추론까지 관리하는 AI 인프라의 핵심 플랫폼으로 영역을 넓히는 모습이다.

23일 업계에 따르면 글로벌 클라우드 기업과 국내 플랫폼 기업들은 쿠버네티스를 기반으로 AI 인프라와 서비스를 운영하기 위한 기술 개발을 확대 중이다.

클라우드네이티브컴퓨팅재단(CNCF)이 올해 발표한 연례 조사에 따르면 생성형 AI 모델을 운영하는 조직 가운데 66%가 일부 또는 전체 추론 워크로드를 쿠버네티스에서 운영하는 것으로 나타났다.

오픈소스 쿠버네티스가 AI 시대를 맞아 다시 주목받고 있다. (사진=클립아트코리아)

컨테이너 관리하던 쿠버네티스…이젠 GPU까지

쿠버네티스는 수많은 서버와 그 안에서 실행되는 프로그램을 알아서 배치하고 관리해주는 오픈소스 플랫폼이다. 과거에는 단일 서버에 애플리케이션을 직접 설치했다면 클라우드 환경에선 프로그램과 실행에 필요한 요소를 '컨테이너'라는 작은 단위로 묶어 여러 서버에 나눠 실행한다.

쿠버네티스는 이 컨테이너를 어느 서버에서 실행할지 정하고 이용자가 몰리면 수를 늘리거나 장애가 발생하면 다른 곳에서 다시 실행하는 작업을 자동으로 수행한다.

AI 시대에는 쿠버네티스가 관리해야 할 대상이 한층 넓어졌다. 과거에는 중앙처리장치(CPU)와 메모리를 중심으로 애플리케이션을 배치했다면, 이제는 가격이 비싼 GPU와 신경망처리장치(NPU) 등 다양한 AI 가속기를 여러 개발팀과 서비스가 효율적으로 나눠 사용하도록 해야 한다.

이에 최신 버전 쿠버네티스는 동적 자원 할당(DRA) 기능이 도입돼 GPU와 같은 하드웨어의 특성을 파악하고 필요한 작업에 자원을 보다 세밀하게 배분하는 방향으로 발전하고 있다.

AI 모델을 실제 서비스에 적용하는 추론에서도 역할이 커지고 있다. 이용자가 AI에 질문하면 적합한 GPU가 있는 서버를 찾아 요청을 보내고 이용량이 급증하면 자원을 늘리는 방식이다.

글로벌 빅테크부터 국내 기업까지 활용 확산

대표적으로 구글클라우드는 구글 쿠버네티스 엔진(GKE)에서 GPU를 이용해 대규모언어모델(LLM)을 배포·서비스할 수 있도록 지원하고 있다. 최근에는 여러 지역에 흩어진 GPU와 자사 텐서처리장치(TPU) 클러스터를 하나의 자원처럼 활용해 AI 요청을 적절한 곳으로 보내는 기술도 확대 중이다.

국내에서도 쿠버네티스를 기반으로 AI와 클라우드 플랫폼을 고도화하려는 움직임이 이어지고 있다. 오케스트로는 쿠버네티스 기반 서비스형 플랫폼(PaaS) '비올라'를 통해 컨테이너 워크로드의 배포부터 운영까지 생애주기를 관리하고 멀티 클러스터와 데브옵스 환경을 지원하고 있다.

이노그리드 역시 쿠버네티스 기반 'SE클라우드잇'을 통해 여러 쿠버네티스 클러스터를 통합 관리하고 있으며 GPU·NPU·CPU 등 이기종 자원을 AI 워크로드에 활용하는 방향으로 사업 영역을 넓히고 있다.

나무에이엑스는 쿠버네티스를 AI 모델 추론까지 연결 중이다. 자체 AI 플랫폼에서 vLLM과 쿠버네티스 기반 분산 추론 기술 등을 활용해 여러 GPU에서 AI 추론 작업을 분산 처리하는 방식이다. 멀티·하이브리드 클라우드 관리 플랫폼 '스페로'에도 GPU 사용량과 정책, 스케줄링을 관리하는 기능을 적용해 AI 워크로드 운영 효율을 높이고 있다.

맨텍솔루션은 쿠버네티스의 활용 영역을 데이터센터 밖 엣지까지 확대 중이다. 자체 쿠버네티스 플랫폼 '아코디언 엣지'를 통해 중앙 클라우드에서 개발한 AI 모델을 공장 등 여러 현장에 배포하고 각 현장에서 독립적으로 추론 서비스를 운영할 수 있도록 지원하고 있다.

GPU·모델·데이터 연결…AI 네이티브 플랫폼으로 진화

AI 시대에는 고가의 GPU를 비롯한 컴퓨팅 자원을 효율적으로 운영하는 것이 비용 경쟁력과 직결된다. 이에 쿠버네티스를 기반으로 GPU 자원 관리와 모델 배포·추론, 데이터 연계 등을 통합하는 AI 네이티브 플랫폼의 중요성도 커지고 있다. 기존 PaaS가 애플리케이션의 개발·배포를 지원했다면 AI 시대에는 관리 영역이 AI 인프라와 서비스 전반으로 넓어지는 셈이다.

관련기사

한국인공지능클라우드산업협회(KACI)도 최근 기존 PaaS 지원분과위원회를 AI 네이티브 플랫폼(ANP) 분과위원회로 개편하고 관련 생태계 확대에 나섰다. 기존 클라우드 네이티브 기술을 AI 환경으로 확장하고 국내 플랫폼 기업의 기술 고도화와 금융·제조·공공 등 산업별 적용 사례를 확대한다는 목표다.

정철 KACI ANP 분과위원회 위원장은 "쿠버네티스처럼 개방형 표준을 기반 기술로 활용하면 특정 클라우드나 AI 모델에 종속되지 않고 필요에 따라 인프라와 서비스를 바꿀 수 있다"며 "AI 시대에는 GPU와 모델을 확보하는 것뿐 아니라 이를 효율적으로 나누고 배분해 실제 기업 서비스로 연결하는 플랫폼의 역할이 더욱 중요해질 것"이라고 밝혔다.