[최홍석 칼럼] AI 에이전트가 달리려면 어떤 도로가 필요한가

NPU·AI 그리드 시대, 통신사가 지금 설계해야 할 AI 추론 인프라 네트워크

전문가 칼럼입력 :2026/09/04 11:18    수정: 2026/09/04 12:03

최홍석 E&B 정보통신 기술전략 상무

"AI 추론은 '빠른 망'이 아니라 '예측 가능한 망'을 원한다. 지연이 작은 것보다 지연이 일정한 것이 AI 에이전트 서비스의 품질을 결정한다."

이 시리즈는 지금까지 망을 어떻게 만드는가, 즉 인프라의 언어로 이야기해 왔습니다. 4월 OpenROADM, 5월 SRv6·RON, 6월 소버린 AI, 7월 자율화 거점, 8월 6G 설계 철학, 이 모든 논의가 궁극적으로 수렴하는 질문이 바로 이것입니다. 그 망 위에서 무엇이 달리는가.

최홍석 E&B 정보통신 기술전략 상무

2026년, AI 에이전트 서비스가 본격화되면서 네트워크에 완전히 새로운 요구사항이 생겼습니다. 챗봇이 아닙니다. 스스로 계획하고, 도구를 호출하고, 결과를 판단해 다음 행동을 결정하는 에이전틱 AI가 실시간으로 서비스되기 시작했습니다. 이 에이전트들이 달리려면 지금까지와는 다른 종류의 도로가 필요합니다. 그 도로를 누가 깔 것인가, 통신사의 가장 현실적인 기회이자 도전이 여기 있습니다.

AI 추론 트래픽은 기존 데이터와 무엇이 다른가

AI 에이전트 서비스가 네트워크에 요구하는 것은 단순한 대역폭 확대가 아닙니다. 트래픽의 성격 자체가 다릅니다. 세 가지 핵심 차이가 있습니다.

첫째, 예측 가능한 지연과 지터입니다. 음성 AI 에이전트처럼 대화형 서비스는 응답이 약 500ms를 넘으면 지연감을 줄 수 있어, 클라이언트 기준 time-to-first-token(TTFT)을 중요한 SLO로 둡니다. 원격 제어·협력 제어와 같은 안전 중요 서비스는 지연과 지터가 안전성에 영향을 줄 수 있으므로, 안전 기능을 원격망 품질에만 의존하지 않고 로컬 폐루프·이중화와 함께 설계해야 합니다. 일반 인터넷 트래픽은 평균 지연만으로도 충분한 경우가 많지만, 실시간 AI 서비스는 워크로드별로 P99 등 꼬리 지연 목표를 관리해야 합니다.

둘째, 버스트성(Burstiness)입니다. AI 에이전트 서비스는 동시 요청이 순간적으로 폭증하는 특성을 가집니다. 중앙 집중식 추론 클러스터는 이 버스트 구간에서 처리 용량이 포화되고, 지연이 급격히 증가합니다. 컴캐스트와 엔비디아의 GTC 2026 벤치마크는 이를 명확히 보여줍니다. 버스트 트래픽 조건(P99)에서 단일 중앙 집중식 클러스터는 오히려 처리량이 감소한 반면, 4개 엣지 사이트에 분산된 AI 그리드는 42,362 토큰/초 처리량을 유지했습니다.

셋째, 멀티-티어 분산 처리입니다. 일부 에이전틱 AI 서비스는 단일 모델만으로 처리되지 않으며, 디바이스·엣지·코어의 서로 다른 모델과 도구가 협력할 수 있습니다. 디바이스에서 경량 추론, 엣지에서 도메인 특화 모델, 코어에서 대형 모델을 선택적으로 활용하는 구조입니다. 다만 일반적인 에이전트 서비스가 계층 간 마이크로초 단위 동기화를 요구하는 것은 아니며, 엄격한 시간 동기는 TSN 기반 산업 제어 등 특정 워크로드의 요구사항입니다.

NPU 서버와 AI Grid — 추론 인프라의 새 지형

NPU 서버란 무엇인가

GPU가 병렬 연산에 폭넓게 활용되는 반면, NPU(Neural Processing Unit)는 신경망 연산에 특화된 가속기입니다. 일부 추론 워크로드에서는 NPU가 GPU보다 전력 효율이나 비용 측면에서 이점을 낼 수 있지만, 실제 성능은 모델 구조·정밀도·메모리 구성·배치 크기·소프트웨어 생태계에 따라 달라집니다. CPU가 시스템 운용·데이터 처리를 맡고 NPU 또는 GPU가 AI 연산을 가속하는 이종 컴퓨팅 구조가 일반적입니다.

AI Grid — 분산 추론 인프라

엔비디아는 GTC 2026에서 AI 그리드 레퍼런스 아키텍처를 발표했습니다. 핵심은 지역 PoP, 중앙국, 메트로 허브와 엣지 거점에 가속 컴퓨팅을 배치해 지리적으로 분산된 AI 추론 플랫폼을 구성하는 것입니다. 약 10만 개라는 수치는 개별 텔코의 자산이 아니라 전 세계 통신사와 분산 클라우드 사업자가 운영하는 분산 네트워크 데이터센터의 합산 추정치입니다. 기지국은 모든 곳에 추론 서버를 두기보다, 전력·냉각·경제성을 검토해 선택적으로 활용할 수 있는 미래 배치점으로 보는 편이 정확합니다.

한 가지 구현 방식은 코어 AI 팩토리, 지역 엣지 노드, 그리고 선택적 AI-RAN 거점으로 역할을 나누는 것입니다. 코어에서는 대형 모델 학습·파인튜닝과 광역 서비스가, 지역 엣지에서는 지연·데이터 주권·대역폭 요구가 높은 추론이 수행될 수 있습니다. AI-RAN은 RAN과 AI 워크로드의 컴퓨팅 자원 공유를 검증하는 단계이며, 모든 기지국이 사용자 추론을 처리한다는 뜻은 아닙니다. 사용자와 데이터에 가까운 곳에서 처리하면 왕복 구간을 줄일 수 있지만, 종단간 지연은 무선·전송·큐잉·모델 처리 시간을 함께 고려해야 합니다.

통신사가 설계해야 할 네 가지 네트워크 요건

AI 그리드가 제 성능을 발휘하려면 그것을 연결하는 네트워크가 AI 추론 트래픽의 특성을 수용할 수 있어야 합니다. 4개의 구체적 요건이 있습니다.

① SRv6 기반 결정론적 경로 제어

일반 IP 망에서는 혼잡이나 장애에 따라 경로와 지연이 변동할 수 있습니다. SRv6의 SR Policy는 소스에서 명시 경로를 지정하는 기반이 되어, 지연 민감 트래픽의 경로 변동을 줄이는 데 활용할 수 있습니다. 다만 SRv6만으로 결정론적 레이턴시가 보장되지는 않습니다. 보장형 지연을 위해서는 용량 설계, 자원 예약, 입장 제어, 큐잉·스케줄링과 필요 시 DetNet·TSN 같은 메커니즘을 함께 적용해야 합니다. 따라서 SRv6 단일 패브릭은 AI Grid 연결의 유용한 기반이지만, 그 자체가 충분조건은 아닙니다.

② 5G 네트워크 슬라이싱...AI 추론 전용 슬라이스

AI 추론·일반 데이터·IoT 센서 데이터는 서로 다른 QoS 요건을 가질 수 있습니다. 5G 네트워크 슬라이싱은 하나의 물리 인프라 위에서 용도별 논리 네트워크와 정책을 구성하는 기능이며, 실제 보장 범위는 RAN·전송·코어·애플리케이션을 포함한 종단간 설계와 SLA에 좌우됩니다. 노키아와 AWS는 MWC 2026에서 AI가 네트워크 KPI와 상황 정보를 바탕으로 슬라이싱 정책을 조정하고, SMO를 통해 RAN 정책을 적용하는 인텐트 기반 사례를 발표했습니다. 이는 기업 AI가 표준 API로 슬라이스를 직접 협상한 상용 구조라기보다, 자동화된 정책 운영을 향한 실증 사례로 보는 것이 적절합니다.

③ 엣지 UPF 분산 배치

5G 코어의 UPF(User Plane Function)를 엣지 가까이 분산 배치하면 사용자 트래픽을 중앙 코어까지 보내지 않고 인접한 서비스 거점으로 분기할 수 있습니다. 다만 UPF가 AI 추론을 직접 수행하는 것은 아닙니다. UPF는 로컬 브레이크아웃을 제공하고, 인접한 MEC 또는 AI 서버가 추론을 수행하는 구조가 일반적입니다. 지연 개선 효과는 배치 위치·무선 구간·전송망·모델 처리 시간에 따라 달라지며, sub-15ms와 같은 목표는 특정 서비스와 측정 범위를 명시해 검증해야 합니다.

④ gNMI 기반 실시간 레이턴시 가시성

AI 그리드에서는 네트워크 지연·손실·혼잡뿐 아니라 추론 지연, 처리량, 큐 깊이, 가속기 사용률 같은 애플리케이션·플랫폼 지표를 함께 관측하고, 오케스트레이터가 이를 바탕으로 요청을 적절한 노드에 배치하는 구조가 필요합니다. gNMI 스트리밍 텔레메트리는 네트워크 장비 상태를 수집하는 유용한 인터페이스이지만, 추론 성능 관측이나 동적 라우팅 전체를 대신하지는 않습니다. 애플리케이션 관측성, 용량 관리, 정책·트래픽 제어와 결합해야 합니다. 아카마이는 요청을 적절한 컴퓨팅 계층에 매칭해 비용과 레이턴시를 함께 최적화하는 접근을 제시했습니다.

글로벌 Telco의 실제 구현 사례

컴캐스트 × 엔비디아...AI 그리드 레퍼런스 검증 (2026.03)

컴캐스트는 엔비디아와 함께 깊은 분산 네트워크 아키텍처를 AI 그리드로 활용하는 협업을 발표했습니다. 엔비디아가 공개한 벤치마크에서 퍼스널l AI의 음성 소형 언어 모델을 RTX PRO 6000 GPU 기반의 4개 사이트 AI Grid에 분산 배치했을 때, 상관된 버스트 트래픽에서도 음성 상호작용의 종단간 지연을 500ms 목표 안에서 유지했습니다.

같은 시험 조건에서 중앙집중형 구성과 비교한 토큰당 비용 절감은 버스트 시 76.1%였습니다. 이는 특정 모델·하드웨어·트래픽 조건의 결과이며 일반적 비용 절감률로 해석해서는 안 됩니다.

SKT × Arm × 리벨리온...국산 NPU 기반 AI 추론 인프라 (2026.04)

SKT는 Arm·리벨리온과 3자 협약을 통해 Arm AGI CPU와 리벨리온 RebelCard NPU를 결합한 AI 추론 서버를 공동 개발하고, 자사 AI 데이터센터에서 성능·안정성을 실증하기로 했습니다. A.X K1 모델의 운영도 검토 대상이며, 현 시점에서는 상용 도입 완료가 아니라 개발·검증 단계로 표현하는 것이 정확합니다. SKT는 별도의 GPU 기반 AI 인프라 협력도 추진하고 있어, 향후 NPU와 GPU를 워크로드별로 병행 활용할 가능성이 있습니다.

AT&T × 시스코 × 엔비디아...제로-트러스트 AI 추론 아키텍처 (2026.03)

AT&T와 시스코는 달라스 디스커버리 디스트릭트에서 엔비디아 GPU와 시스코의 파일럿 플랫폼을 활용한 공개안전 사용사례를 시연했습니다. 이 협력은 전용 IoT 코어, 로컬 트래픽 분기, 엣지 컴퓨팅과 제로-트러스트 보안을 결합해 실시간 AI를 네트워크 가까이 제공하려는 접근입니다. 다만 이는 상용 전면 배치라기보다 시연·파일럿과 산업 적용 확대 단계로 보는 것이 정확합니다.

인도삿 × 노키아 × 엔비디아...소버린 AI 그리드 (2026.06)

Indosat Ooredoo Hutchison는 2026년 3월 MWC에서 노키아·엔비디아와 함께 동남아시아 최초의 AI-RAN 기반 레이어3 5G 통화를 실증했습니다. 노키아 에어스케일 무선 장비와 RAN 소프트웨어가 엔비디아 GPU 가속 인프라 위에서 동작하며, AI와 RAN 워크로드를 동일한 컴퓨팅 자원에서 동시에 처리할 수 있음을 기능적으로 검증한 사례입니다. 이후 인도네시아 현장 시험과 망 현대화는 추진 단계이므로, AI 그리드와 AI-RAN의 전국 상용 구현 완료로 단정하지 않는 것이 적절합니다.

한국 통신사의 실행 과제...지금 무엇을 결정해야 하는가

영국 리서치 컨설팅 회사인 Analysys Mason에 따르면 통신사의 GPUaaS 수익은 2024년 1억 달러 미만에서 2030년 96억 달러로 성장할 전망이며, 전 세계 약 30개 사업자가 이미 GPUaaS를 출시했습니다. 다만 맥킨지의 잠재 시장 규모와 Analysys Mason의 Telco 수익 전망은 대상 범위와 산정 방법이 달라 이를 단순 점유율로 비교하기에는 한계가 있습니다. 핵심 메시지는 기회가 존재하되, 통신사가 하이퍼스케일러·네오클라우드와 직접 규모 경쟁하기보다 데이터 주권, 연결성, 지역 엣지, 산업별 통합 서비스처럼 차별화 가능한 영역을 선택해야 한다는 점입니다. 국내 통신사의 현실적 준비 순서는 다음과 같습니다.

결론 : 망이 추론 인프라가 되는 시대, 도로를 먼저 깔아야 한다

AI 에이전트 서비스에는 단순히 빠른 망보다 워크로드별로 예측 가능한 종단간 성능, 관측성, 보안과 비용 효율이 중요합니다. 이 시리즈가 다룬 SRv6 단일 패브릭, OpenROADM 개방 광전송, TM Forum L4 자율화 거점은 이러한 AI 추론 인프라의 기반이 될 수 있습니다. 다만 각각은 충분조건이 아니라, 컴퓨팅·오케스트레이션·보안·운영 설계와 결합돼야 합니다.

엔비디아의 AI 그리드 레퍼런스 설계, SKT의 NPU 기반 추론 서버 개발, 인도삿의 소버린 AI와 AI-RAN 추진은 통신사가 분산 추론 인프라의 유력한 제공자가 될 수 있음을 보여 줍니다. 그러나 CDN·분산 클라우드·엔터프라이즈 엣지 사업자도 경쟁과 협력의 대상입니다. 통신사의 강점은 광범위한 접속망과 지역 거점, QoS·보안·운영 역량을 결합해 특정 산업과 지역에 차별화된 서비스를 제공하는 데 있습니다.

관련기사

"AI 에이전트 시대에 통신사의 역할은 단순한 전송 제공을 넘어, 연결성과 분산 컴퓨팅을 결합한 서비스 운영자로 확장될 수 있습니다. 다만 이 역할은 단독 소유권이 아니라 클라우드·CDN·장비·애플리케이션 사업자와의 생태계 경쟁 및 협력 속에서 형성될 것입니다."

도로가 없으면 어떤 차도 달릴 수 없습니다. AI 에이전트 서비스의 시대에 그 도로를 먼저 깔기 시작하는 통신사가, 다음 10년의 AI 인프라 패권을 가져갑니다.

*본 칼럼 내용은 본지 편집방향과 다를 수 있습니다.

최홍석 E&B 정보통신 기술전략 상무

25년간 국내외 통신 장비 제조사 SI 기업에서 광전송 및 IP 네트워크 솔루션 사업을 담당해 왔다. 국내 3대 통신사와 대형 엔터프라이즈 시장에서 최적의 네트워크 아키텍처를 설계한 '올라운드 플레이어'로 평가 받는다. 현재는 E&B 정보통신에서 차세대 광전송 전략을 담당하고 있다.