SK텔레콤이 독자 AI 파운데이션 모델 ‘A.X K2’를 기업과 기관에서 실제 서비스에 보다 쉽게 활용할 수 있도록 경량화와 추론 가속 기술을 잇달아 공개한다. 모델 개방을 넘어 메모리와 속도, 구동 장비 등 AI 운영 부담을 함께 낮추는 것이 핵심이다.
13일 SK텔레콤에 따르면 최근 A.X K2의 메모리 사용량을 줄인 ‘A.X K2 NVFP4’와 답변 생성을 가속하는 ‘A.X K2 EAGLE3’, ‘A.X K2 DSpark’를 허깅페이스에 공개했다.
고사양 단일 장비에서 실행할 수 있는 ‘A.X K2 GGUF’도 선보일 예정이다.
오픈소스 AI 모델은 누구나 내려받을 수 있지만 실제 서비스 적용에는 별도 인프라가 필요하다. 모델이 클수록 메모리와 장비 부담이 커지고 답변 생성 속도도 서비스 운영의 변수가 된다.
이에 따라 SK텔레콤은 이용자가 비용과 속도, 보유 장비 등 환경에 따라 적합한 운영 방식을 선택할 수 있도록 4개 기술을 제공한다.
6880억개 매개변수 유지…필요 메모리 43% 절감
A.X K2 NVFP4는 모델의 매개변수나 구조를 줄이지 않고 구동에 필요한 메모리를 낮춘다. A.X K2는 전체 6880억개 매개변수를 갖추고 질문을 처리할 때 약 330억개가 선택적으로 활성화되는 전문가 혼합(MoE) 구조다.
NVFP4는 매개변수 개수가 아닌 이를 표현하는 숫자의 정밀도를 조정하는 ‘양자화’를 적용했다. 모델이 학습한 지식을 줄이는 대신 숫자 표현에 필요한 저장공간과 계산량을 줄이는 방식이다.
이에 따라 원본 FP8 모델에서 약 646GB였던 최소 필요 메모리가 약 370GB로 감소했다. 원본의 약 57% 수준으로 메모리 요구량이 43%가량 줄었다.
엔비디아 B200 GPU 4개가 탑재된 서버 한 대에서도 모델을 운영할 수 있다. 다만 메모리 절감 비율만큼 모든 환경에서 GPU 수나 비용이 감소하는 것은 아니다. 동시 이용자 수와 입력 문서 길이, 요구 응답 속도 등에 따라 장비 구성은 달라진다.
양자화 이후에도 주요 기능을 지원한다. 복잡한 문제를 단계적으로 검토하는 ‘싱킹 모드’와 빠르게 답하는 ‘넌싱킹 모드’를 요청에 따라 선택할 수 있고 최대 256K 토큰의 긴 문맥도 처리한다.
SK텔레콤은 긴 문장 속 특정 정보를 찾아내는 NIAH 평가에서 양자화 전후 동일한 결과를 확인했다. 다만 특정 장문 검색 평가 결과로 모든 업무에서 답변 품질이 동일하다는 의미는 아니다.
검색과 데이터 조회, 외부 프로그램 실행 등 필요한 도구를 AI가 판단해 호출하는 에이전트 기능도 지원한다. 기업은 자료 검색부터 업무 시스템 연동까지 여러 단계를 수행하는 AI 에이전트 기반으로 활용할 수 있다.
작은 AI가 초안 쓰고 K2가 검증…추론 속도 높인다
답변 생성 속도를 높이는 ‘추측 디코딩’ 기술도 제공한다. 작은 보조 모델이 앞으로 생성할 여러 단어를 미리 예상하면 A.X K2가 이를 한꺼번에 검증하는 방식이다.
A.X K2 EAGLE3는 약 30억개 매개변수의 소형 보조 모델이 A.X K2의 중간 계산 결과를 참고해 다음 단어들을 미리 제안한다. 보조 모델은 A.X K2 전체 규모의 1% 미만으로, 기존 운영 환경에 추가해 사용할 수 있다. 제안된 단어는 A.X K2가 최종 검증하기 때문에 본 모델의 지식이나 답변 방식을 바꾸지 않고 생성 과정만 효율화한다.
A.X K2 DSpark도 추론을 가속하는데, 작동 방식은 다르다. EAGLE3가 앞선 단어를 바탕으로 초안을 이어간다면 DSpark는 여러 위치의 단어 후보를 병렬로 예측한 뒤 단어 간 관계를 확인하고 A.X K2가 최종 검증한다.
두 방식의 효율은 답변 길이와 동시 이용자 수, 수학 코딩 일반대화 등 업무 유형에 따라 달라질 수 있다. SK텔레콤은 기업과 기관이 자체 환경에 맞는 기술을 시험해 선택할 수 있도록 두 방식을 함께 제공한다.
수백GB 메모리 갖춘 단일 장비용 GGUF도 제공
A.X K2를 실행할 수 있는 장비의 범위를 넓히기 위한 GGUF 형식도 준비했다. GGUF는 대규모 AI 모델을 단일 장비에서 실행하는 데 활용되는 파일 형식이다.
A.X K2 GGUF는 약 345GiB(약 370GB) 규모로 충분한 시스템 메모리를 갖춘 고사양 워크스테이션이나 서버 한 대에서 실행 환경을 구성할 수 있다. 여러 GPU 서버를 연결한 대규모 클러스터 없이도 모델을 시험하거나 제한적으로 운영할 수 있는 선택지를 제공한다.
다만 일반 PC나 노트북에서 구동할 수 있다는 의미는 아니다. 모델 자체가 수백GB 규모여서 충분한 메모리와 저장공간을 갖춘 워크스테이션급 이상의 장비가 필요하다.
SK텔레콤이 제시한 4가지 기술은 각각 운영 과정의 다른 부담을 겨냥한다. NVFP4는 메모리를 줄이고 EAGLE3와 DSpark는 답변 생성을 가속하며 GGUF는 실행 가능한 장비와 소프트웨어의 선택 폭을 넓힌다. 이용자는 비용과 응답 속도, 기존 장비 활용 여부에 따라 운영 방식을 선택할 수 있다.
관련기사
- SKT 독자 AI 모델 'A.X K2' 수학도 잘한다..."올림피아드 금메달 수준"2026.08.11
- "추론하며 스스로 학습하는 AI…SKT 'A.X K2' 경쟁력 키운다"2026.08.06
- KG스틸, SKT 독자 AI모델로 설비 오류 대응 30% 줄였다2026.08.06
- "제조부터 국방까지"…SKT, '일하는 AI' 확산 시동2026.08.04
A.X K2와 관련 최적화 모델은 연구와 상업적 활용이 가능한 아파치 2.0 라이선스로 공개된다. 기업과 개발자는 모델을 자체 서비스에 적용하거나 산업 업무에 맞춰 추가 학습할 수 있다.
SK텔레콤은 앞서 A.X K1에도 양자화를 적용해 제한된 인프라와 폐쇄망에서 활용할 수 있는 국방용 모델을 개발했다. A.X K2 최적화 기술 공개를 통해 스타트업과 대학, 공공기관, 기업 등이 독자 AI 모델을 직접 운영 응용할 수 있는 기반을 확대한다는 계획이다.











