지난 16일 중국 문샷AI가 초거대 인공지능 모델 '키미 K3'를 공개했다. 총 2조8000억개 파라미터의 전문가혼합(MoE) 구조에 100만 토큰 컨텍스트, 상시 추론 모드까지 갖춘 역대 최대 오픈웨이트(가중치) 모델이다.
수요가 폭주해 신규 구독이 일시 중단됐고, 반도체주에는 매도세가 번졌으며, 미국 정가에서는 중국 오픈소스 모델 사용 논쟁이 재점화됐다. 언론은 어김없이 '제2의 딥시크 쇼크'라는 제목을 뽑았다.
필자는 이 진단이 절반만 맞다고 본다. 그리고 어느 절반이 맞고 어느 절반이 틀렸는지 가려내는 일이야말로 지금 한국 기업과 정책 당국에 가장 필요한 작업이라고 본다. 헤드라인에 휘둘린 과대평가도, 반사적 폄하에 기댄 과소평가도 모두 잘못된 의사결정으로 이어지기 때문이다.
우선 두 쇼크는 성격이 다르다. 지난해 1월 딥시크가 깬 것은 '학습 비용'의 거품이었다. 강화학습 중심의 접근과 MoE 구조로 자본과 GPU의 장벽을 무력화할 수 있음을 보여줬고, 엔비디아 시가총액이 하루 만에 6000억달러 가까이 증발하는 초유의 사태로 이어졌다. 반면 K3가 깬 것은 '체급의 희소성'이다. 그러니까 더이상 폐쇄형 프론티어 모델만 큰 모델이 아니라는 것이다. 딥시크 최신 초거대 모델보다 75%가량 큰 2조8000억 파라미터를 오픈웨이트로 풀어냈다고 선언한 것이다.
딥시크가 "이렇게 싸게 만들 수 있다"를 증명했다면, K3는 "이렇게 큰 것도 풀 수 있다"를 입증한 셈이다. 알리바바의 Qwen(큐원,通义千问)도 2조4000억 파라미터급 모델을 준비 중이라고 한다. 스케일 경쟁이 끝나기는커녕 중국도 체급을 계속 키운다는 뜻이고, HBM을 비롯한 반도체 수요가 꺾일 이유도 없다고 본다.
두 쇼크에는 공통점이 있다. 어느 쪽도 미국 최상위 모델의 '지능 상한선'을 역전하지는 못했다는 점이다. K3의 경우 문샷 스스로가 클로드 Fable 5와 GPT-5.6에는 전체 성능이 못 미친다고 인정했다. 독립 평가기관 아티피셜 애널리시스는 K3에 지능지수 57점을 부여해 189개 모델 중 4위에 올렸다. 비교군 평균이 31점이니 압도적 상위권으로, 미국 최상위 계열 바로 뒤, 그 아래 체급보다는 앞이다.
그러니까, "중국은 아직 멀었다"도 "미국은 끝났다"도 사실이 아니다. 최고 성능은 여전히 미국에 있으나 격차는 반보로 좁혀졌고, 그 반보의 차이에서 K3 가격이 3분의 1 수준이라는 점이 이 논쟁의 진짜 핵심이다.
K3를 좀더 해부해 보자. 긴 컨텍스트 처리 효율을 높이는 KDA, 일관된 스케일링 이득을 준다는 어텐션 레지듀얼 등 핵심 기법은 발표 전에 공개 논문으로 먼저 풀렸다. 딥시크가 MLA를 논문으로 먼저 공개했던 것과 같은 패턴으로, 알고리즘 연구를 생태계 영향력의 지렛대로 쓰는 중국 랩들의 일관된 전략이다.
K3의 MoE 구조는 896개 전문가 중 토큰당 16개만 활성화하는 극단적 희소성으로, 2조8000억이라는 숫자는 전체 파라미터일 뿐 토큰당 실제 가동되는 지능의 크기가 아니다. 정작 활성 파라미터 수는 공개하지 않았다. 초거대 모델의 위압감과 실제 추론 깊이는 별개의 문제라는 뜻이다. 반면 가격 설계는 철저히 보급을 겨냥했다. 입력 100만 토큰당 3달러, 출력 15달러에 기존 API와 호환돼 갈아타기 비용까지 낮췄고, 소비자용으로는 무료 티어부터 깔아놨다.
출시 후 쏟아진 실사용 평가를 종합하면 K3의 정체성은 실시간 보조 도구라기 보다는 '장시간 가동형 중장비 에이전트’로 봐야 할 듯하다. GPU 커널을 스스로 재작성하고 테스트하는 24시간 자율 루프, 48시간 만의 소형 칩 설계와 타이밍 검증, 인간 개발자들 투표로 검증된 프런트엔드 코딩 1위 등 강점은 분명하다. 논문 20여편을 교차 검증하고 파이썬 코드 3000여줄을 작성해 계산천체물리학의 난제급 관계식을 두 시간 만에 재현했다는 발표도 있었다. 지식노동에서도 밤새 돌려놓는 자율 에이전트로서의 잠재력은 상당하다는 얘기다.
당연히 약점도 있다. 생성 속도는 초당 62토큰으로 189개 모델 중 91위에 그쳐, 실시간으로 주고받는 코딩이나 즉답형 업무에는 답답하다는 평가가 많다. 심층 소프트웨어 엔지니어링과 대학원급 과학 추론에서 미국 최상위 계열에 뒤진다는 점은 문샷 자체 발표에도 나온다.
좀 심각한 것은 '과잉 사고'다. 아티피셜 애널리시스가 지능지수 평가를 완주시키는 데 K3는 1억3000만 출력 토큰을 소모했다. 비교군 평균 6300만의 두 배다. 표면 단가는 절반인데 토큰을 두 배 쓰니 청구서에서 가격 우위가 사라진다. 토큰당 단가가 아니라 '수용된 결과물당 비용'으로 계산해야 한다는, 필자가 줄곧 강조해온 AI 경제학의 기본이 여기서도 확인된다.
정작 위험한 것은 국내에 퍼지는 통념이다. “프론티어급 성능이 공짜로 풀렸으니 내려받아 사내 서버에 올리면 게임 끝"이라는 기대에는 네 가지 착시가 겹쳐져 있다.
첫째, 다운로드는 서비스가 아니다. 2조8000억 파라미터 모델은 무압축 기준 가중치만 약 2.8테라바이트의 GPU 메모리를 요구한다. 최상급 GPU 수십 장을 초고속으로 묶어야 간신히 로딩이 시작되는 체급이다. 결국 대부분의 조직은 4비트 이하로 양자화해 올리게 되는데, 이 압축 과정에서 가장 먼저 손상되는 것이 하필 복잡한 다단계 추론 능력이다. 개인 PC에서 도는 소형 증류 버전이 원본과 사실상 다른 물건이라는 점은 딥시크 때 이미 배운 교훈이다.
둘째, 이 글을 쓰는 현재까지 K3의 가중치는 공개되지도 않았다. 약속된 공개일은 오는 27일이다. 실물이 등장하기도 전에 '세계 최대 오픈웨이트'라는 헤드라인이 선판매되고 있는 셈이다.
셋째, 오픈웨이트는 오픈소스가 아니다. 공개되는 것은 가중치라는 '결과물'뿐, 어떤 데이터를 썼는지, 강화학습 보상 모델과 정렬 레시피가 무엇인지는 철저히 닫혀 있다. 재현도 감사도 불가능한 공개이며, 기술 이전이 아니라 무료 가중치에 익숙해진 전 세계 개발자 생태계를 자국 API와 툴체인 위에 쌓으려는 표준 선점 전략에 가깝다.
넷째, 온프레미스에 올리면 안전하다는 믿음도 순진하다. 닫힌 가중치 안에 무엇이 각인돼 있는지 검증할 수단이 마땅치 않다. 학습 단계에서 주입된 검열 정렬은 사내망으로 가져와도 그대로 작동하고, 특정 트리거에 반응하는 행동이 숨어 있는지 전수 검사하는 것은 현재 기술로 대단히 어렵다. 보안 과제는 '어디에 두느냐'가 아니라 '무엇이 들어 있는지 어떻게 확인하느냐'의 문제다.
필자가 가장 강조하고 싶은 대목은 따로 있다. 가중치를 내려받는 것은 굳이 비유를 하자면, F1 머신의 엔진만 인도받는 것과 같다. 차체와 변속기, 공기역학 패키지, 피트크루의 정비 역량을 결합해야 우승하는 차가 되듯, 프론티어 AI 빅테크들이 파는 것은 엔진(모델)이 아니라 완성차(토털 서비스)다.
정교하게 조율된 시스템 프롬프트와 전후처리, 인퍼런스 엔진 최적화, 컨텍스트 압축과 검색 오케스트레이션, 도구 호출을 제어하는 에이전트 하네스까지, 엔진을 감싼 나머지 전부가 '서빙 레이어'다.
문샷의 벤치마크 표 각주를 읽어보면 평가 행마다 실행 환경이 다른 것을 알 수 있다. 같은 가중치라도 어떤 하네스에 얹느냐에 따라 점수가 달라진다는 사실을 발표 자료에서 스스로 자인한 셈이다. 100만 토큰 컨텍스트를 자랑하면서도 30만 토큰 수준으로 압축 관리했을 때의 점수가 100만을 통째로 밀어 넣었을 때보다 높았다는 자체 평가 결과도 같은 얘기다. 에이전트 시대에서는 최종 서비스 지능에서 가중치 자체의 몫이 30이라면, 그 가중치를 둘러싼 서빙 레이어의 완성도가 나머지 70을 결정할 수 있다.
기업이 소문만 듣고 오픈웨이트를 허겁지겁 받아다 인퍼런스 엔진 기본 설정으로 띄우면 이 레이어가 통째로 빠진다. 지시 이행이 흔들리고, 출력 포맷이 깨지고, 환각이 늘어난다. "가져와 보니 왜 이렇게 멍청하지"라는 반응은 모델이 나빠서가 아니라 서빙 레이어가 결여됐기 때문이다.
"벤치마크 1위, 미국 다 따라잡았다"는 보도와 "막상 써보니 별로"라는 현장 체감의 간극도 상당 부분 여기서 나온다. 구조적 원인은 몇 가지 더 있다. 클라우드 전용 미공개 상위 모델로 점수를 찍고 오픈웨이트로는 그 아래 체급을 푸는 이원화는 이미 업계 관행에 가깝다.
언론을 도배하는 그 중국 모델과 내가 내려받을 수 있는 중국 모델은 사실상 다른 물건이라는 얘기다. 공개된 시험 문제와 유사 합성 데이터가 학습에 스며들면 모델은 기출문제만 암기한 수험생이 되는데, 과제형 벤치마크라고 이 오염에서 자유롭지 않다. 고품질 학술 데이터와 글로벌 전문가 피드백, 문화적 뉘앙스의 축적에서 오는 격차는 벤치마크에는 잘 잡히지 않지만 실무의 미묘한 판단에서는 계속 드러난다.
검열 가이드라인을 정렬 단계에서 주입하면 특정 주제만 막히는 게 아니라 일반 추론의 유연성 자체가 훼손될 수 있다는 가설도 있는데, 레시피가 닫혀 있어 반증조차 불가능하다는 점에서 도입 리스크 평가 항목에서 빼기 어렵다. 결국 리더보드는 거짓말을 하는 게 아니라 다른 것을 측정하고 있을 뿐이다. 문제는 그 숫자를 내 업무 환경에서의 성능으로 오독하는 쪽에 있다.
필자는 이런 가능성을 국산 모델에서 직접 확인했다. 정부 독자 파운데이션 모델 사업의 첫 공개 성과물을 기본 환경에서 원시 가중치 그대로 돌려보니 처음엔 그냥 준수한 중형 모델로 보였다. 그러나 특화 시스템 프롬프트와 도구 연동, 검색증강생성(RAG) 오케스트레이션을 밀착 결합한 서비스에서의 체감 성능은 완전히 달랐다. 한정된 파이프라인 영역이긴 했지만 해외 프론티어 상용 모델에 서비스 품질이 밀리지 않았다. 같은 가중치가 서빙 레이어에 따라 '괜찮은 중형 모델'과 '특정 영역 프론티어급' 사이를 오간다면, 경쟁의 무게중심이 어디에 있는지는 자명하다고 볼 수 있다.
그래서 결론은 이렇다. 중국산 오픈웨이트 홍수는 위협이 아니라 원자재 폭락이다. 원자재가 싸질수록 가공 역량의 가치는 올라간다. 세계 최고 원유 수입국이면서 최고 정유 강국이 된 나라가 우리 아닌가. 프론티어급 가중치를 밑바닥부터 만드는 조 단위 자본 게임만 쫒을 것이 아니라, 어떤 가중치가 와도 최고의 체감 지능으로 완성해내는 '지능 완성국'의 포지션도 노려야 한다.
구체적 과제는 다섯 가지다.
첫째, 서빙 레이어 엔지니어링을 국가 역량으로 키워야 한다. 인퍼런스 최적화, 컨텍스트 엔지니어링, 도메인 특화 RAG, 에이전트 하네스는 자본보다 엔지니어링 밀도가 결정하는 게임이다.
둘째, 독자 파운데이션 모델은 가중치만 던지는 중국식 공개와 달리 기술보고서, 서빙 스택, 배포 레퍼런스까지 묶은 '풀스택 공개'로 차별화해야 한다. 재현 가능하고 감사 가능한 공개야말로 소버린 AI가 국제 시장에 팔 수 있는 희소가치가 될 수 있다.
셋째, 기업은 하이브리드 파이프라인으로 가야 한다. 반복적 과제의 80%는 국산 모델과 가성비 오픈웨이트에 최적화 서빙 레이어를 얹어 비용을 낮추고, 성패를 가르는 20%의 고난도 추론은 미국 프론티어 모델에 배치하는 이원 구조, 필자가 말해온 '연결된 자율성'이다. 100% 미국 모델은 비용에서, 100% 자체 모델은 품질에서 잃을 수 있다. 관건은 어떤 과제를 어느 층으로 보낼지 판별하는 라우팅과 오케스트레이션 역량이며, 이 역시 서빙 레이어 엔지니어링의 일부다.
넷째, 도입 의사결정의 회계 단위를 토큰당 단가에서 수용된 산출물당 총소유비용(TCO)으로 바꿔야 한다. 단가는 절반인데 토큰을 두 배 쓰는 K3의 사례가 교과서다.
관련기사
- 키미 K3 터지자 상장 당긴다…문샷, 6개월 내 홍콩 증시 노크2026.07.21
- 미국, '키미 K3' 성능 입증에 '긴장'…"중국 AI 확산 억제책 필요"2026.07.20
- 중국 AI '키미 K3' 쇼크가 흔든 반도체 패권2026.07.20
- 中 문샷, 신형 AI '키미 K3' 공개…오픈AI·앤트로픽 턱밑 추격2026.07.19
마지막으로, 국가 AI예산과 평가 체계를 정적 벤치마크 점수가 아니라 실무 환경 성공률과 단위 비용당 지능 투입량, 즉 국민총지능생산(GIP)의 관점으로 옮겨야 한다.
과소평가는 금물이다. 중국은 GPU 수출통제라는 극한 제약 속에서 자본이 아니라 알고리즘으로 활로를 뚫었고, 그 태도야말로 자본과 GPU가 부족한 우리가 가장 절실히 배워야 할 것이다. 과대평가도 금물이다. 지능의 상한선은 아직 넘지 못했고, 가중치 공개는 레시피 공개가 아니며, 다운로드는 서비스가 아니고, 표면 단가는 총비용이 아니다. K3 쇼크에서 우리가 읽어야 할 것은 공포도 안도도 아닌, 바로 이 것이다.
*본 칼럼 내용은 본지 편집방향과 다를 수 있습니다.










