정부가 '독자 인공지능(AI) 파운데이션 모델' 개발 과정에서 확보한 학습용 데이터를 민간에 개방했다. 국내 기업과 연구자가 대형 AI 모델과 멀티모달·안전성 기술을 개발할 수 있는 기반을 넓히기 위한 전략이다.
과학기술정보통신부는 독파모 5개 정예팀이 1차 단계평가 과정에서 확보한 데이터 29종을 한국지능정보사회진흥원(NIA)의 AI허브에 공개했다고 27일 밝혔다. 개방 규모는 약 3544만건으로 토큰으로 환산하면 약 1조 5600억개다.
이번 데이터는 정예팀들이 각자 AI 모델 개발 전략에 맞춰 2025년 데이터 구축·가공 예산 150억원으로 확보했다. 대규모 사전학습 데이터부터 영상·음성 기반 멀티모달 데이터와 AI 안전성 확보를 위한 레드티밍 데이터까지 포함됐다.
전체 데이터는 이론적으로 약 700~800억개 매개변수 수준의 대형 AI 모델을 학습하는 데 사용할 수 있는 규모다. 독자 AI 모델 개발에 참여한 정예팀들의 학습 전략과 데이터 구축 경험도 담겼다.
네이버클라우드는 공개 영상 234만건과 방송 영상 52만건을 비롯해 영상 클립을 기반으로 만든 텍스트 1550만건과 음성 질의응답 1200만건을 구축했다. 장면을 문장 단위로 설명한 캡션 등이 포함돼 AI의 영상 이해 능력과 이미지 생성 모델 학습에 활용할 수 있다.
업스테이지는 1조 토큰 규모의 사전학습 데이터와 50만건의 사후학습 데이터를 공개했다. 사전학습 데이터는 대형 AI 모델을 처음부터 학습하는 데 쓸 수 있으며 사후학습 데이터는 추론과 판단·실행 능력을 갖춘 AI 에이전트 개발에 활용할 수 있다.
SK텔레콤은 수학·과학·법률 분야의 고난도 다단계 추론 데이터와 음성·이미지 기반 사후학습 데이터를 구축했다. 국내 법령과 한국 사회의 보편적 가치관을 반영한 한국형 레드티밍 데이터 약 1만건도 포함했다.
NC AI는 제조 분야 기술문서와 민원 상담 음성 등 산업 현장에서 확보한 실제 데이터 기반으로 7종의 학습 데이터를 마련했다. 긴 문맥 이해와 단계별 추론·멀티턴 대화·질의응답·멀티모달 학습 등에 활용할 수 있다.
LG AI연구원은 국내 50개 실제 가정환경에서 50종 넘는 가사 활동을 촬영해 한국 가정환경에 특화된 피지컬 AI 멀티모달 데이터를 구축했다. 17만개 이상의 영상 클립에 객체와 분할·자세·맥락 정보를 다층으로 표시해 비전 언어 모델 학습과 상용 서비스 개발 등에 이용할 수 있도록 했다.
NIA와 한국정보통신기술협회(TTA)는 정예팀들로부터 데이터를 제공받아 품질과 개인정보·유해성을 검증했다. 라이선스 제약이 있는 데이터는 개방 대상에서 제외했다.
사업 참여 조건에 따라 데이터 구축·가공 예산으로 확보한 데이터 가운데 50% 이상을 공개해야 한다. 네이버클라우드와 업스테이지·SK텔레콤·NC AI는 검증을 마친 데이터를 모두 개방하고 LG AI연구원은 의무 개방량을 충족하도록 세부 데이터셋을 통계적으로 선별해 공개했다.
국내 기업과 연구자·학생 등 대한민국 국민은 누구나 AI허브 '독자AI모델 데이터' 항목에서 데이터를 무료로 내려받아 활용할 수 있다. 일부 데이터는 보안이 보장된 온라인 AI 모델 개발 공간인 '안심존' 이용을 별도로 신청해야 한다.
관련기사
- "한국판 IRA, 직접환급제 필요…못하면 정부가 대안 내라"2026.08.27
- 다가오는 AGI 시대…정부·산학연 머리 맞댄다2026.08.27
- "연구실 아이디어를 현실로"…정부, 'ICT 챌린지 2026' 수상팀 16곳 선정2026.08.26
- 정부, 인천 AI·SW 인재양성 거점 열어…지역 기업 AX 지원2026.08.25
과기정통부는 독파모 고도화 지원을 이어갈 방침이다. 향후 2차 단계평가 과정에서 데이터 구축·가공 예산으로 확보한 데이터도 품질검증을 거쳐 추가로 개방할 예정이다.
김경만 과기정통부 AI정책실장은 "독파모 프로젝트는 단순히 AI모델 개발을 넘어 개발과정에서 축적된 경험과 노하우를 통해 AI생태계 전반의 질적 성장에 기여한다는 점에서 큰 의미"라면서 "오늘 개방된 데이터는 정예팀의 AI학습 전략이 담긴 귀중한 자산인 만큼 AI생태계의 성장과 자생력 강화를 이끄는 밑거름이 될 것"이라고 밝혔다.








