정부 주도의 국가대표 인공지능(AI) 선발전인 '독자 AI 파운데이션 모델(독파모)' 프로젝트가 내년 초 최종 2개 팀을 가린다. 마지막 단계평가를 앞두고 정부가 벤치마크 자체 평가 항목 중 도구·에이전트와 코딩 분야를 구축하기로 하면서 결과에 어떤 영향을 미칠지 주목된다.
24일 업계에 따르면 한국지능정보사회진흥원(NIA)은 지난 12일 'AI 모델 벤치마크 데이터셋 구축 사업(2차)' 공모를 냈다. 도구·에이전트와 코딩 2개 분야에서 한국어 기반 벤치마크 데이터셋을 구축하는 사업으로, 다음 달 11일까지 참가 신청을 받는다. 총사업비는 12억원이며 분야당 6억원이 지원된다.
벤치마크 자체 평가에 에이전트·코딩 분야 신규 편입
이 사업은 독파모 평가에 쓰이는 벤치마크를 만드는 과제다. 실제 공모안내서에는 이 사업이 독파모 프로젝트와 함께 과기정통부의 월드 베스트 거대언어모델(LLM) 데이터 활용 지원 사업' 산하에서 추진된다고 명시됐다. 이렇게 구축된 데이터셋은 AI 모델 성능 검증을 2회 지원하게 된다.
NIA는 지난해 7월 1차로 공고했던 'LLM 성능 평가 데이터셋 구축 사업'에서 수학·지식·장문이해 3개 분야 벤치마크를 구축했다. 반면 이번 공모에서는 도구·에이전트와 코딩 분야를 신규로 구축한다. 텍스트 기반의 지식·추론 능력을 재던 1차와 달리, 2차 사업에서는 도구를 활용해 실제 과업을 완수하는 실행 능력을 새 평가 축으로 삼은 셈이다.
이 같은 변화는 독파모 2차수가 사실상 텍스트 기반 평가에 머물렀다는 지적을 반영한 것으로 풀이된다. 2차 평가에 오른 LG AI연구원, 업스테이지, SK텔레콤, 모티프테크놀로지스 4개 팀 모델은 모두 미국 비영리 연구기관 에포크AI의 '주목할 만한 AI 모델'에 이름을 올렸지만 도메인은 언어에만 한정됐다.
모델 사용성을 보는 정성 평가도 텍스트에 한정됐다. 2차수 당시 전문가 평가와 일반 국민 평가 모두 LLM의 텍스트 응답 성능을 대상으로 이뤄졌고 파일 첨부나 이미지·영상 생성 같은 텍스트 외 기능은 평가 대상에서 빠졌다. 글로벌 프론티어 모델 경쟁이 이미지·음성·영상을 함께 처리하는 멀티모달로 이동한 것과는 대비되는 지점이다.
최종 평가 어떻게 진행되나…기준 설정에 쏠린 눈
독파모 최종전인 3차 평가 방식은 2차 결과에 대한 이의제기 절차가 끝난 뒤 참가 팀들과의 합의를 거쳐 확정된다. 앞선 두 차례 평가 전후로 업계 안팎에서 여러 논란이 이어진 만큼 3차 평가 기준이 어떻게 짜일지에 업계 이목이 쏠린다.
독파모는 기술 독자성(프롬 스크래치) 논란에 이어 2차에서 특정 벤치마크를 겨냥한 데이터와 사후학습으로 점수를 집중적으로 끌어올리는 '벤치맥싱' 의혹에 휩싸였다. 세부 점수 공개를 둘러싼 투명성 문제도 제기됐다.
안광섭 세종대학교 겸임교수(인레벨나인 대표)는 "사업 목표와 쓰임새를 분명히 정하고 가야 평가 논란이나 실효성에 대한 의문이 반복되지 않는다"며 "모델을 하나의 기준으로 줄 세우기보다 크기별·용도별로 나눠 평가하는 체계도 고려해야 한다"고 말했다.
벤치마크 다양화부터 투명성 개념 재정립까지
2차 평가에서 AAII 점수를 둘러싼 벤치맥싱 논란이 불거지면서 단일 지표에 대한 의존도를 낮춰야 한다는 목소리도 커졌다. 단순 배점만 조정해서는 벤치맥싱 같은 논란을 근본적으로 막기 어렵다는 이유에서다.
업계에서는 아티피셜 애널리시스의 AI 모델 종합평가인 'AAII' 외에도 글로벌 지표를 추가로 검토해야 한다는 의견이 나온다. AI에 가상의 사업 운영을 맡기고 최종 잔고로 채점하는 '벤딩벤치', 실사용 세션 수백만 건으로 작업 완수를 재는 '에이전트 아레나' 등이 AAII를 보완할 주요 지표로 거론된다.
안 교수는 "문제를 미리 알려주고 보는 시험은 없다"면서 "2차 평가 요소에 AAII를 추가했듯 3차에 새 지표를 넣더라도 어떤 시험지를 쓸지는 각 팀에 알려주지 않는 블라인드 방식으로 가야 한다"고 강조했다.
독파모 평가 지표 및 평가 결과 산출 기준에 대한 투명성의 본질이 점수 공개 여부에 있지 않다는 의견도 있다. 점수를 낱낱이 공개하기보다 평가가 어떤 절차와 기준으로 이뤄졌는지를 사전에 밝히는 게 우선이라는 것이다.
관련기사
- 정부, 독파모 2차 평가 세부 점수 공개…"투명성 논란 해소"2026.08.20
- [독파모 2차 발표] SK텔레콤 3차 진출, 다음 행보는 "산업·생활 서비스 확산"2026.08.18
- [독파모 2차 발표] LG 'K-엑사원' 3차 진출…"승부처는 활용성"2026.08.18
- [독파모 2차 발표] 업스테이지 3차 진출…"국산 NPU로 실증·아시아권 공략"2026.08.18
과학기술정보통신부는 2차 평가 발표 브리핑에서 1위 기업에 대한 인식 제고와 나머지 기업에 대한 낙인 효과를 우려해 세부 순위를 밝히지 않았다. 그러나 결과 공개 이후 구체적인 점수 산출 근거에 대한 요구가 커지자 이틀 만에 보도설명자료를 내고 1차 평가와 같이 항목별 1위 기업과 점수를 공개했다.
안 교수는 "대학수학능력시험(수능) 출제위원도 외부와 차단된 환경에서 비공개로 문제를 만들지만 아무도 이를 불투명하다고 하지 않는다"며 "점수 하나하나를 공개하는 것보다 전문가 평가위원을 어떤 기준으로 선정했는지 등을 구체적으로 알리는 것이 투명성 확보에 더 가깝다"고 제언했다.








