글로벌 인공지능(AI) 평가기관 아티피셜 애널리시스가 벤치마크 맞춤형 학습으로 실제 성능 개선 없이 점수만 높아질 수 있다는 우려를 인정했다. 현재 이같은 이슈를 최소화하기 위해 내부적으로 기술적 조치를 강화하고 있는 것으로 확인됐다.
14일 아티피셜 애널리시스는 지디넷코리아에 보낸 이메일에서 "벤치마크를 활용해 모델 약점을 보완하는 것은 통상적인 개발 과정"이라면서도 "특정 평가에 과도하게 최적화해 점수만 끌어올리는 방식은 경계해야 한다"고 밝혔다.
아티피셜 애널리시스는 글로벌 AI 모델 성능과 속도, 비용 등을 비교·분석하는 민간 평가기관이다. 해당 기관이 운영하는 '아티피셜 애널리시스 인텔리전스 지수(AAII)'가 독파모 2차 평가에서 전체 100점 중 25점을 차지한다.
아티피셜 애널리시스는 이같은 벤치마크 이슈를 최소화하기 위해 내부 분석과 검증, 자체 평가 데이터 활용, 지속적 평가 방법론 업데이트 등 세 가지 장치를 추진하고 있다고 말했다.
아티피셜 애널리시스 관계자는 "우리는 개별 평가와 전체 지수 차원에서 모델 답변과 추론 과정, 실행 로그, 점수 분포를 검토한다"며 "이를 통해 비정상적인 점수 변화나 특정 평가에만 특화된 최적화 흔적을 찾는다"고 말했다.
이어 자체적으로 개발·관리하는 평가와 외부 벤치마크도 활용한다고 밝혔다. 특정 공개 데이터나 하나의 평가 방식에 대한 의존도를 낮춰 일부 시험에 특화된 학습이 전체 점수 상승으로 이어지는 것을 막기 위해서다.
관계자는 평가 항목과 가중치, 채점 방식도 정기적으로 바꾸겠다고 밝혔다. 최신 AI 기술과 산업에서 중요해진 역량을 반영해 평가 체계를 지속적으로 개편함으로써 AAII가 개발사 공략 대상이 되지 않도록 한다는 취지다.
기관이 현재 사용 중인 'AAII 4.1.1' 버전은 에이전트 업무와 코딩, 과학적 추론, 장문 맥락 추론, 지식과 환각 등을 측정하는 9개 평가로 구성됐다. 아티피셜 애널리시스는 한 영역에서만 점수를 높이더라도 성능이 다른 과제로 확장되지 않으면 전체 지수에 미치는 영향은 제한적이라고 주장하고 있다.
그러나 아티피셜 애널리시스는 실제 벤치마크 과적합 징후를 발견한 사례가 있는지는 공개하지 않았다. 과적합 징후를 확인했을 때 해당 점수를 제외하거나 모델을 재평가하는지, 순위를 조정하거나 외부에 경고하는지 등 사후 조치 기준도 밝히지 않았다.
독파모 평가 25점 걸린 AAII...업계 "실제 성능 왜곡 우려"
최근 업계에선 일부 독파모 참여사 일부가 AAII 점수를 겨냥한 맞춤형 사후학습 데이터를 활용하고 있다는 의혹이 제기되고 있다.
이에 일각에선 일부 참여사가 모델이 낮은 점수를 받은 지식 영역과 문제 유형을 분석한 뒤 유사한 사후학습 데이터를 구매하거나 별도 구축하고 있다는 주장이 나온다. 벤치마크 문제와 정답을 그대로 학습하는 방식은 아니지만, 실제 사용 역량보다 특정 평가 점수만 높아진다면 모델 성능을 왜곡하는 벤치맥싱으로 이어질 수 있다는 우려다.
AAII 순위가 독파모 2차 평가의 최종 결과를 의미하는 것은 아니다. NIA 벤치마크와 전문가·사용자 평가가 별도로 진행되는 데다 AAII 역시 버전과 평가 구성에 따라 점수가 달라질 수 있어서다.
관련기사
- 독파모 2차 결과 발표 임박…AI 업계 '초긴장', 관전 포인트는2026.08.14
- 독파모 4개 팀 모두 해냈다…美 에포크AI '주목할 모델' 선정2026.08.11
- [안광섭 AI 진테제] 독파모 2차평가 눈앞...무엇을 '평가' 해야 하나2026.08.10
- [ZD브리핑] 3대 메가프로젝트 2차 점검회의...독파모 국민평가단 참여2026.08.09
과학기술정보통신부는 AAII만으로 모델 우열을 판단하지 않고 한국지능정보사회진흥원(NIA) 벤치마크와 전문가·사용자 평가를 종합한다는 입장이다. 그러나 AAII에 전체 점수의 4분의 1이 배정된 만큼 벤치마크 맞춤형 학습을 실제 성능 향상과 어떻게 구분할지가 평가 공정성을 가를 핵심 과제로 꼽힌다.
아티피셜 애널리시스는 "우리는 모델 답변과 추론 과정, 실행 로그, 점수 분포를 분석해 평가에만 특화된 최적화 방법론을 꾸준히 연구 중"이라고 밝혔다.











