오픈AI·딥마인드가 짚은 벤치마크 함정, AI 승부는 '현장'서 갈린다

"막대그래프로 AI 실력 재는 시대 끝"…최전선 연구자들이 짚은 '현장의 힘'

컴퓨팅입력 :2026/08/19 11:13    수정: 2026/08/19 11:14

김동원 기자

인공지능(AI) 경쟁 기준이 성적표에서 현장으로 옮겨가고 있다. 벤치마크 점수가 아무리 높아도 실제 업무에서 쓰이지 않으면 좋은 모델로 보기 어렵다는 인식이 확산 중이다. 18일 발표된 정부의 국가대표 AI 선발 2차 평가가 이 변화를 그대로 보여줬다.

이날 독자 AI 파운데이션 모델(독파모) 2차 단계평가에서는 글로벌 AI 평가기관 아티피셜 애널리시스의 AAII 지표에서 참여팀 중 최고점을 받은 모티프테크놀로지스가 사용성·활용성에서 밀려 탈락했다. 반면 업스테이지·SK텔레콤·LG AI연구원이 3차에 진출했다.

이번 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점 등 총 100점으로 진행했다. AI 전문가 49명과 일반 국민 185명이 각 팀의 모델을 직접 써보고 채점하는 사용자 평가를 새로 도입해, 벤치마크 성능만으로는 통과할 수 없는 구조였다.

나만 고얄 구글 딥마인드 머신러닝 리서치 엔지니어는 벤치마크를 '텅 빈 코스에서 치르는 운전면허 시험'에 비유했다. (사진=구글)

류제명 과기정통부 제2차관은 브리핑에서 "기술력이 뛰어나도 75점의 상당한 배점이 주어진 사용성·활용성에서 낮은 평가를 받으면 종합 결과가 달라질 수 있다"고 설명했다.

성적표가 실력을 보증하지 못하는 이유는 벤치마크 구조적 한계에 있다. 벤치마크는 미리 정해진 문제와 정제된 환경에서 모델을 시험한다. 문제 유형이 고정돼 있어 특정 시험에 맞춰 최적화하면 점수를 끌어올릴 수 있지만, 이렇게 얻은 고득점이 실제 업무 능력으로 이어진다는 보장은 없다. 현장 입력은 지저분하고 예외적이며, 사용자의 질문은 시험지처럼 정돈돼 있지 않기 때문이다.

이 문제는 최전선 연구자들이 먼저 지적해왔다. 노엄 브라운 오픈AI 연구부사장은 지난달 서울에서 열린 글로벌 AI 프론티어 심포지엄 2026에서 "막대그래프 하나로 AI 실력을 재는 시대는 끝났다"고 말했다. 오픈AI의 추론 모델 'o1'과 'o3' 시리즈를 설계한 그는 벤치마크 점수 하나가 아니라 연산량 대비 성능 곡선으로 모델을 평가해야 한다고 지적했다. 같은 모델이라도 더 오래 연산하게 하면 성능이 달라지는데, 단일 점수로는 이 차이가 드러나지 않는다고 강조했다.

국제 AI 학회 ICML 참석차 방한한 나만 고얄 구글 딥마인드 머신러닝 리서치 엔지니어는 벤치마크를 '텅 빈 코스에서 치르는 운전면허 시험'에 비유했다. 시험을 통과했다고 실제 도로에서 잘 달릴 수 있는 것은 아니란 뜻이다.

그는 성능이 뛰어난 물체 탐지 모델이 영상의 한 프레임에서는 대상을 정확히 찾고도 거의 똑같아 보이는 다음 프레임에서는 놓치는 사례를 들며 "정제된 환경에서 잘 작동하던 모델도 조건이 조금만 어긋나면 무너질 수 있다"고 지적했다.

통과한 팀들이 활용성을 전면에 내세운 배경도 여기에 있다. LG AI연구원은 이번 모델의 차별점으로 파라미터 규모가 아니라 실제 업무 현장에서 스스로 일을 처리하는 AI 에이전트 성능을 앞세웠다. LG AI연구원 관계자는 "크기를 키우면서도 실제 사용자가 더 효율적으로 쓸 수 있도록 에이전트 기능에 집중했다"며 "단순히 큰 모델을 만드는 게 아니라 사용자가 실제 업무에서 성과를 내도록 돕는 AI를 만드는 것이 핵심"이라고 밝혔다.

정부는 독파모 3차 평가를 거쳐 내년 초 최종 2개 팀을 선정한다. 2027년 이후 지원 방식은 개발 주관사 중심의 기존 구도에서 벗어나 전면 재검토하기로 했다. 글로벌 프론티어 모델과의 격차를 좁히기 위해 지원 규모와 경쟁 방식을 다시 짠다는 방침이다.

관련기사

고얄 엔지니어는 10년 전 알파고가 정복한 대상이 규칙이 정해진 바둑판이었다면, 지금 마주한 대상은 규칙이 수시로 바뀌는 현실 속 AI라고 했다. 

그는 "AI 실력은 정해진 판 위 고득점이 아니라, 판이 흔들리는 현실에서 얼마나 믿을 만한 결정을 내리느냐에 있다"고 밝혔다.