비드래프트, '허깅페이스' 공인 1위 10개 석권

구조화 출력 IFStruct 98.95%로 오픈AI·엔비디아 넘어서

컴퓨팅입력 :2026/10/06 10:43

AI 딥테크 스타트업 비드래프트(대표 김민식)는 세계 최대 AI 플랫폼 허깅페이스의 공인 리더보드에서 1위를 추가해 총 10개 부문 1위에 올랐다고 6일 밝혔다. 

허깅페이스가 지정한 공인 벤치마크 48개, 95개 조직이 경쟁하는 무대에서 가장 많은 1위로, 2위 중국 지푸AI(4개)의 두 배를 넘는다. 같은 시기 AI 에이전트의 행동을 판정하는 비드래프트의 'Gate Arcade'는 허깅페이스 '이주의 스페이스(Spaces of the Week)'에 선정됐다.

회사 측에 따르면 새로 추가된 1위는 문서에서 필요한 정보를 뽑아내는 'ExtractBench'와 요구한 데이터 형식을 정확히 지키는 능력을 재는 'IFStruct'다. 지금까지의 1위가 과학·수학·법률 같은 '시험' 영역이었다면, 이번 두 부문은 기업이 AI를 실제 업무에 쓸 때 가장 먼저 부딪히는 '실무' 능력이라고 회사 측은 설명했다. 

비드래프트, '허깅페이스' 공인 1위 10개 석권.

미국 AI 기업 리퀴드AI(Liquid AI)가 만든 IFStruct는 AI의 요청받은 형식(JSON·YAML) 그대로 데이터를 제작하는지 체크한다. 항목 개수, 필드 이름, 자료형, 허용값, 숫자 범위까지 조건을 하나라도 누락되거나 요청하지 않은 항목을 하나라도 지어내면 불합격이다. 비드래프트 모델은 2000문항 가운데 1979문항을 통과해 98.95%를 기록했다고 알려졌다. 

이에 종전 1위 Agents-A1(93.25%), 오픈AI의 gpt-oss-20b(91.95%), 엔비디아 Nemotron-3-Nano(86.80%)를 앞섰다. AI의 답을 프로그램이 곧바로 읽어 다음 단계로 넘기는 기업 시스템에서는 형식이 한 글자만 틀려도 업무가 멈추기 때문에 형식 준수 능력은 AI 도입의 관건이다.

라마인덱스(LlamaIndex)가 만든 ExtractBench는 수 쪽에서 190여 쪽에 이르는 PDF 문서 370건에서 필요한 정보의 정확성을 확인한다. 자가개선을 한 번 더 거친 'Darwin-180B-RSI-R3'가 90.29점으로 1위에 올랐다. 종전 1위는 이 모델의 기반이 된 알리바바 Qwen3.8-Flash-Next(89.88점)였다.

또한 참가 모델이 가장 많은 MMLU-Pro(141개)와 GPQA(111개)에서도 모두 1위를 지키고 있어 경쟁이 가장 치열한 무대와 실무 영역을 함께 아우른다.

Darwin-180B-RSI는 알리바바의 오픈 모델 Qwen3.8-Flash-Next를 기반으로, 비드래프트의 '모델 수준 재귀적 자가개선(Model-level RSI)' 기술로 성능을 끌어올렸다. 사람이 쓴 정답이나 풀이 없이 모델이 검증 가능한 문제를 스스로 풀고, 정답으로 확인된 자기 풀이만 골라 다시 학습한다. 학습을 거듭할수록 모델이 스스로 똑똑해지는 구조로, 검증되지 않은 풀이는 배우지 않아 오류가 강화되지 않는다. 법률이나 문서 추출을 따로 가르치지 않았는데도 이 영역에서 1위에 오른 것은, 검증 가능한 문제를 풀며 익힌 꼼꼼한 추론 습관이 다른 영역으로 옮겨 간 결과로 회사는 보고 있다.

이와 함께 비드래프트는 9월 첫째 주 'ai-world'에 이어 한 달 새 두 번째로 '이주의 스페이스'에 이름을 올렸다. '이주의 스페이스'는 허깅페이스가 등록된 약 150만 개의 AI 앱 가운데 매주 8개를 골라 첫 화면에 소개하는 큐레이션이다. AI 에이전트의 행동을 실행할지 보류할지 판정하는 체험 앱 Gate Arcade는 지난달 28일 주간에 선정됐다. 

관련기사

김민식 비드래프트 대표는 "시험 문제를 잘 푸는 AI를 넘어, 문서를 읽고 정해진 형식대로 정확히 일하는 AI가 됐다"며 "RSI로 스스로 배우는 모델을 만들고, ZTC로 그 모델이 행동하기 전에 확신 없는 순간을 0.06초 만에 잡아내는 것이 비드래프트의 두 바퀴"라고 전했다. 

이어 "글로벌 빅테크가 판정 AI에 뛰어드는 지금, 생성 없이 판정하는 기술로 세계 시장을 선도하겠다"고 덧붙였다.