AI가 찍은 스포츠 명장면, 진짜일까?…UNIST가 답 찾다

8개 종목 320편·누적 640시간 분량 AI 평가 벤치마크 구축

과학입력 :2026/09/13 09:00    수정: 2026/09/13 09:24

스포츠 경기 영상에서 하이라이트를 찾는 AI 모델의 성능을 평가할 때 사용하는 보다 정교한 벤치마크가 개발됐다.

UNIST는 김태환 인공지능대학원 교수 연구팀이 대규모 벤치마크인 ‘SV하이라이트(SVHighlights)를 만들었다고 13일 밝혔다.

축구, 야구, 농구, 배구, 미식축구, 아이스하키, 럭비, 레이싱 등 8개 종목 영상을 각각 40편씩 320편으로 구성했다. 누적 640.18시간에 해당한다. 영상 한 편의 평균 길이는 2시간. 기존 데이터셋보다 30~60배나 길다.

UNIST 연구진. 왼쪽부터 김태환 교수, 이동규 연구원, 기영빈 연구원.(사진=UNIST)

김태환 교수는 "실제 스포츠 중계 길이와 비슷한 수준"이라고 말했다.

기존 벤치마크에 담긴 영상은 평균 2~4분 내외다. 이유는 시간과 비용 때문이다.

연구팀은 이미 편집돼 인터넷 등에 공개된 스포츠 공식 하이라이트 영상을 활용했다. 다만, 하이라이트 영상이 원본 어느 시점에 나오는지에 대한 타임 스탬프 정보가 없다는 문제는 이를 자동으로 찾아내는 매칭 알고리즘을 만들어 해결했다.

이 알고리즘은 원본 영상과 하이라이트 영상 프레임을 픽셀 단위(PSNR)로 비교해 가장 유사한 장면을 파악할 수 있다.

연구팀은 알고리즘을 설계할 때 화면 유사성뿐만 아니라 앞에서 찾은 장면과의 시간 순서까지 함께 따지도록 했다. 중계 영상에는 보통 득점 장면 등을 여러 번 리플레이하는 경우가 많아, 실제 경기 발생 시점 대신 시각적으로 동일한 리플레이 장면을 하이라이트로 잘못 매칭하는 오류를 방지하기 위해서다.

일반인 10명이 참여한 평가에서도 하이라이트 구간은 5점 만점에 평균 3.42점을 받았다. 비하이라이트 구간의 평균 점수인 1.94점과 1.97점보다 뚜렷하게 높아, 자동으로 만든 정답이 사람의 판단과도 대체로 일치함을 확인했다.

연구팀은 기존의 장면 분할 모델과 음성인식모델, 비전언어모델, 대규모 언어모델을 조합해 긴 영상에서도 하이라이트를 효과적으로 추출할 수 있는 ‘TF-셀렉터’라는 AI 모델도 함께 개발했다.

'TF-셀렉터'는 고른 장면이 실제 하이라이트인지를 평가하는 HIT@1은 2.50%포인트, 실제 하이라이트 수만큼 후보를 골랐을 때 얼마나 많이 찾아냈는지를 평가하는 HIT@K는 4.04%포인트 높았다. 예측 구간과 정답 구간 겹침을 나타내는 IoU(교집합 대비 합집합 비율)도 2.95점 높았다.

UNIST가 개발한 SV하이라이트 정렬 알고리즘 개요도.(그림=UNIST)

연구는 이동규 UNIST 석·박사통합과정생, 기영빈 석사가 제1저자로 참여 했다. 연구 결과는 지난달 9일 제주에서 열린 데이터마이닝분야 국제학회인 'ACM KDD'에 채택됐다.

관련기사

김태환 교수는 “데이터를 계속 늘려갈 수 있어 장시간 영상 분석 모델을 객관적으로 평가하고 성능이 더 나은 모델을 개발하는 데 도움이 될 것”이라고 말했다.

김 교수는 또 "스포츠 하이라이트 자동 제작뿐 아니라 영화·드라마 요약, 회의 기록 정리, 장시간 관제 영상의 주요 장면 검색 등으로 확장 가능하다"고 덧붙였다.