가사만 붙여넣으면 곡 완성…50만 시간 학습한 무료 AI가 수노 코앞까지 추격

컴퓨팅입력 :2026/08/20 20:18

노래를 만드는 AI라고 하면 대개 매달 요금을 내야 하는 수노(Suno) 같은 서비스를 떠올린다. 그런데 텐센트(Tencent)와 칭화대(Tsinghua University) 연구진이 2026년 6월 공개한 노래 생성 AI 레보 2(LeVo 2)는 모델과 코드 전체를 무료로 내놓았다. 노래 생성 AI란 가사와 짧은 지시문만 넣으면 보컬과 반주가 합쳐진 완성곡 한 곡을 통째로 만들어 주는 인공지능을 말한다. 흥미로운 점은 이 무료 오픈소스 모델이 20명의 음악 전문가 평가에서 유료 상용 서비스의 성능을 코앞까지 따라잡았다는 사실이다.

텐센트와 칭화대가 공개한 무료 노래 생성 AI 레보 2

레보 2(LeVo 2)는 텐센트와 칭화대 연구진이 2026년 6월 논문과 함께 모델 가중치, 추론 코드를 전면 공개한 완곡 생성 AI다. 사용자가 가사를 적고 "따뜻한 포크풍, 여성 보컬, 어쿠스틱 기타와 피아노" 같은 분위기 설명을 덧붙이면, 보컬과 반주가 어우러진 완성곡 한 곡이 통째로 만들어진다. 기존에도 노래를 만드는 AI는 있었지만, 대부분 수노(Suno)나 뮤레카(Mureka)처럼 내부 작동 방식을 공개하지 않는 유료 서비스였다. 레보 2는 그 반대편에서 "어떻게 만들었는지"까지 논문으로 상세히 공개했다는 점에서 뚜렷이 구별된다.

이 차이는 단순한 무료 여부를 넘어선다. 상용 서비스는 회사가 문을 닫거나 요금제를 바꾸면 이용자가 여기에 종속될 수밖에 없지만, 코드와 모델이 공개된 도구는 누구나 자신의 컴퓨터에서 직접 구동하고 원하는 방향으로 수정해 활용할 수 있다. 곡을 자주 만드는 창작자나 소규모 스튜디오에게는 이 점 하나만으로도 선택지가 근본적으로 달라진다.

상용 유료 서비스를 위협하는 전문가 평가 성적

레보 2는 20명의 음악 전문가가 중국어 100곡, 영어 100곡을 직접 듣고 채점한 평가에서 오픈소스 모델 가운데 압도적 1위를 차지했다. 전체 음악성(OVL) 점수는 10점 만점에 5.48점으로, 기존 오픈소스 최강자였던 에이스스텝 1.5(ACE-Step 1.5)의 4.76점을 큰 차이로 앞섰다. 더 눈에 띄는 대목은 상용 서비스와의 격차다. 유료 서비스인 미니맥스 뮤직 2.5+(MiniMax Music 2.5+)는 5.22점으로, 무료인 레보 2가 오히려 모든 주관적 청취 지표에서 이 상용 모델을 앞질렀다.

업계 최정상급인 수노 v5(5.72점)와 뮤레카 v8(5.69점)에는 아직 미치지 못하지만, 그 격차는 이제 반주 음질 등 일부 항목에서 사실상 동률에 이를 만큼 좁혀졌다. 멜로디(6.12점), 편곡(6.42점), 반주 음질(7.10점) 항목에서는 상용 정상권과 거의 어깨를 나란히 한다. 특히 지시한 감정을 얼마나 정확히 표현하는지를 측정한 감정 제어 점수에서 레보 2는 8.72점을 기록해, 유료 상용 서비스를 포함해 어떤 시스템보다도 낮지 않은 최고 수준을 보였다. 가사를 얼마나 정확히 발음하는지를 보는 발음 오류율(PER)도 8.55%로 오픈소스 중 가장 낮아, 엉뚱한 가사를 지어내는 이른바 "가사 환각" 현상이 크게 줄었다.

이 숫자들이 작아 보일 수 있지만, 실제로 들었을 때 느껴지는 차이는 작지 않다. 음악성 0.5점 차이는 이 연구의 전문가 평가에서 90%가 같은 판정을 내릴 만큼 뚜렷한 격차였다. 무료로 풀린 도구가 유료 서비스와 이 정도로 좁혀졌다는 것은, 취미로 곡을 만들던 사람이 상용 구독을 끊고도 비슷한 결과물을 얻을 수 있는 지점에 가까워졌다는 뜻이다.

사람이 작곡하듯 큰 그림을 먼저 잡는 계층적 설계

레보 2가 이런 성적을 낸 비결은 사람이 곡을 만드는 순서를 흉내 낸 계층적 구조에 있다. 계층적 모델링(Hierarchical Modeling)이란 곡 전체의 큰 흐름을 먼저 정하고, 그 위에 세부 음질을 나중에 채워 넣는 2단계 작업 방식을 말한다. 레보 2는 이 작업을 두 개의 언어모델로 나눠 처리한다. 먼저 곡의 뼈대를 잡는 언어모델이 멜로디, 리듬, 템포, 보컬과 반주의 조화 같은 전체 흐름을 설계한다. 이어서 음질을 다듬는 또 다른 언어모델이 그 뼈대 위에서 보컬과 반주 소리의 세밀한 부분을 채운다.

그림1. 레보 2의 전체 구조와 3단계 학습 과정 개요 (출처: LeVo 2 논문 그림 1)

이 구조가 중요한 이유는 기존 방식의 고질적 딜레마를 피해 가기 때문이다. 보컬과 반주를 한 덩어리로 묶어 처리하면 둘의 조화는 잘 이루지만 각 소리의 세부가 흐려진다. 반대로 보컬과 반주를 개별적으로 처리하면 음질은 좋아지지만 처리해야 할 데이터가 길어져 곡 전체의 통일감이 흔들린다. 레보 2는 큰 그림을 잡는 언어모델과 세부를 채우는 언어모델을 분리해 병렬로 처리하는 방식으로, 조화와 음질이라는 두 목표를 동시에 달성했다.

또 하나의 핵심은 좋은 곡을 골라 가르치는 미학 평가 프레임워크다. 미학 평가 프레임워크란 AI가 만든 곡의 완성도를 사람 대신 자동으로 채점해 주는 심사위원 역할의 도구다. 연구진은 약 50만 시간에 이르는 방대한 음악 데이터를 이 도구로 채점해 다섯 등급으로 나눴고, AI가 상위권 곡의 특징을 우선 학습하도록 유도했다. 여기에 기초 학습, 사용자 취향에 맞추는 정렬, 세부 음질 보완이라는 세 단계로 훈련을 구분해, 여러 목표가 서로 충돌하는 문제를 줄였다.

창작 도구의 대중화와 남겨진 숙제

레보 2의 공개는 곡을 만드는 문턱을 크게 낮춘다. 악기를 다루지 못해도, 작곡 이론을 몰라도, 가사와 분위기만 정하면 완성곡을 얻을 수 있는 도구가 무료로 공개됐다는 점은 개인 창작자와 소규모 콘텐츠 제작자에게 실질적인 변화를 가져올 가능성이 있다. 유튜브 배경음악, 개인 프로젝트, 습작 등에서 상용 구독 없이도 실용적인 결과물을 얻을 수 있는 선택지가 생긴 셈이다.

다만 연구진 스스로 밝힌 한계도 분명하다. 레보 2의 음질은 여전히 학습 데이터의 양과 품질에 좌우되어 최정상 상용 서비스와는 격차가 남아 있다. 또 학습 데이터의 상당 부분을 다른 AI 모델이 자동으로 붙인 설명에 의존한 탓에, 지시를 정확히 따르는 능력에서 상용 서비스에 밀리는 부분이 있다. 저작권과 윤리 문제도 두고 볼 필요가 있다. 연구진은 모든 모델과 데이터를 학술 연구 목적으로만 쓰며 원작자의 지식재산권을 존중하려 했다고 밝혔지만, 이런 도구가 널리 퍼질수록 창작물의 권리와 책임을 둘러싼 논의는 더 커질 가능성이 있다. 무료 공개가 창작의 민주화로 이어질지, 아니면 새로운 분쟁의 불씨가 될지는 앞으로의 활용 방식에 달려 있다.

FAQ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)

Q1. 레보 2는 정말 누구나 무료로 쓸 수 있나요?

연구진은 레보 2의 모델 가중치와 추론 코드를 공개했습니다. 다만 논문에는 학술 연구 목적으로 공개한다는 점이 명시되어 있어, 실제 이용 시에는 공개된 라이선스 조건을 확인하는 것이 좋습니다. 코드와 예시 음원은 연구진이 안내한 공식 저장소에서 확인할 수 있습니다.

Q2. 레보 2로 만든 노래가 수노나 뮤레카보다 좋은가요?

전문가 평가 기준으로는 수노 v5와 뮤레카 v8이 여전히 앞섭니다. 다만 그 격차가 매우 좁혀졌고, 또 다른 상용 서비스인 미니맥스 뮤직 2.5+는 모든 주관적 청취 지표에서 레보 2가 앞섰습니다. 오픈소스 모델 중에서는 레보 2가 가장 뛰어난 성적을 보였습니다.

Q3. 노래 생성 AI는 어떤 원리로 곡을 만드나요?

레보 2는 곡 전체의 큰 흐름(멜로디, 리듬, 보컬과 반주의 조화)을 먼저 잡은 뒤, 그 위에 보컬과 반주의 세밀한 음질을 채워 넣는 계층적 방식으로 곡을 만듭니다. 여기에 좋은 곡을 자동으로 골라 학습시키는 미학 평가 도구를 더해, 사람이 듣기 좋은 음악에 가까워지도록 훈련합니다.

기사에 인용된 리포트 원문은 arXiv에서 확인할 수 있다.

관련기사

리포트명: LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

■ 이 기사는 AI 전문 매체 ‘AI 매터스’와 제휴를 통해 제공됩니다. 기사는 클로드 3.5 소네트와 챗GPT를 활용해 작성되었습니다. (☞ 기사 원문 바로가기)