다시 부를 필요 없다…녹음된 노래 가사만 갈아끼우는 AI 나왔다

컴퓨팅입력 :2026/08/06 08:41

…

노래에서 가사 한 단어를 바꾸는 일은 지금까지 가수를 스튜디오로 다시 부르는 일과 같았다. 그런데 이미 녹음된 노래에서 멜로디와 박자, 나머지 구간은 그대로 둔 채 가사만 바꿔 넣는 AI가 등장했다. 카이스트(KAIST) 연구진이 2026년 6월 공개한 노래 가사 편집 AI '멜로디싱어(MeloDISinger)'다. 텍스트만 고치면 노래가 바뀌는 시대가 가까워지면서, 음원 수정에 들던 스튜디오 비용과 시간이 달라질 수 있다는 전망이 나온다.

스튜디오 재녹음 없이 텍스트만 고치는 노래 가사 편집 AI

멜로디싱어는 카이스트 인공지능대학원과 문화기술대학원의 박윤정(Yoonjeong Park), 임재권(Jaekwon Im), 남주한(Juhan Nam) 연구진이 발표한 텍스트 기반 노래 음성 편집 모델이다. 텍스트 기반 노래 음성 편집(SVE, singing voice editing)이란 이미 녹음된 노래에서 원래 멜로디와 전체 길이, 수정하지 않은 구간을 그대로 유지하면서 가사만 바꿔 새로운 노래 음성을 만들어내는 기술을 말한다. 예를 들어 "You look happy to meet me"라고 부른 원곡에서 가사 텍스트만 "We feel lucky to meet us"로 고쳐 입력하면, AI가 바뀐 부분만 새로 노래해 원곡에 이어 붙이는 방식이다.

음악 제작 현장에서 녹음된 보컬을 수정할 일은 생각보다 잦다. 발음이 잘못됐거나, 빠진 단어를 넣어야 하거나, 특정 구절을 통째로 바꿔야 하는 경우다. 논문에 따르면 이런 수정 작업에는 전문 스튜디오와 숙련된 보컬리스트, 전용 녹음 장비가 필요해 비용과 시간이 많이 든다. 말소리를 편집하는 기술은 이미 상당히 발전했지만, 노래는 사정이 다르다. 편집한 구간이 원곡의 멜로디, 리듬과 어긋나면 반주와 박자가 틀어지기 때문이다. 특히 전체 길이가 조금이라도 달라지면 뒤에 이어지는 반주 전체와 어긋나게 된다.

기존 기술은 이 문제를 제대로 풀지 못했다. 베보2(Vevo2)처럼 대규모 데이터로 학습한 모델은 전체 시퀀스를 다시 생성하는 과정에서 수정하지 않은 구간의 타이밍이나 멜로디까지 바꿔버리는 일이 있었다. 길이와 음정을 명시적으로 다루는 에디트싱어(EditSinger)는 바꾸려는 단어와 원래 단어의 음소 개수가 같아야 한다는 제약이 있어, 길이가 다른 가사로는 자연스러운 교체가 어려웠다. 음소란 소리를 이루는 가장 작은 단위로, 한글로 치면 자음과 모음 하나하나에 해당한다.

전체 길이 오차 0.004초, 청취 평가 사실상 전 항목 1위

멜로디싱어의 가장 두드러진 성과는 전체 길이를 사실상 완벽하게 보존했다는 점이다. 논문의 객관 평가에서 멜로디싱어의 길이 차이(DDUR) 지표는 모든 편집 시나리오에서 0.00초를 기록했다. 신호 처리 과정에서 생기는 약 0.004초의 잔여 오차만 남는 수준이다. 0.004초는 사람이 눈을 한 번 깜빡이는 시간의 100분의 1 안팎에 불과한 길이로, 반주와의 어긋남을 사실상 느낄 수 없다는 뜻이다. 반면 비교 대상인 베보2는 단어 삭제 편집에서 최대 1.92초, 에디트싱어는 최대 0.67초의 길이 오차를 보였다. 노래에서 1초 안팎의 어긋남은 반주와 박자가 완전히 틀어지는 수준이다.

가사가 얼마나 정확하게 들리는지 측정하는 단어 오류율(WER)에서도 차이가 컸다. 단어 오류율은 음성 인식기가 생성된 노래를 받아 적었을 때 원래 의도한 가사와 얼마나 다른지를 나타내는 수치로, 낮을수록 가사 전달이 정확하다는 의미다. 음절 수는 같지만 음소 구성이 다른 가사로 바꾸는 시나리오에서 멜로디싱어의 단어 오류율은 21.88%로, 베보2의 42.29%의 절반 수준이었다. 단어를 삭제하는 편집에서는 격차가 더 벌어져 멜로디싱어가 24.88%, 베보2가 68.72%를 기록했다. 베보2로 단어를 지우면 가사 단어 열 개 중 일곱 개가 잘못 들리는 수준이라는 이야기다.

사람이 직접 들은 평가에서도 결과는 같았다. 22명의 청취자가 가사 전달, 멜로디 유지, 자연스러움 세 항목을 5점 만점으로 평가한 결과, 멜로디싱어는 여섯 가지 편집 시나리오(세 종류의 단어 교체와 삽입, 삭제, 혼합 편집)에서 거의 모든 항목 최고 점수를 기록했다. 단어 삽입 시 가사 전달 항목에서 에디트싱어와 동점(3.95점)을 이룬 것을 제외하면 전 항목 1위다. 특히 음절 구성이 달라지는 어려운 편집일수록 격차가 커졌는데, 이는 발음 구조가 바뀌어도 원곡의 멜로디에 맞게 시간을 다시 배분하는 능력에서 갈린 것으로 분석됐다.

그림1 멜로디싱어의 가사 편집 전후 음정 비교 (출처: MeloDISinger 논문, arXiv:2606.30580)

실제 노래에서 뽑아낸 가짜 악보, 박자를 지키는 작동 원리

멜로디싱어가 박자를 지키는 핵심은 '시간 예산' 개념이다. 연구진이 설계한 멜로DRP(MeloDRP)는 편집 구간의 총 길이를 고정된 예산으로 정해 놓고, 새 가사의 음소들이 그 안에서 시간을 비율로 나눠 갖도록 예측하는 모듈이다. 각 음소가 몇 초를 차지할지 절대값으로 정하는 기존 방식과 달리, 전체에서 차지하는 비율을 정하기 때문에 합계가 반드시 원래 구간 길이와 일치한다. 단어를 끼워 넣을 때는 이웃 단어의 시간을 나눠 쓰고, 단어를 지울 때는 그 자리를 침묵으로 처리하는 식으로 편집 유형별 규칙도 마련했다.

멜로디를 지키는 장치는 따로 있다. 연구진은 악보 대신 실제 노래에서 추출한 유사 미디(pseudo-MIDI), 말하자면 가수가 실제로 낸 음정을 기록한 가짜 악보를 활용했다. 가수는 악보와 다르게 음정과 박자를 밀고 당기며 부르는 일이 많아서, 악보보다 실제 음성에서 뽑은 정보가 원곡의 느낌을 더 정확하게 담기 때문이다. 새 가사의 음소 정보와 이 멜로디 정보를 교차 주의(cross-attention) 방식으로 결합해, 어떤 음소가 어떤 음표 위에서 얼마나 길게 불려야 하는지를 학습시켰다.

소리를 만들어내는 단계에서는 오디오 인필링(audio infilling) 기법을 썼다. 오디오 인필링이란 노래 전체를 새로 생성하는 대신 편집할 구간만 비워 두고, 앞뒤 원본 소리에 자연스럽게 이어지도록 빈 곳만 채워 넣는 방식을 말한다. 잡음에서 시작해 목표하는 소리로 점차 다듬어가는 플로 매칭(flow matching) 생성 모델이 이 채움 작업을 맡는다. 수정하지 않은 구간은 원본 그대로 남기 때문에 원곡의 음색과 감정이 훼손되지 않는다.

구성 요소별 기여도를 확인한 실험에서는 총 길이 조건을 제거했을 때 성능이 가장 크게 무너졌다. 멜로디 정보를 빼면 발음 구조가 크게 바뀌는 편집에서 품질이 떨어졌다. 박자 예산과 멜로디 정보라는 두 축이 모두 있어야 노래다운 편집이 가능하다는 사실이 확인된 셈이다.

위스퍼X와 제미나이로 만든 시험 문제, 그리고 남은 한계

연구진은 평가 방식도 새로 설계했다. 기존 연구들은 대규모 언어 모델에게 가사만 주고 바꿔 쓰게 했는데, 이렇게 만든 가사는 주어진 멜로디 구간 안에서 부르기에 물리적으로 불가능한 경우가 있었다. 멜로디싱어 연구진은 음성 인식 도구 위스퍼X(WhisperX)로 원곡에서 단어별 시작과 끝 시각을 측정한 뒤, 사람이 한 음절을 안정적으로 부르는 데 필요한 최소 시간을 0.3초로 잡아 각 구간에 들어갈 수 있는 음절 수의 상한을 계산했다. 이 제약 조건을 구글의 제미나이(Gemini-2.5-flash)에 전달해 시간 안에 부를 수 있는 편집 가사만 생성하도록 했다. 노래방에서 원곡보다 글자 수가 두 배인 개사곡을 같은 반주에 욱여넣을 수 없는 것과 같은 이치를 평가 체계에 반영한 것이다.

다만 한계도 뚜렷하다. 실험은 GTSinger 데이터셋의 영어 노래 13시간, 가수 3명분으로 진행됐다. 학습에 쓰이지 않은 8곡에서 뽑은 60개 클립으로 성능을 검증했지만, 한국어를 포함한 다른 언어나 다양한 창법, 실제 상업 음원 수준의 복잡한 녹음 환경에서도 같은 품질이 나올지는 아직 확인되지 않았다. 연구진도 멜로디 인식 평가 지표 개발과 더 넓은 편집 상황으로의 확장을 향후 과제로 남겨 뒀다.

음악 후반 작업의 비용 구조가 바뀔 가능성

이 기술이 상용 수준에 도달하면 가장 먼저 달라질 곳은 음악 제작의 후반 작업이다. 가사 한 줄 때문에 보컬 세션을 다시 잡는 대신 텍스트 수정으로 끝낼 수 있다면, 수정 비용은 스튜디오 대여료 단위에서 소프트웨어 사용료 단위로 내려간다. 방송 심의에 맞춘 클린 버전 제작, 광고 음악의 브랜드명 교체, 게임이나 애니메이션 주제가의 현지화처럼 같은 멜로디에 다른 가사를 얹는 작업이 특히 직접적인 적용 대상이 될 수 있다.

물론 이번 연구는 13시간 분량의 영어 데이터로 검증된 초기 단계 결과이며, 상업 음원의 품질 기준을 충족할지는 두고 볼 필요가 있다. 가수의 목소리를 본인이 부르지 않은 가사에 입히는 기술인 만큼, 목소리 권리와 동의 문제를 어떻게 정리할지도 기술 발전과 별개로 남는 과제다. 분명한 것은 노래에서 '녹음된 것은 고칠 수 없다'는 전제가 흔들리기 시작했다는 점이다. 말소리 편집이 몇 년 사이 팟캐스트와 영상 제작의 표준 도구가 된 것처럼, 노래 편집이 음악 작업의 기본 기능으로 자리 잡을지 지켜볼 만하다.

FAQ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)

Q1. 멜로디싱어는 어떤 기술인가요?

A1. 멜로디싱어(MeloDISinger)는 카이스트 연구진이 개발한 노래 가사 편집 AI입니다. 이미 녹음된 노래에서 멜로디와 전체 길이는 그대로 유지하면서, 가사 텍스트만 고치면 바뀐 부분을 AI가 새로 노래해 원곡에 이어 붙여 줍니다.

Q2. 원곡 가수가 직접 다시 부르지 않아도 되나요?

A2. 네, 재녹음이 필요 없습니다. AI가 원곡에서 가수의 음색과 실제로 부른 음정 정보를 추출한 뒤, 바뀐 가사 구간만 그 목소리와 멜로디에 맞춰 새로 생성합니다. 수정하지 않은 구간은 원본 녹음이 그대로 유지됩니다.

Q3. 지금 바로 상용 서비스로 쓸 수 있나요?

A3. 아직은 연구 단계입니다. 영어 노래 13시간, 가수 3명분 데이터로 성능이 검증됐으며, 한국어 등 다른 언어와 상업 음원 수준의 녹음 환경에서의 성능은 추가 검증이 필요합니다. 데모 샘플은 연구진이 공개한 웹페이지에서 들어볼 수 있습니다.

기사에 인용된 리포트 원문은 arXiv에서 확인할 수 있다.

관련기사

리포트명: MeloDISinger: Melody-Aware & Duration-Preserving Singing Voice Editing with Audio Infilling

■ 이 기사는 AI 전문 매체 ‘AI 매터스’와 제휴를 통해 제공됩니다. 기사는 클로드 3.5 소네트와 챗GPT를 활용해 작성되었습니다. (☞ 기사 원문 바로가기)