알리바바, 30개 언어 음성 인식 모델 공개…중국어 7대 방언과 20개 억양 지원

컴퓨팅입력 :2026/08/04 15:46

알리바바가 음성 인식 모델 큐원-오디오-3.0-ASR-플래시를 출시했다. 큐원클라우드 변경 이력에 적힌 API 출시일은 현지 시각 7월 30일이며, 알리바바 통이랩의 대외 공지와 관련 보도는 7월 31일 이뤄졌다.

모델은 실시간 스트리밍용, 오프라인 파일 전사용, 짧은 음성을 처리하는 오프라인용 세 가지다. 처리 가능한 길이도 각각 다르다. 스트리밍은 제한이 없고, 파일 전사는 최대 12시간에 2기가바이트까지, 단문용은 최대 5분이다.

지원 언어는 30개다. 중국어와 영어, 일본어, 한국어를 포함하며 베트남어와 태국어, 힌디어, 아랍어 등 아시아·유럽 언어가 들어간다. 중국어는 관화와 오, 상, 감, 객가, 민, 월 7대 방언군 전체와 20개 이상 지역 억양을 지원한다.

파일 전사 버전에는 화자 분리 기능이 들어갔다. 여러 사람이 말한 음성에서 누가 언제 말했는지 구분하는 기능이며, 큐원 계열 음성 인식 모델에서는 처음 적용됐다. 다만 화자 분리를 쓸 때는 2시간 이내 음성을 권장한다.

특정 단어의 인식률을 높이는 핫워드와 문맥 프롬프트도 함께 지원한다. 이전 세대인 큐원3-ASR-플래시는 두 기능을 모두 지원하지 않았다.

알리바바가 밝힌 자체 평가에서 의료 전문용어 재현율은 95.36%, IT 프로그래밍 용어는 91.87%다. 기업 전용 핫워드를 적용하면 대부분 99% 이상이라고 설명했다. 스트리밍 버전의 글자 출력 지연은 이론상 300밀리초이며 중국어 산업 현장 글자오류율은 7.80%, 영어는 11.52%다. 이 수치는 모두 알리바바 자체 발표이며 제3자 검증은 이뤄지지 않았다.

가중치는 공개되지 않았다. 알리바바 클라우드 바이롄 플랫폼과 큐원클라우드에서 API로만 제공된다. 오픈웨이트로 풀린 것은 이전 세대인 큐원3-ASR-0.6B와 1.7B다.

자세한 내용은 Qwen Cloud 에서 확인할 수 있다.

이미지 출처: 이디오그램 생성

관련기사

■ 이 기사는 AI 전문 매체 ‘AI 매터스’와 제휴를 통해 제공됩니다. 기사는 클로드 3.5 소네트와 챗GPT를 활용해 작성되었습니다. (☞ 기사 원문 바로가기)