Tencent가 자연어 지시와 참조 오디오로 음성을 만들고 편집하는 AuK 모델을 공개했습니다. 제로샷 TTS와 내용 삽입 및 삭제, 음색과 감정 변경, 속도와 음높이 조절 및 음질 개선을 하나의 인터페이스로 처리합니다. 잘못 녹음한 단어만 고치는 작업도 목표로 합니다. 학습에 약 195만 시간의 오디오를 사용했다고 설명했지만 소개된 기능과 데이터 규모만으로 실제 작업의 품질을 보장할 수는 없으므로 이용 조건과 자체 녹음에서의 결과를 확인해야 합니다.
Tech로 돌아가기
Tech
Tencent AuK, 자연어 기반 음성 생성과 편집 통합
부분 대사 수정이 가능하지만 다양한 언어와 화자에서 품질이 동일하다고 보장된 것은 아닙니다.