알리바바가 음성 인식, 합성 및 실시간 상호작용을 맡는 Qwen Audio 3.1 모델 5종을 발표했다. ASR은 다국어와 방언 인식 및 군더더기 정리를, ASR-Next는 화자별 시간 정보와 감정 및 주변 소리 탐지를 제공한다. TTS는 언어 간 음색 이전과 지시문 기반 스타일 제어를, TTS-Next는 음성 및 효과음의 통합 생성을 지원한다. 실시간 모델은 동시 듣기와 말하기, 즉시 중단을 내세운다. 요금 인하 폭은 TTS 약 70%, 실시간 약 85%, ASR 최대 95%로 서로 다르며 실제 정확도와 지연은 서비스 조건에서 확인해야 한다.
Tech로 돌아가기
Tech
Qwen Audio 3.1, 음성 모델 5종과 요금 인하 발표
인식과 합성 및 실시간 대화의 기능이 다르며 최대 할인율을 모든 모델의 동일한 절감으로 해석하면 안 됩니다.