메타, 실시간 음성 인식 모델 '뮤즈 보이스 트랜스크라이브' 출시...단어 오류율 1위 달성
메타가 실시간 음성 인식과 화자 분리, 발화 종료 감지를 하나의 모델에서 처리하는 새로운 음성 AI 모델 '뮤즈 보이스 트랜스크라이브'를 공개했다. 이 모델은 단어 오류율 3.1%를 기록하며 스트리밍 음성 인식 벤치마크 1위를 달성했으며, 80밀리초 단위로 속도와 정확도를 스스로 조절하는 '적응형 지연' 기술을 적용했다. 20명 이상의 화자 분리와 1시간 이상의 오디오 처리, 다국어 지원 등을 특징으로 하며, 메타 AI와 코딩 AI에 활용될 예정이다.