메타 슈퍼인텔리전스 랩스가 스트리밍 전사, 엔드포인트 감지, 20명 이상 화자 구분을 결합한 오디오 인식 모델 '뮤즈 보이스 트랜스크라이브'를 공개했다. 처리 오디오 시간당 0.18달러의 API 가격을 책정했으며, 1시간 넘는 긴 오디오, 다국어 코드 스위칭, 언어·키워드 바이어싱, 별도 후처리 없는 화자 분리를 지원하고 70개 이상 언어로 학습돼 이 중 25개 언어가 우선 검증됐다. 스피치매틱스(최대 100명)나 아마존 트랜스크라이브(최대 30명) 등 경쟁 서비스와 비교하면 화자 수 상한 자체는 최고는 아니지만, 저지연 전사와 강력한 화자 분리, 공격적인 가격을 한 모델에 결합한 점이 특징이다.
투자 금액·기업가치는 원문에 적힌 표기를 그대로 옮겼으며 통화를 환산하지 않았습니다. 이 색인은 투자 자문이 아닙니다. 표지 사진은 기사 속 기업·인물이 아니라 분야 이미지입니다.




