HyperAI
Command Palette
Search for a command to run...
GLOBE_V2 전 세계 억양 영어 음성 데이터셋
GLOBE 데이터셋은 2024년에 공개된 고품질 영어 음성 코퍼스이며, 관련 논문 결과는 GLOBE: A High-quality English Corpus with Global Accents for Zero-shot Speaker Adaptive Text-to-Speech에 실렸습니다. 이 데이터셋은 제로샷 화자 적응형 텍스트-음성 변환(TTS) 시스템의 악화 화자에 대한 일반화 성능이 낮다는 문제를 해결하는 것을 목표로 합니다.
해당 데이터셋은 초당 샘플링률 24kHz인 총 535시간 분량의 음성을 포함하며, 전 세계 164개 지역의 억양을 가진 23,519명의 화자에게서 수집되었습니다. 또한 상세한 화자 메타데이터도 제공됩니다. GLOBE_V2는 여기에 초당 샘플링률 44.1kHz 오디오를 추가하고, 볼륨 이상 또는 오디오와 텍스트 정렬 문제가 있는 약 5%의 샘플을 제거하여 데이터 품질을 더욱 향상시켰습니다.
인용문헌
@misc{wang2024globe,
title={GLOBE: A High-quality English Corpus with Global Accents for Zero-shot Speaker Adaptive Text-to-Speech},
author={Wenbin Wang and Yang Song and Sanjay Jha},
year={2024},
eprint={2406.14875},
archivePrefix={arXiv},
}
이 데이터셋은 커뮤니티 사용자가 기여한 것이며 교육 및 정보 제공 목적으로만 사용됩니다. 저작권 침해와 관련된 콘텐츠가 있는 경우 [email protected]로 문의하시면 신속하게 검토 및 삭제 처리하겠습니다.