Command Palette
Search for a command to run...
Globales Akzent-Englisch-Sprachdatensatz GLOBE_V2
Das GLOBE-Datenset ist ein hochwertiges englisches Sprachkorpus, das im Jahr 2024 veröffentlicht wurde; die zugehörige wissenschaftliche Veröffentlichung lautet GLOBE: A High-quality English Corpus with Global Accents for Zero-shot Speaker Adaptive Text-to-Speech, und es zielt darauf ab, das Problem der schlechten Generalisierungsfähigkeit von Zero-Shot-Talk-Systemen für Sprecher mit Akzenten zu lösen.
Der Datensatz umfasst 535 Stunden an Sprachdaten mit einer Abtastrate von 24 kHz, stammend aus den Stimmen von 23.519 Sprechern, wobei weltweit 164 verschiedene Akzente abgedeckt werden. Zudem liegen detaillierte Metadaten zu jedem Sprecher vor. Die Version GLOBE_V2 bietet darüber hinaus Audio mit einer Abtastrate von 44,1 kHz und entfernt etwa 5 % der Proben, bei denen Probleme wie anomale Lautstärken oder Fehlausrichtungen zwischen Audio und Transkript vorlagen, was die Datenqualität weiter steigert.
Zitation
@misc{wang2024globe,
title={GLOBE: A High-quality English Corpus with Global Accents for Zero-shot Speaker Adaptive Text-to-Speech},
author={Wenbin Wang and Yang Song and Sanjay Jha},
year={2024},
eprint={2406.14875},
archivePrefix={arXiv},
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.