Command Palette
Search for a command to run...
AudioSetCaps 오디오 자막 데이터 세트
이 데이터 세트는 2024년에 노스웨스턴 폴리테크닉 대학교, 시안 리안펑 음향기술 주식회사, 난양이공대학교, 서리대학교, 중국과학원 음향연구소의 연구원들에 의해 공개되었습니다.AudioSetCaps: 대규모 오디오 언어 모델을 사용한 강화된 오디오 캡션 데이터 세트 생성"이 NeurIPS 24에 게재되었습니다. AudioSetCaps는 6,117,099개의 10초 오디오 파일을 포함하는 오디오 캡션 데이터 세트입니다. 각 오디오 파일에는 설명적 제목과 3개의 Q&A 쌍이 메타데이터로 포함되어 최종 제목을 생성합니다(총 18,414,789쌍의 Q&A 데이터). 이 모델은 AudioSet, YouTube-8M, VGGSound의 세 가지 오디오 데이터세트에서 수집한 데이터를 사용하여 대규모 오디오 및 언어 모델의 자동 생성 파이프라인을 통해 만들어졌습니다.
소환
@article{bai2024audiosetcaps, 제목={AudioSetCaps: 대규모 오디오 및 언어 모델을 사용한 자동 생성 파이프라인을 통해 풍부해진 오디오 캡션 데이터 세트}, 작성자={Bai, Jisheng 및 Liu, Haohe 및 Wang, Mou 및 Shi, Dongyuan 및 Wang, Wenwu 및 Plumbley, Mark D 및 Gan, Woon-Seng 및 Chen, Jianfeng} 저널={arXiv 사전출판물 arXiv:2411.18953}, 연도={2024} }