Command Palette
Search for a command to run...
AF-Chat 音声会話テキスト データセット
AF-Chatは、NVIDIAが2025年にリリースした音声会話テキストデータセットです。関連する論文の結果は次のとおりです。Audio Flamingo 3: 完全にオープンな大規模音声言語モデルによる音声インテリジェンスの進化対話生成モデルのトレーニングと評価を目的としています。 このデータセットには、約75,000件のマルチターン、マルチオーディオ対話(平均4.6セグメント、6.2ラウンド、範囲2~8セグメント、2~10ラウンド)が含まれており、音声、環境音、音楽が収録されています。データセットは、各オーディオのソースデータセットに基づいて、複数のサブセット(サウンド、ミュージック4ALL、100万曲データセット)に分割されており、音声ファイル自体は提供されておらず、テキストによる質問と回答のアノテーションのみが提供されています。
引用
@misc{ghoshaudioflamingonext,
title={Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music},
author={Sreyan Ghosh and Arushi Goel and Kaousheik Jayakumar and Lasha Koroshinadze and Nishit Anand and Zhifeng Kong and Siddharth Gururani and Sang-gil Lee and Jaehyeon Kim and Aya Aljafari and Chao-Han Huck Yang and Sungwon Kim and Ramani Duraiswami and Dinesh Manocha and Mohammad Shoeybi, Bryan Catanzaro and Ming-Yu Liu and Wei Ping},
year={2026},
eprint={},
archivePrefix={arXiv},
primaryClass={cs.SD},
url={},
}