HyperAI
Command Palette
Search for a command to run...
LCCC 大規模でクリーンな中国語会話コーパス
LCCC(正式名称:Large-scale Cleaned Chinese Conversation corpus)は、2020 年に清華大学とサムスン中国研究所によってリリースされました。 データセットは主に、LCCC ベース (680 万会話) と LCCC 大 (1,200 万会話) の 2 つの部分で構成されます。研究チームは、このデータセット内の対話データの品質を確保するために、厳密なデータ フィルタリング プロセスを設計しました。このデータセットは、一連のルールと、手動で注釈が付けられた 110,000 の対話ペアでトレーニングされた分類器に基づいて構築されました。研究チームがフィルタリングしたノイズには、汚い言葉、特殊文字、顔文字、文法的な文章、無関係な会話などが含まれます。クリーンなデータセットと事前トレーニングされたモデルにより、短いテキストの対話モデリングの研究が容易になります。
引用
データセットやモデルを研究にご利用になる場合は、ぜひ当研究室の論文(https://arxiv.org/abs/2008.03946)を引用してください。 @inproceedings{wang2020chinese, タイトル={大規模な中国語短文会話データセット}、 author={ワン、イーダとケ、ペイとジェン、インヘとファン、カイリとジャン、ヨンとジュー、シャオヤンとファン、ミンリー} 書籍タイトル={NLPCC}、 年={2020}、 url={https://arxiv.org/abs/2008.03946} }
LCCC.torrent
シード中 1ダウンロード中 0完了 387総ダウンロード数 626
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。