Command Palette
Search for a command to run...
Microsoft Research Sequential Question Answering マイクロソフト研究順序質問応答データセット
Microsoft Research Sequential Question Answering は、Microsoft Research が2017年に公開した、順次質問応答タスク向けのデータセットであり、より自然な対話型質問応答シナリオを探求し、従来の意味解析における過度に複雑で不自然な長い質問の問題を解決することを目的としています。
このデータセットには17,553の質問が含まれており、6,066のシーケンスに分かれています。各質問には、テーブル内のセル位置が回答として関連付けられています。 データはWikiTableQuestionsデータセットに基づいており、クラウドソーシングワーカーが元の質問を分解して生成しました。
データセット構成
データセットは以下の3つの部分に分かれています:
- トレーニングセット(train):12,276サンプル。
- 検証セット(validation):2,265サンプル。
- テストセット(test):3,012サンプル。
各サンプルには主に以下のフィールドが含まれています:
- id:質問シーケンスの一意の識別子。
- annotator:アノテーター識別子。
- position:シーケンス内での質問の位置。
- question:質問テキスト。
- table_file:関連するテーブルファイル。
- table_header:テーブルの列名。
- table_data:テーブルデータ。2次元配列形式で格納。
- answer_coordinates:回答が存在するセルの行と列の座標。
- answer_text:回答のテキスト内容。
Citation```bibtex
@inproceedings{iyyer-etal-2017-search, title = "Search-based Neural Structured Learning for Sequential Question Answering", author = "Iyyer, Mohit and Yih, Wen-tau and Chang, Ming-Wei", booktitle = "Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)", month = jul, year = "2017", address = "Vancouver, Canada", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/P17-1167", doi = "10.18653/v1/P17-1167", pages = "1821--1831", }