HyperAI
Command Palette
Search for a command to run...
MeetingBank-LLMCompressed 会議記録圧縮トレーニングデータセット
MeetingBank-LLMCompressed は、Microsoft が 2024 年に公開した、LLMLingua-2 圧縮器のトレーニングデータを構築するためのデータセットであり、関連する論文成果は「LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression」です。効率的かつ元の意図に忠実なタスク非依存型プロンプト圧縮トレーニングサンプルを提供することを目的としています。
このデータセットには、MeetingBank トレーニングセットからの 5,169 件のサンプルが含まれており、各サンプルには元の会議記録テキストと、GPT-4 によって独立してチャンク単位で圧縮されたバージョンが含まれています。データ規模は約 246 MB です。
データセット構成
このデータセットには、以下の 6 つのフィールドが含まれています:
- idx: インスタンスのインデックス番号
- prompt: 会議記録の元のテキスト
- prompt_list: prompt に対応する元のテキストのチャンクリスト
- compressed_prompt_list: 各チャンクを GPT-4 で独立して圧縮したテキストのリスト
- compressed_prompt: すべての圧縮チャンクを連結した完全な圧縮テキスト
- summary: MeetingBank からの会議記録の要約
Citation
@inproceedings{pan2024llmlingua2,
title={LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression},
author={Zhuoshi Pan and Qianhui Wu and Huiqiang Jiang and Menglin Xia and Xufang Luo and Jue Zhang and Qingwei Lin and Victor Rühle and Yuqing Yang and Chin-Yew Lin and H. Vicky Zhao and Lili Qiu and Dongmei Zhang},
year={2024},
booktitle = {Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics},
publisher = {Association for Computational Linguistics}
}
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。