HyperAIHyperAI

Command Palette

Search for a command to run...

MeetingBank-LLMCompressed 会議記録圧縮トレーニングデータセット

日付

データセット構成

Microsoft Corporation

Paper URL

2403.12968

ライセンス

Other

MeetingBank-LLMCompressed は、Microsoft が 2024 年に公開した、LLMLingua-2 圧縮器のトレーニングデータを構築するためのデータセットであり、関連する論文成果は「LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression」です。効率的かつ元の意図に忠実なタスク非依存型プロンプト圧縮トレーニングサンプルを提供することを目的としています。

このデータセットには、MeetingBank トレーニングセットからの 5,169 件のサンプルが含まれており、各サンプルには元の会議記録テキストと、GPT-4 によって独立してチャンク単位で圧縮されたバージョンが含まれています。データ規模は約 246 MB です。

データセット構成

このデータセットには、以下の 6 つのフィールドが含まれています:

  1. idx: インスタンスのインデックス番号
  2. prompt: 会議記録の元のテキスト
  3. prompt_list: prompt に対応する元のテキストのチャンクリスト
  4. compressed_prompt_list: 各チャンクを GPT-4 で独立して圧縮したテキストのリスト
  5. compressed_prompt: すべての圧縮チャンクを連結した完全な圧縮テキスト
  6. summary: MeetingBank からの会議記録の要約

Citation

@inproceedings{pan2024llmlingua2,
    title={LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression},
    author={Zhuoshi Pan and Qianhui Wu and Huiqiang Jiang and Menglin Xia and Xufang Luo and Jue Zhang and Qingwei Lin and Victor Rühle and Yuqing Yang and Chin-Yew Lin and H. Vicky Zhao and Lili Qiu and Dongmei Zhang},
    year={2024},
    booktitle = {Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics},
    publisher = {Association for Computational Linguistics}
}

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています