Command Palette
Search for a command to run...
MeetingBank-LLMCompressed 数据集 D'entraînement À La Compression De Comptes Rendus De Réunion
Date
URL du document
Licence
Other
MeetingBank-LLMCompressed est un ensemble de données publié par Microsoft en 2024, conçu pour construire les données d'entraînement du compresseur LLMLingua-2. Le document de recherche associé est « LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression », visant à fournir des échantillons d'entraînement pour la compression de prompts indépendante de la tâche, efficace et fidèle au sens original.
Cet ensemble de données contient 5 169 échantillons issus de l'ensemble d'entraînement de MeetingBank. Chaque échantillon comprend le texte original des procès-verbaux de réunion ainsi que sa version compressée par blocs indépendants via GPT-4, avec une taille totale d'environ 246 Mo.
Composition de l'ensemble de données
Cet ensemble de données comprend les 6 champs suivants :
- idx : numéro d'index de l'instance
- prompt : texte original des procès-verbaux de réunion
- prompt_list : liste des blocs de texte originaux correspondant au prompt
- compressed_prompt_list : liste des textes compressés indépendamment par GPT-4 pour chaque bloc
- compressed_prompt : texte compressé complet obtenu en concaténant tous les blocs compressés
- summary : résumé des procès-verbaux de réunion provenant de MeetingBank
Citation
@inproceedings{pan2024llmlingua2,
title={LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression},
author={Zhuoshi Pan and Qianhui Wu and Huiqiang Jiang and Menglin Xia and Xufang Luo and Jue Zhang and Qingwei Lin and Victor Rühle and Yuqing Yang and Chin-Yew Lin and H. Vicky Zhao and Lili Qiu and Dongmei Zhang},
year={2024},
booktitle = {Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics},
publisher = {Association for Computational Linguistics}
}
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.