Command Palette
Search for a command to run...
MeetingBank-LLMCompressed مجموعة بيانات تدريب ضغط محاضر الاجتماعات
التاريخ
رابط الورقة البحثية
الترخيص
Other
MeetingBank-LLMCompressed هو مجموعة بيانات أصدرتها Microsoft في عام 2024 لبناء بيانات تدريب لضاغط LLMLingua-2، وتُعرض النتائج البحثية ذات الصلة في ورقة بعنوان «LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression»، وتهدف إلى توفير عينات تدريب فعالة وموالية للمعنى الأصلي لضغط المطالبات المستقلة عن المهمة.
تحتوي مجموعة البيانات هذه على 5,169 عينة من مجموعة تدريب MeetingBank، وتتضمن كل عينة نص محضر الاجتماع الأصلي ونسخته المضغوطة بشكل مستقل عبر GPT-4، ويبلغ حجم البيانات حوالي 246 ميجابايت.
تكوين مجموعة البيانات
تحتوي مجموعة البيانات هذه على الحقول الستة التالية:
- idx: رقم فهرس المثيل
- prompt: النص الأصلي لمحضر الاجتماع
- prompt_list: قائمة تقسيم النص الأصلي المقابلة لـ prompt
- compressed_prompt_list: قائمة النصوص المضغوطة بشكل مستقل لكل تقسيم عبر GPT-4
- compressed_prompt: النص المضغوط الكامل الناتج عن دمج جميع التقسيمات المضغوطة
- summary: ملخص محضر الاجتماع من MeetingBank
Citation
@inproceedings{pan2024llmlingua2,
title={LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression},
author={Zhuoshi Pan and Qianhui Wu and Huiqiang Jiang and Menglin Xia and Xufang Luo and Jue Zhang and Qingwei Lin and Victor Rühle and Yuqing Yang and Chin-Yew Lin and H. Vicky Zhao and Lili Qiu and Dongmei Zhang},
year={2024},
booktitle = {Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics},
publisher = {Association for Computational Linguistics}
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.