Command Palette
Search for a command to run...
CLaRa: الاسترجاع المعزز بالتوليد والاستدلال الكامن المستمر
التاريخ
رابط الورقة البحثية
الترخيص
MIT
نظرة عامة على مجموعة البيانات
تم إصدار مجموعة بيانات الاستدلال المتسلسل للمتغيرات الكامنة CLaRa بواسطة شركة أبل في عام 2025، وهي مخصصة للاسترجاع المعزز للتوليد والاستدلال بالمتغيرات الكامنة المستمرة. النتائج البحثية ذات الصلة منشورة في «CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning»، وتهدف المجموعة إلى توفير بيانات التدريب والتقييم لدعم قدرة النماذج على الإجابة عن الأسئلة ضمن تمثيلات الوثائق المضغوطة.
تحتوي هذه المجموعة على ثلاثة فئات رئيسية من البيانات: ما قبل التدريب، والضبط الدقيق بالتوجيهات، والضبط الدقيق الشامل (من البداية للنهاية)، حيث تغطي مجموعات البناء والتقييم لمعايير متعددة شائعة الاستخدام للإجابة عن الأسئلة مثل 2WikiMultihopQA وHotpotQA وMuSiQue وNatural Questions. تتميز بحجم كبير يتراوح بين 10 جيجابايت و100 جيجابايت، وبصيغة قياسية موحدة هي JSONL، وتدعم وثائق الحالة المثالية (التي تحتوي على إجابات صحيحة معروفة) وسيناريوهات الاسترجاع العادية، مما يجعلها مناسبة لأبحاث الاسترجاع المعزز للتوليد (RAG)، وضغط الوثائق، ومهام الإجابة عن الأسئلة المعقدة.
تكوين مجموعة البيانات
تتكون المجموعة بشكل أساسي من الأقسام الثلاثة التالية، ويتم تخزين جميع البيانات بصيغة JSONL:
بيانات ما قبل التدريب (Pretraining)
بيانات تُستخدم لتعلم مُضغط الوثائق. تتضمن الحقول التالية:
data_type: نوع البيانات (مثل qa)question: قائمة بالاستفساراتanswers: قائمة بالإجاباتdocs: قائمة بوثائق السياق
بيانات الضبط الدقيق (Fine-Tuning Data)
بيانات ضبط دقيق توجيهي تُستخدم للتدريب على الإجابة عن الأسئلة بناءً على تمثيل الوثائق المضغوطة. تتضمن الحقول التالية:
question: نص الاستعلامdocs: قائمة بالوثائج المسترجعةgold_answer: الإجابة القياسية المرجعيةanswer: الإجابة المُولَّدة من النموذج
بالإضافة إلى ذلك، توجد مجموعات تقييم خاصة بمختلف معايير الاختبار (2wiki, hotpotqa, musique, nq)، مقسمة إلى إعداد يحتوي على وثائق حالة مثالية (Oracle) ويُرمز له بـ (inst_eval_*_with_pos) وإعداد عادي يُرمز له بـ (inst_eval_*_no_pos).
بيانات الضبط الدقيق الشامل (End-to-End Tuning Data): بيانات للعملية الكاملة الخاصة بتدريب نموذج شامل من البداية للنهاية. تتضمن الحقول التالية:
question: نص الاستعلامanswer: نص الإجابةdocs: قائمة بالوثائج المسترجعةpos_index: فهرس الوثيقة المثالية داخل قائمة الـdocs
تنقسم أيضاً إلى مجموعات تدريب وتقييم، وتتوفر لإصدارات مختلفة من معايير الاختبار (ours_2wiki, ours_hotpotqa, ours_musique, ours_nq) بإعدادين اثنين: واحد يتضمن وثائق حالة مثالية (with_pos) وآخر لا يتضمنها (no_pos).
مثال على مجموعة البيانات
الاقتباس العلمي
@misc{he2025clarabridgingretrievalgeneration,
title={CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning},
author={Jie He and Richard He Bai and Sinead Williamson and Jeff Z. Pan and Navdeep Jaitly and Yizhe Zhang},
year={2025},
eprint={2511.18659},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2511.18659},
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.