Command Palette
Search for a command to run...
MMPR-Datensatz Für Multimodale Schlussfolgerungspräferenzen
Datum
Größe
Veröffentlichungs-URL
Paper-URL
MMPR (Multimodal Preference Dataset) ist ein umfangreicher multimodaler Präferenzdatensatz, der 2024 gemeinsam von den Forschungsteams des Shanghai Artificial Intelligence Laboratory, der Fudan University, der Nanjing University, der Chinese University of Hong Kong, der Tsinghua University und SenseTime veröffentlicht wurde. Die entsprechenden Ergebnisse der Studie sind „Verbesserung der Argumentationsfähigkeit multimodaler großer Sprachmodelle durch gemischte PräferenzoptimierungDer Datensatz enthält 750.000 Beispiele ohne eindeutige richtige Antworten und 2,5 Millionen Beispiele mit eindeutigen richtigen Antworten. Die Beispiele decken mehrere Bereiche ab, wie z. B. VQA, Naturwissenschaften, Grafik, Mathematik, OCR und Dokumente, um Vielfalt zu gewährleisten. Bei der Erstellung des Datensatzes achteten die Forscher besonders darauf, falsch positive und negative Antworten aufgrund der Einschränkungen heuristischer Regeln zu vermeiden, insbesondere in den allgemeinen VQA- und Dokumentdomänen. Der Datensatz wurde entwickelt, um die Leistung des Modells bei multimodalen Denkaufgaben zu verbessern und gleichzeitig potenzielle negative Effekte während des Trainings zu vermeiden.

Zitat
Falls Ihnen dieses Projekt für Ihre Forschung nützlich ist, erwägen Sie bitte, es zu zitieren: „`BibTeX @article{wang2024mpo, title={Verbesserung der Argumentationsfähigkeit multimodaler großer Sprachmodelle durch Optimierung gemischter Präferenzen}, Autor={Wang, Weiyun und Chen, Zhe und Wang, Wenhai und Cao, Yue und Liu, Yangzhou und Gao, Zhangwei und Zhu, Jinguo und Zhu, Xizhou und Lu, Lewei und Qiao, Yu und Dai, Jifeng} journal={arXiv preprint arXiv:2411.10442}, Jahr={2024} } @article{chen2023internvl, title={InternVL: Skalierung von Vision Foundation-Modellen und Ausrichtung für generische visuell-linguistische Aufgaben}, Autor={Chen, Zhe und Wu, Jiannan und Wang, Wenhai und Su, Weijie und Chen, Guo und Xing, Sen und Zhong, Muyan und Zhang, Qinglong und Zhu, Xizhou und Lu, Lewei und Li, Bin und Luo, Ping und Lu, Tong und Qiao, Yu und Dai, Jifeng} journal={arXiv preprint arXiv:2312.14238}, Jahr={2023} } @article{chen2024far, title={Wie weit sind wir von GPT-4V entfernt? Die Lücke zu kommerziellen multimodalen Modellen mit Open-Source-Suiten schließen}, Autoren: {Chen, Zhe und Wang, Weiyun und Tian, Hao und Ye, Shenglong und Gao, Zhangwei und Cui, Erfei und Tong, Wenwen und Hu, Kongzhi und Luo, Jiapeng und Ma, Zheng und andere} journal={arXiv preprint arXiv:2404.16821}, Jahr={2024} }
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.