Command Palette
Search for a command to run...
WIT-Bild-Text-Datensatz
Datum
Größe
Veröffentlichungs-URL
Paper-URL
Lizenz
Other

WIT steht für Wikipedia-based Image Text, einen großen multimodalen und mehrsprachigen Datensatz. Der Datensatz besteht aus einer kuratierten Sammlung von 37,6 Millionen mit Entitäten angereicherten Bild-Text-Beispielen, die 11,5 Millionen einzigartige Bilder in 108 Wikipedia-Sprachen enthalten. Aufgrund seiner Größe eignet sich dieser Datensatz zur Verwendung als Vortrainingsdatensatz für multimodale Modelle des maschinellen Lernens. WIT bietet vier einzigartige Vorteile:
- WIT ist der größte multimodale Datensatz im Hinblick auf die Anzahl der Bild-Text-Beispiele.
- Es werden über 100 Sprachen abgedeckt (mit mindestens 12.000 Beispielen pro Sprache) und für viele Bilder wird ein sprachübergreifender Text bereitgestellt.
- Im Vergleich zu früheren Datensätzen stellt WIT einen vielfältigeren Satz von Konzepten und realen Entitäten dar.
- WIT bietet einen sehr anspruchsvollen Testsatz für die reale Welt.
Zitat
@inproceedings{10.1145/3404835.3463257, Autor = {Srinivasan, Krishna und Raman, Karthik und Chen, Jiecao und Bendersky, Michael und Najork, Marc}, title = {WIT: Wikipedia-basierter Bild-Text-Datensatz für multimodales mehrsprachiges maschinelles Lernen}, Jahr = {2021}, ISBN = {9781450380379}, Herausgeber = {Association for Computing Machinery}, Adresse = {New York, NY, USA}, url = {https://doi.org/10.1145/3404835.3463257}, doi = {10.1145/3404835.3463257}, Buchtitel = {Proceedings der 44. Internationalen ACM SIGIR-Konferenz über Forschung und Entwicklung im Bereich Information Retrieval}, Seiten = {2443–2449}, numpages = {7}, Schlüsselwörter = {Datensatz, multimodal, maschinelles Lernen, Wikipedia, mehrsprachig, Bild-Text-Abruf, neuronale Netze}, Ort = {Virtuelle Veranstaltung, Kanada}, Serie = {SIGIR '21} }
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.