NeoMME vereint Text und Bilder im effizienten Encoder
Die Entwickler Aurélien Lac und Tony Wu von H Company haben NeoMME vorgestellt, eine neue Familie von 260 und 800 Millionen Parametern schweren multimodalen und mehrsprachigen Encoder-Modellen. Im Gegensatz zu gängigen generativen visuellen Sprachmodellen verzichtet NeoMME vollständig auf einen separaten, vorab trainierten Vision-Tower oder einen kausalen Decoder. Stattdessen verarbeitet ein einziger bidirektionaler Transformer Text-Token und rohe Bild-Patches gemeinsam. Das Modell wurde von Grund auf mit einem maskierten diskret-diffusiven Trainingsziel optimiert und integriert moderne Architekturelemente wie Grouped-Query Attention, 2D-Rotary-Position-Embeddings sowie eine Kontextlänge von 16.384 Token, was die Verarbeitung hochauflösender Dokumentenseiten ohne Qualitätsverlust ermöglicht. Für praktische Anwendungen wurde NeoMME zum NeoMME-Retriever weiterentwickelt, der speziell für die visuelle Dokumentensuche trainiert wurde. Durch die direkte Verarbeitung ganter PDF-Seiten als Bilder entfällt der fehleranfällige OCR-Vorverarbeitungsschritt, was Layouts, Tabellen und Grafiken besser erhält. Auf dem ViDoRe-v3-Benchmark erreicht der kleinere NeoMME-260M-Checker die höchsten nDCG@10-Werte aller Modelle unter 800 Millionen Parametern und übertrifft dabei etablierte Referenzarchitekturen bei deutlich geringerer Komplexität. Auf einer NVIDIA-L40S-Grafikkarte kodiert NeoMME bei einer Eingabegröße von 2048 mal 2048 Pixeln etwa 51 Seiten pro Sekunde, was einer Verdopplung der Durchsatzrate gegenüber dem Vergleichsmodell ColModernVBERT entspricht. Ein wesentlicher Innovationsschritt betrifft die Speicherung hochauflösender Späte-Interaktion-Embeddings. Durch die Kombination aus hierarchischem Token-Pooling und asymmetrischer Quantisierung lässt sich der Speicherplatz pro Dokumentseite von etwa 1,5 Megabyte auf 6 Kilobyte reduzieren. Diese massive Komprimierung um den Faktor 255 geht mit einem Qualitätsverlust von weniger als fünf Prozent einher. Der NeoMME-Retriever liefert in einem einzigen Forward-Pass sowohl dichte als auch späte-Interaktion-Embeddings, was eine flexible Anpassung an unterschiedliche Infrastruktur- und Skalierungsanforderungen ermöglicht. NeoMME ist ab sofort über Hugging Face Transformers und Sentence Transformers nutzbar. Die vollständigen Modell-Checkpoints werden unter der Apache-2.0-Lizenz veröffentlicht. Durch die effiziente Architektur und die hohe Rechengeschwindigkeit positioniert sich NeoMME als ideale Basis für visuelle Retrieval-Augmented-Generation-Pipelines, bei denen Originaldokumente statt extrahierten Textes an visuelle Sprachmodelle übergeben werden. Die Veröffentlichung unterstützt die Forschung und Entwicklung an ressourcenschonenden, mehrsprachigen Repräsentationsmodellen für den praktischen Enterprise-Einsatz.
