HyperAIHyperAI

Command Palette

Search for a command to run...

NeoMME : encodeur multimodal natif et multilingue

Une équipe de chercheurs dirigée par Aurélien Lac et Tony Wu, soutenue par H Company, présente NeoMME, une nouvelle famille d'encodeurs multimodaux multilingues de 260 et 800 millions de paramètres. Dévoilée dans une publication académique en septembre 2026, l'architecture se distingue par son approche unifiée. Contrairement aux modèles actuels qui combinent un encodeur d'images pré-entraîné et un générateur de texte, NeoMME repose sur un seul Transformateur bidirectionnel. Ce noyau unique traite simultanément les tokens textuels et les patches d'images bruts sans alignement préalable. L'entraînement, réalisé entièrement depuis zéro, utilise un objectif de diffusion discrète masquée sur plus de 524 milliards de tokens, incluant du texte multilingue, du code, des mathématiques ainsi que des images naturelles et de documents. Pour valider les capacités du modèle, les créateurs ont développé NeoMME-Retriever, une version affinée spécifiquement pour la recherche documentaire visuelle. S'appuyant sur une approche qui traite les pages de documents comme des images, le système conserve les mises en page, graphiques et tableaux souvent perdus lors d'une transcription optique. Une seule passe du réseau fournit simultanément des représentations denses et des embeddings à interaction tardive, offrant une flexibilité adaptée à divers environnements informatiques. Sur le benchmark ViDoRe v3, le modèle de 260 millions de paramètres atteint un score de 0,523 en nDCG@10, se plaçant en tête des solutions inférieures à 800 millions de paramètres et approchant les performances de systèmes plus lourds. La variante de 800 millions de paramètres suit de près les modèles de référence tout en nécessitant nettement moins de ressources. L'efficacité computationnelle constitue un autre atout majeur. Sur un GPU NVIDIA L40S avec des images en 2048x2048 pixels, NeoMME-Retriever-260M traite environ cinquante et une pages par seconde, soit deux fois plus que ses concurrents directs. Pour pallier la taille élevée des embeddings à interaction tardive, les auteurs ont intégré un mécanisme de regroupement hiérarchique des tokens combiné à une quantification asymétrique. Cette optimisation réduit l'espace de stockage requis pour un document d'environ 1,5 mégaoctet à seulement 6 kilooctets, soit une division par deux cent cinquante-cinq, tout en préservant plus de quatre-vingt-quinze pour cent de la précision initiale. Les poids des deux architectures et leur implémentation pour Hugging Face Transformers sont publiés sous licence Apache 2.0. Cette ouverture permet aux ingénieurs de déployer rapidement des pipelines de recherche augmentée par génération visuelle. En récupérant les pages originales plutôt que du texte extrait, ces systèmes fournissent aux modèles de langage des éléments contextuels riches, améliorant la fiabilité des réponses générées. NeoMME marque ainsi une étape vers des encodeurs multimodaux plus légers, plus rapides et plus adaptés aux applications industrielles nécessitant une compréhension conjointe du texte et de l'image.

Liens associés