NVIDIA open-source Kumo Tabular pour données tabulaires
NVIDIA a publié Kumo Tabular, un modèle fondamental open source dédié aux données tabulaires, désormais disponible sur Hugging Face et GitHub sous licence OpenMDW-1.1 autorisant l'usage commercial. Ce modèle prédit les étiquettes de nouvelles lignes en un seul passage direct, sans formation, ajustement de paramètres ni ingénierie des fonctionnalités. Il s'inscrit dans une évolution majeure pour l'apprentissage automatique d'entreprise, remplaçant progressivement les workflows traditionnels par un apprentissage in-context, similaire à celui des grands modèles de langage, où l'intelligence provient de la lecture du contexte plutôt que d'une réoptimisation continue. Conçu comme un transformateur adapté à la structure des tableaux, Kumo Tabular combine trois mécanismes d'attention : colonne, ligne et contexte. Il encode les valeurs numériques et catégorielles via des transformations de Fourier, neutralise automatiquement les valeurs manquantes et applique une température d'attention dynamique pour préserver sa précision sur de vastes ensembles. Disponible en trois tailles, de 28 à 215 millions de paramètres, il s'exécute via une nouvelle bibliothèque native GPU dédiée aux données structurées, récemment ouverte par NVIDIA. L'entraînement repose exclusivement sur des données synthétiques générées procéduralement à partir de modèles causaux structurels. NVIDIA a produit des millions de tableaux simulés intégrant des imperfections réalistes : valeurs manquantes, caractéristiques agrégées, niveaux catégoriels multiples et cibles à distributions asymétriques. Cette méthode permet au modèle d'absorber le bruit et la complexité sans pré-nettoyage manuel, offrant une alternative plus fluide aux arbres de décision en gradient boosting, qui exigent un recyclage complet à chaque nouvelle problématique métier. Sur le plan des performances, Kumo Tabular domine plusieurs benchmarks majeurs. Il atteint la première place sur TabArena, BeyondArena, TALENT et ScoringBench, avec un Elo de 1950 sur TabArena. Sa vitesse d'exécution est dix-sept fois supérieure à celle de LimiX-2 dans un environnement de test unifié, plaçant l'ensemble de ses versions sur le front optimal entre précision et efficacité computationnelle. La bibliothèque intègre également un mécanisme de correction d'erreur permettant de dépasser la limite native de dix classes. Certaines limites subsistent : le modèle ne prend en charge nativement que les colonnes numériques et catégorielles, les textes, images ou dates nécessitant un prétraitement préalable. Sa fiabilité peut décroître face à des données hors distribution ou à des structures tabulaires radicalement différentes de celles observées lors de l'entraînement. NVIDIA recommande par conséquent une validation méthodique avant tout déploiement en production. En délestant les équipes des étapes répétitives de préparation et d'optimisation, Kumo Tabular positionne la prédiction tabulaire comme une composante standardisée, rapide et directement exploitable par les entreprises.
