HyperAIHyperAI

Command Palette

Search for a command to run...

NVIDIA Kumo Tabular führt bei tabellarischer Vorhersage

NVIDIA hat mit Kumo Tabular ein offenes Grundlagendatenmodell für tabellarische Daten veröffentlicht, das einen neuen Maßstab in Genauigkeit und Effizienz setzt. Als Teil der NVIDIA Kumo Structured Sammlung ist das Modell nun über Hugging Face und GitHub sowie über eine neue GPU-native Bibliothek verfügbar. Kumo Tabular ermöglicht Vorhersagen für Klassifikation und Regression in einem einzigen Vorwärtsschritt, ohne dass zusätzliches Training, Feinabstimmung oder manuelles Feature-Engineering erforderlich sind. Das Modell basiert auf einer Transformatorarchitektur, die speziell für die Struktur tabellarischer Daten konzipiert wurde. Durch kombinierte Zell-, Zeilen- und In-Context-Aufmerksamkeitsmechanismen erfasst Kumo Tabular nicht nur den Kontext einzelner Zellen und Spalten, sondern erkennt auch komplexe Interaktionen zwischen Features. Fehlende Werte werden nativ verarbeitet, ohne Imputation zu erfordern. Zur Stabilisierung bei wachsenden Tabellengrößen kommt ein längenadaptierter Aufmerksamkeits-Temperaturansatz zum Einsatz, der die Attention-Matrix bei steigenden Kontextlängen scharf hält. Das Modell ist in drei Größen verfügbar, die zwischen 28 Millionen und 215 Millionen Parametern liegen. Für das Pretraining wurde ausschließlich auf künstlich erzeugte Daten zurückgegriffen, die mittels Struktureller Kausalmodelle generiert werden. Dieser prozedurale Ansatz erzeugt unendlich viele realistische Datensätze mit natürlichen Imperfektionen wie fehlenden Werten, verrauschten Labels oder verteilten Ausreißern, wodurch das Modell robust gegen unstrukturierte reale Daten trainiert wird. Die Bewertung auf führenden Benchmarks wie TabArena, BeyondArena, TALENT und ScoringBench bestätigt die führende Position. Kumo Tabular schlägt sowohl manuell optimierte Gradient-Boosting-Bäume als auch moderne AutoML- und Foundation-Modelle und bietet dabei bis zu 17-mal höhere Inference-Geschwindigkeiten unter einheitlichen Hardwarebedingungen. Veröffentlicht unter der kommerziell nutzbaren OpenMDW-1.1-Lizenz, lässt sich das Modell direkt über die neu vorgestellte sdm-Bibliothek integrieren. Entwickler können Tabellendaten nahtlos von pandas-DataFrames in CUDA-taugliche Tensorstrukturen konvertieren und Vorhersagen generieren. Die aktuelle Implementierung unterstützt primär numerische und kategoriale Spalten, wobei Text, Bilder oder Zeitstempel über vordefinierte Vorkonfigurations-Pipelines extrahiert werden müssen. Bei starken Datendrifts oder Daten außerhalb des Trainingsbereichs kann die Prognosegenauigkeit variieren, weshalb eine lokale Validierung vor Produktionsfreigabe empfohlen wird. Mit Kumo Tabular schließt NVIDIA eine signifikante Lücke im enterprise-Maschinenlernen und bietet Unternehmen eine skalierbare, trainingssparende Alternative zu herkömmlichen tabellarischen Predictive-Modeling-Pipelines.

Verwandte Links