01 Was passiert ist
NVIDIA hat Kumo-Tabular 1.0 veröffentlicht, ein Basismodell für Klassifikation und Regression mit Tabellendaten. Für Vorhersagen nutzt es gelabelte Kontextzeilen und ungelabelte Abfragezeilen mit denselben Spalten.
02 Die wichtigsten Details
- Laut NVIDIA gibt das Modell in einem einzigen Vorwärtsdurchlauf Klassenwahrscheinlichkeiten oder Zahlenprognosen aus. Aufgabenspezifisches Training, Gradientenupdates und die Abstimmung von Hyperparametern sind nicht nötig.
- Das Vortraining verwendete ausschließlich synthetische Tabellen, die mit strukturellen Kausalmodellen erzeugt wurden; reale Daten kamen dafür nicht zum Einsatz.
- Es gibt drei Größen: Small mit etwa 28 Millionen Parametern, Medium mit etwa 62 Millionen und Large mit etwa 215 Millionen. Für das Vortraining dienten jeweils etwa 35, 71 und 137 Millionen synthetische Tabellen.
- Die Modellkarte nennt Auswertungen mit TabArena-v0.1 (51 Datensätze), TALENT (300) und BeyondArena mit zufälligen, zeitlichen und gruppierten Aufteilungen. Die Suiten dienten nur der Auswertung; der Benchmark-Wert ist nicht veröffentlicht.
03 Warum das wichtig ist
Kumo-Tabular bietet Datenteams eine Möglichkeit, Vorhersagen aus Tabellen zu erstellen, ohne für jede Aufgabe ein eigenes Modell zu trainieren. Da NVIDIA keine Benchmark-Werte veröffentlicht, lässt sich die Auswertung nicht anhand veröffentlichter Zahlen vergleichen.
04 Für wen es relevant ist
Analysten, Ingenieure für maschinelles Lernen und Teams, die mit Tabellendaten arbeiten.