01 Ce qui s’est passé

NVIDIA a lancé Kumo-Tabular 1.0, un modèle de fondation pour la classification et la régression sur données tabulaires. Il utilise des lignes de contexte étiquetées et des lignes de requête non étiquetées avec les mêmes colonnes.

02 Les points essentiels

  • Selon NVIDIA, le modèle fournit des probabilités de classe ou des prédictions numériques en un seul passage avant, sans entraînement propre à une tâche, mise à jour des gradients ni réglage des hyperparamètres.
  • Le préentraînement a utilisé uniquement des tableaux synthétiques générés par des modèles causaux structurels ; aucune donnée réelle n’a été utilisée.
  • Trois tailles sont proposées : Small, avec environ 28 millions de paramètres, Medium, avec environ 62 millions, et Large, avec environ 215 millions. Elles ont été préentraînées respectivement sur environ 35, 71 et 137 millions de tableaux synthétiques.
  • La fiche mentionne des évaluations sur TabArena-v0.1 (51 jeux de données), TALENT (300) et BeyondArena, avec des découpages aléatoires, temporels et par groupes. Ces ensembles ont servi uniquement à l’évaluation ; le score n’est pas publié.

03 Pourquoi c’est important

Kumo-Tabular offre aux équipes de données une méthode pour produire des prédictions à partir de tableaux sans entraîner un modèle distinct pour chaque tâche. Faute de scores publiés par NVIDIA, les évaluations ne peuvent pas être comparées à partir de résultats chiffrés.

04 Pour qui c’est utile

Analystes, ingénieurs en apprentissage automatique et équipes travaillant avec des données tabulaires.

Source originaleNVIDIA