01 Что произошло
NVIDIA выпустила Kumo-Tabular 1.0 — фундаментальную модель для классификации и регрессии по табличным данным. Для прогнозов она использует размеченные строки-контексты и неразмеченные строки-запросы с теми же столбцами.
02 Ключевые детали
- По описанию NVIDIA, модель за один прямой проход выдаёт вероятности классов или числовые прогнозы. Обучение под задачу, обновление градиентов и подбор гиперпараметров не требуются.
- Для предварительного обучения использовались только синтетические таблицы, созданные структурными причинными моделями; реальные данные не применялись.
- Выпущены три версии: Small примерно с 28 млн параметров, Medium — с 62 млн и Large — с 215 млн. На их обучение ушло около 35 млн, 71 млн и 137 млн синтетических таблиц соответственно.
- Модель оценивали на TabArena-v0.1 (51 набор данных), TALENT (300) и BeyondArena с разбиениями по случайному, временному и групповому принципу. Наборы использовались только для оценки; итоговый балл не раскрыт.
03 Почему это важно
Kumo-Tabular предлагает командам, работающим с данными, прогнозировать по таблицам без отдельного обучения под каждую задачу. Однако без опубликованных баллов численные результаты оценки модели сравнить нельзя.
04 Кому полезно
Аналитики, инженеры по машинному обучению и команды, работающие с табличными данными.
ПервоисточникNVIDIA