01 发生了什么
英伟达发布Kumo-Tabular 1.0,这是一款用于表格数据分类与回归的基础模型。它根据带标签的上下文行和具有相同列的未标注查询行生成预测。
02 关键细节
- 据英伟达介绍,模型一次前向计算即可输出类别概率或数值预测,无需针对任务训练、更新梯度或调整超参数。
- 预训练仅使用由结构因果模型生成的合成表格,没有使用真实世界数据。
- 该模型有三种规模:Small约2800万参数、Medium约6200万参数、Large约2.15亿参数;预训练分别使用约3500万、7100万和1.37亿张合成表格。
- 模型卡列出TabArena-v0.1(51个数据集)、TALENT(300个)和BeyondArena的评估,后者采用随机、时间和分组切分。这些基准仅用于评估;评测分数未披露。
03 为什么重要
Kumo-Tabular让数据团队无需为每项任务单独训练模型,也能根据表格生成预测。不过,英伟达没有公布基准分数,因此无法依据已发布的数值比较评估结果。
04 适合谁
分析师、机器学习工程师及处理表格数据的团队。
原始来源NVIDIA