产品简介
NVIDIA Kumo Tabular 是 NVIDIA 于 2026 年 9 月 29 日发布的开源表格基础模型,属于 NVIDIA Kumo Structured 模型系列,权重已在 Hugging Face 上线。它面向表格数据的分类与回归任务,核心特点是无需针对具体任务训练、调参、做特征工程或对缺失值插补,只需提供一张带标签的表格和需要预测的行,模型单次前向推理即可返回分类概率或数值预测。模型采用围绕表格结构设计的 Transformer,融合列注意力、行注意力与上下文注意力,并提供 28M 到 215M 参数的三种尺寸,预训练全部使用结构因果模型采样器生成的合成表格。
核心功能
- 单次前向推理完成预测:给一张带标签的表格和需要预测的行,模型单次前向推理即返回分类概率或数值预测,无需针对任务训练、调参、做特征工程或对缺失值插补,分类与回归都支持。
- 面向表格结构的 Transformer 架构:结合 TabICL 与 TabPFN 引入的列注意力、行注意力和上下文注意力:单元格经 Fourier 特征嵌入,行嵌入交替使用列注意力与带旋转位置的行注意力并用四个可学习的 CLS token 读出,最后的上下文 Transformer 中查询行只关注上下文行,因此上下文的键值可以算一次并复用。
- 长度感知注意力温度:随键的数量对数增长,缓解表格变大时注意力发散的问题。
- 回归输出 999 个分位数:可得到点预测与不确定性估计。
- 三种参数尺寸与合成预训练:提供 28M 到 215M 参数的三种尺寸,预训练全部使用结构因果模型采样器生成的合成表格,涵盖缺失值、粗化、重尾等情形,三个阶段从 1024 行逐步扩展到 6 万行、最多 100 列。
- 开源许可与商用支持:代码在 github.com/NVIDIA/structured-data-models,采用 OpenMDW-1.1 许可,允许商用。
适合谁用
以下类型的用户会特别受益于 NVIDIA Kumo Tabular:
- 在只有一张带标签表格和待预测行的场景下,直接进行分类或回归预测,省去训练、调参与特征工程环节。
- 需要不确定性估计的回归任务,可利用模型输出的 999 个分位数获得点预测与不确定性估计。
- 表格规模较大、希望减少重复计算的场景,可受益于上下文键值算一次并复用的设计。
- 存在缺失值、粗化、重尾等情形的表格数据,可直接使用该模型进行预测。
- 需要商用部署的表格建模项目,可基于 OpenMDW-1.1 许可使用该开源模型。
优点亮点
- 单次前向推理即可完成分类与回归预测,无需训练、调参或特征工程。
- 无需对缺失值插补,降低表格数据预处理负担。
- 在 TabArena 以 1950 ELO 排名第一,在 BeyondArena(1418 ELO)、TALENT 和 ScoringBench 排名第一。
- 在单张 RTX 6000 Pro 上比 LimiX-2 快 17 倍。
- 回归输出 999 个分位数,可同时得到点预测与不确定性估计。
- 采用 OpenMDW-1.1 许可,允许商用,权重已在 Hugging Face 上线。
价格与方案
该模型为开源模型,采用 OpenMDW-1.1 许可,允许商用,权重已在 Hugging Face 上线。具体定价信息未提供,以官网为准。
总结与建议
NVIDIA Kumo Tabular 是 2026 年 9 月 29 日发布的开源表格基础模型,支持单次前向推理完成分类与回归,无需训练、调参、特征工程或缺失值插补。模型提供 28M 到 215M 三种尺寸,在 TabArena、BeyondArena、TALENT 和 ScoringBench 排名第一,单张 RTX 6000 Pro 上比 LimiX-2 快 17 倍,采用 OpenMDW-1.1 许可允许商用。
版本演进
- NVIDIA 发布开源表格基础模型 Kumo Tabular (2026-09-29):给一张带标签的表格即可单次前向推理返回分类概率或回归预测,无需训练、调参或特征工程;三尺寸 28M 到 215M 参数,TabArena 以 1950 ELO 排名第一,并在 BeyondArena、TALENT 与 ScoringBench 登顶,OpenMDW-1.1 许可可商用。