Google Research 推出 TabFM:用于表格数据的零样本基础模型
Introducing TabFM: A zero-shot foundation model for tabular data
Google Research 发布 TabFM,一种基于上下文学习(ICL)的零样本基础模型,专为表格数据的分类与回归任务设计。TabFM 将整个数据集(包含训练样本与待预测行)作为统一提示输入,在推理时直接从上下文中学习行列关系,无需模型训练、超参数调优或特征工程。与需大量人工调优的传统方法(如 XGBoost)不同,TabFM 通过单次前向传播即可在新表格上生成高质量预测。该模型已在 Hugging Face 和 GitHub 上开源。
TabFM 把表格预测变成一次前向传播,不再需调参和特征工程,数据科学家可以少熬夜了。BigQuery 集成让使用门槛降到 SQL,这是表格 ML 的零样本时刻。
自我们推出 TimesFM 以来,人们处理时间序列预测的方式已经发生了巨大转变。如今,我们把这套同样的“零样本”逻辑带到了表格数据领域。
我们推出 TabFM,这是一个面向表格数据的新基础模型,旨在简化分类与回归工作流。
快速链接
-
- 复制链接 ×
表格数据构成了企业数据基础设施的骨干,并支撑着相当大一部分关键的预测型机器学习应用。从预测客户流失到识别金融欺诈,表格回归与分类任务无处不在。多年来,诸如AdaBoost、XGBoost和随机森林等有监督的树模型算法(仅举几例)一直主导着这一领域,在结构化数据上提供了稳健的性能。
然而,部署这些传统模型的生命周期构成了一个显著的瓶颈。将 XGBoost 模型拟合到新数据集并不仅仅是一个 .fit() 步骤那么简单;它总是需要繁琐的人工投入。数据科学家必须投入无数小时进行大量的超参数优化和领域特定的特征工程,才能从原始数据中提取出可靠的信号。
另一方面,更广泛的机器学习领域近期的进展——尤其是大语言模型(LLM)的演进——已经改变了我们与全新任务交互的方式。LLM 通过上下文学习(ICL)展现了零样本预测的惊人能力。这项技术让预训练模型通过在输入上下文中提供示例和指令来学习一项新任务,而无需更新任何底层模型权重。
今天,我们推出 TabFM,一个专为表格数据分类和回归设计的基础模型。通过将表格预测构建为一个 ICL 问题,TabFM 免去了手动模型训练、超参数调优以及复杂的特征工程的需要。我们很高兴分享这一方法如何让用户仅通过一次前向传播,就能对此前未见过的表格生成高质量预测。TabFM 现已在我们的 Hugging Face 和 GitHub 仓库中提供。
工作原理
传统机器学习范式依赖于针对给定数据集分布来更新模型参数。相比之下,ICL 范式完全绕开了这一点。TabFM 不会为每个新任务经历传统的训练阶段,而是将整个数据集——包括历史训练样本和目标测试行——作为单个统一的提示词。模型在推理时直接从这一上下文中学习解读列与行之间的关系。
然而,将 ICL 应用于表格数据并不像对自然语言进行 token 化那样直接。标准的语言模型处理一维的有序序列,但表格本质上是二维的,且天然无序:交换两行或两列并不会改变数据的底层含义。为了在实现可扩展的零样本预测的同时,有效处理这些多样化的表格结构,TabFM 将 TabPFN 和 TabICL 等架构的优势融合为一种新颖的混合设计。这一架构如下图所示,依赖于三个关键机制:
- 交替的行与列注意力:首先,原始表格通过一个多层注意力模块进行处理。与 TabPFN 类似,这一步在列(特征)和行(样本)两个维度上交替施加注意力。通过在这两个维度上持续进行注意力计算,模型学习到丰富的表征,能够原生地捕捉复杂的特征交互与依赖关系。这种深度上下文建模有效地完成了原本需要数据科学家进行繁琐手工特征工程才能完成的重任。
- 行压缩:在此上下文建模之后,每一行所对应的丰富、经过交叉注意力的信息被压缩为单个稠密的向量表示。
- 上下文学习(ICL):最后,一个专用的 Transformer 对这一系列压缩后的嵌入向量进行处理。采用 TabICL 的高效方法,对这些压缩后的行向量——而非原始未压缩的表格——执行注意力计算,大幅降低了计算成本。这确保了预测步骤即使在面对更大规模数据集时,依然保持极高的计算效率。

TabFM 模型架构。
大规模合成数据训练
构建基础模型的典型方案是使用高容量神经网络,在大量多样化数据上进行训练。然而,表格机器学习领域的一个主要障碍在于,高质量、多样化的表格数据集——尤其是反映真实工业数据分析所需的大规模表格——在开源领域极为稀缺。工业表格通常包含专有 schema 和敏感信息,使其无法用于广泛的预训练。
由于合成表格可以生成得任意大,它们实际上是唯一可行的选择,能够在这一规模上预训练基础模型。因此,TabFM 完全在数亿个合成数据集上进行训练。这些数据集通过结构因果模型(SCM)动态生成,其中融入了各种随机函数。这种大规模合成生成捕捉了真实世界表格数据中普遍存在的各种分布和复杂特征关系。因此,模型能够很好地泛化到未见过的真实世界表格,正如我们在下面的基准测试中所展示的那样。
性能与基准测试
为了严格测试 TabFM 相对于现有最先进方法的表现,我们在 TabArena 上对其进行了评估。TabArena 是一个持续运行的基准测试系统,基于两两对决的胜率计算 Elo 分数。这项全面的评估涵盖 38 个分类数据集和 13 个回归数据集,样本规模从 700 到 150,000 不等。
如下方性能图所示,我们对模型的两种不同配置进行了基准测试:
- TabFM:这代表模型的开箱即用能力。预测通过单次前向传播生成,无需调优或交叉验证。
- TabFM-Ensemble:这一配置通过引入交叉特征和 SVD(奇异值分解)特征进一步提升了性能。我们使用非负最小二乘求解器计算 32 路集成的最优权重。对于分类任务,该变体还引入了 Platt 缩放作为额外的校准步骤。
如需查看完整的 TabArena 基准测试结果——包括详细的逐折指标以及与特定基线模型的两两对决胜率——请访问我们的 GitHub 页面。

TabArena 分类(上)与回归(下)任务中排名前 10 模型的 ELO 评分(↑)。(D)= 默认;(T+E)= 调优 + 集成。分数越高表示性能越优。
结论
通过将表格预测重新定义为上下文学习问题,TabFM 利用混合注意力架构和海量合成训练数据,原生地捕捉复杂的特征交互。这一方法成功消除了人工特征工程、超参数优化和重复模型训练等传统瓶颈,并持续超越经过大量调优的行业标准监督算法。TabFM 将现代基础模型的开箱即用便利性直接带入表格 ML 工作流,让从业者能够在单次前向传播中生成高度准确的预测。
为了让这一能力更易获取,TabFM 正被直接集成到 Google BigQuery 中。在未来几周内,用户将能够通过 BigQuery 中一条简单的 AI.PREDICT SQL 命令执行高级回归和分类——无需任何 ML 专业知识。
致谢
本项目是与 Erez Louidor Ilan、Taman Narayan、Shuxin Nie、Rajat Sen、Yichen Zhou、Joe Toth、Deqing Fu 和 Samet Oymak 的共同工作。我们感谢 Kimberly Schwede 设计图形。
来源:Google Research:Blog(网页) · research.google