TabFM(Table Foundation Model)是由 Google Research 提出的一种用于表格数据(Tabular Data)的基础模型。
它的核心目标和主要特点如下:
1. 核心概念
传统上,大型语言模型(LLM)在自然语言处理领域取得了巨大成功,但在结构化表格数据(如 CSV、数据库表)上,专门的大规模预训练基础模型相对较少。TabFM 旨在填补这一空白,通过大规模无监督预训练,学习表格数据的通用表示,从而提升下游任务的性能。
2. 架构与技术
- 基于 Transformer 的架构:TabFM 采用类似 BERT 或 LLM 的 Transformer 架构,但针对表格数据的特性进行了调整。它将行和列作为输入序列的一部分进行处理。
- 混合嵌入策略:由于表格中包含数值型、类别型和文本型字段,TabFM 使用专门的嵌入层来编码不同类型的特征。例如,对数值字段进行分桶或归一化处理,对类别字段使用独热编码或可学习的嵌入向量。
- 掩码建模(Masked Modeling):在预训练阶段,TabFM 采用掩码预测任务,即随机隐藏表格中的一些单元格值,然后让模型根据其他上下文信息预测被掩码的值。这有助于模型学习字段之间的复杂依赖关系。
3. 优势
- 零样本/少样本学习能力:经过大规模预训练后,TabFM 在面对新的、未见过的表格任务时,仅需少量标注数据甚至无需微调(Zero-shot)就能表现良好。
- 跨领域泛化性:由于其学习了通用的表格结构语义,TabFM 可以在不同领域(如金融、医疗、电商)的表格数据上取得较好的迁移效果。
- 统一框架:它提供了一个统一的预训练范式,可以处理异构的表格数据,而不需要为每个特定任务设计复杂的特征工程。
4. 应用场景
TabFM 可用于多种表格数据分析任务,包括但不限于:
- 分类与回归预测
- 缺失值填充
- 异常检测
- 表格相似性匹配
- 从自然语言到表格查询的转换(NL2SQL)的辅助模块
总结
TabFM 是 Google Research 在“表格智能”领域的重要探索,试图将大模型时代的方法论扩展到结构化数据领域,推动表格数据处理从“手工特征工程”向“预训练+微调”的范式转变。这一研究方向也体现了业界对非文本数据基础模型的日益重视。