先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.17488
LimiX-2:不只预测标签、而是学「数据怎么生成」的表格基础模型
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
Xingxuan Zhang,Gang Ren,Hao Yuan,Hao Zou 等 12 位作者 · 2026-09-15
一个预训练模型,表格分类、回归、补缺失、找因果全包
打开交互式解读 →3 分钟版
问题 表格预测的强方法(梯度提升树、深度网络、自动化集成)通常要对每个数据集单独训练和选模型,跨任务复用知识有限。现有表格基础模型(PFN 范式)只直接监督「预测指定的目标列」,没有显式建模所有变量的联合分布。
思路 LimiX-2 采用「上下文机制网络」(CMN)范式:同一张表上同时练多个条件预测任务,目标是学 p(x, y | 上下文) 而不只是 p(y | x, 上下文)。预训练目标 CCMM 把目标预测和被遮住特征列的重建结合起来。模型保留单元格级表示,只在结构因果模型(SCM)生成的合成数据上预训练。
结果 TabArena(51 个真实数据集)上 Elo 1935,比第二名 TabFM+ 高约 117 分,聚合胜场数约为其 3.6 倍;TALENT 和 BCCO 上也都 Elo 第一。用特征注意力恢复因果骨架,六个数据集平均 F1 0.7972,排名第一。参数规模从 12.5M 增到 406.2M,TabArena Elo 呈对数线性上升。
所以呢 表格基础模型正在逼近甚至超过「每个数据集单独调参」的传统做法;如果规模化趋势持续,企业结构化数据的建模方式可能被改写。但所有结果为作者自报,2B 规模的外推只是预测。
关键数字
- 1935 TabArena Elo(第一)(§5.2)
- 1506 TALENT 总 Elo(第一)(§5.3)
- 43.1% BCCO 上「改进空间」相对 TabFM 的降幅(§5.4)
- 34.68 TabArena 上每翻倍参数的 Elo 增幅(§6.2)
局限与疑问
- 全部结果为作者自报;Elo 依赖参与比较的方法池。
- 2B 规模的表现是外推预测,不是实测(作者自述)。
- 作者指出架构、预训练分布和训练算力不同,参数效率差距不能全归因于模型设计。
- 因果骨架评估只覆盖六个数据集,且只恢复无方向结构。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。