小米发布并开源结构化数据大模型Xiaomi-TabLDM:一个模型、全任务通用
创始人
2026-09-05 14:54:12

快科技9月5日消息,小米正式发布通用表格数据基础大模型Xiaomi-TabLDM,该模型主打一次预训练之后,无需针对每一份数据集重新训练、调参或者模型集成,就可以直接完成分类、回归预测任务,把大模型范式延伸到金融、医疗、制造、物流广泛存在的表格结构化数据场景。

长期以来表格数据处理大多依靠XGBoost、LightGBM这类传统机器学习工具,每拿到一份新业务表格,就要重新完成训练调参,多套模型维护带来沉重部署成本,Xiaomi-TabLDM目标就是打破“一表一模型”的行业现状,实现单模型跨数据集直接使用。

模型技术路线围绕大规模合成数据预训练、高效模型Scaling、Test-Time Scaling三大方向展开,整套预训练全部依靠合成表格数据完成,覆盖多样的数据规模、变量类型与函数关系,扩大任务分布覆盖。

架构层面引入双流Feature Group、轻量级Attention Residual以及稀疏MoE专家混合机制,在扩大模型容量的同时,避免计算量同步暴涨,同时支持在不改动模型参数的前提下,依靠增加推理阶段计算资源,进一步拉高预测结果准确度。

在TALENT、OpenML-CTR23、BCCO、TabArena四大公开基准测试当中,Xiaomi-TabLDM整体进入第一梯队。

回归任务表现尤为亮眼,拿下TALENT二分类第一、OpenML-CTR23回归榜单第一,BCCO总体第二、TabArena回归任务第二,多项指标超过TabPFN-3、AutoGluon1.5 extreme等主流基线方案,同时兼顾预测性能与推理效率,在TabArena回归任务上取得1900 Elo得分,每1000样本验证耗时仅3.12秒。

工业真实场景测试进一步验证模型价值,材料性能预测场景无需微调,预测精度提升130%,减少九成无效试模测试;零件重量预测相比XGBoost,失误样本占比下降31%;生产组分预测平均误差降低54%。

遇到工况发生变化,仅补充三十条左右新样本作为上下文,模型平均误差就可以下降62%,对比传统算法需要两百家样本才能接近同等效果,小样本快速适配优势突出。

相关内容

热门资讯

“1998·11·14”命案告... 跨越二十八载寒暑公安民警辅警接力攻坚一桩尘封28年的命案终于迎来曙光近日内蒙古通辽市科左中旗公安局成...
戴安娜航运继续减持Genco股... (来源:航运界)航运界网消息,在戴安娜航运(Diana Shipping )“撤回”收购Genco ...
1800个SKU、93%自有品... 出品/联商翻译中心编译/李言2001年,ALDI(奥乐齐)在悉尼落地澳洲首批两家门店。偏小的面积、寥...
【环球财经】美监管机构调查特斯... 转自:新华社新华财经旧金山9月5日电(记者吴晓凌)美国国家公路交通安全管理局4日宣布,对美国电动汽车...
外资加仓A股!二季度持股市值增... 资本市场的波动对于投资者而言,既是风险也是机遇。而对以QFII(合格境外机构投资者)资本为代表的外资...