会懂网AI资讯获悉,9月4日,数据库领域顶级会议VLDB 2026揭晓奖项,蚂蚁集团自研的“统一宽表”数据系统OmniTable获工业赛道最佳论文奖。这套系统管理超过35PB、3050亿条训练数据记录,将一次典型SFT(监督微调)任务的数据端到端周期从14天压缩到2.5天,效率提升约5.6倍。

更直观的变化在人工投入:原本需要45步人工操作的数据准备流程被精简到12步。大模型训练的数据清洗与治理长期依赖大量人力,OmniTable用一张统一宽表承接海量样本的入库、去重、配比与版本迭代,把重复性劳动交给系统编排,人只负责关键判断。
获奖本身也是行业风向标:大模型竞争的前沿正从“炼丹”延伸到“数据工程”。当模型架构与参数趋于同质,谁能更快把高质量数据送进训练管线、以更短周期完成“原始数据—训练样本”的循环,谁就能在同等算力下逼近更高上限。
蚂蚁把OmniTable送上VLDB,也带有对外输出技术影响力的意图。作为从金融场景成长起来的科技公司,它在支付、信贷、风控等万亿级业务中沉淀了大量结构化与非结构化数据的治理经验,一旦将这套系统平台化,其可复用性将远超单一业务。
如果把大模型训练比作做饭,OmniTable解决的正是“备菜”环节的效率。蚂蚁在论文中强调,这套系统并非只服务单一模型,而是面向其多模态与Agent类任务的通用数据底座:当训练数据的版本需要快速回滚、或不同任务的配比需要切换时,统一宽表能让团队以“改一行配置”的方式,完成过去需要数天才能落地的调整,这正是它把人工步骤从45步压缩到12步的关键。
会懂网认为,VLDB工业最佳论文这类“工程顶会”奖项的含金量正在上升:它评价的不是单点算法,而是能在生产环境扛住真实负载的系统能力。35PB规模、5.6倍提效,说明“数据中台”正在成为模型公司的第二层算力——看不见,但决定上限。





















暂无评论内容