9月2日·星期三 14:20·来源:量子位

还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍

蚂蚁集团研发的统一宽表系统OmniTable获评VLDB 2026工业赛道最佳论文。该系统已在生产环境管理超35PB、3050亿条大模型训练数据,覆盖Web、代码、PDF及SFT等数据域。真实SFT数据准备任务中,端到端周期从约14天缩短至2.5天,手工操作步骤由45步降至12步。OmniTable采用“逻辑统一、物理分离”原则,将同一数据域呈现为一张逻辑宽表,底层按规模与引擎拆分物理表,并以全局主键和批次字段实现数据对齐与血缘追踪。特征注册后,系统沿列级依赖DAG自动生成执行计划,复用已完成结果,并将UDF故障隔离至记录级,异常样本单独记录,其余数据继续处理。对照实验中,含0.005%异常记录的500GB特征任务,开启故障恢复后约99.995%数据一次完成,耗时6.2小时,无需人工介入。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(量子位)→