蚂蚁OmniTable系统获VLDB最佳论文:统一宽表架构实现35PB语料高效治理

2026/09/02 14:20阅读量 2

蚂蚁集团研发的统一宽表系统OmniTable荣获VLDB 2026工业赛道最佳论文。该系统通过“逻辑统一、物理分离”的设计,在生产环境中管理超35PB、3050亿条大模型训练数据。在真实SFT数据准备任务中,端到端周期从14天缩短至2.5天,效率提升5.6倍,显著降低了数据工程中的协调与重跑成本。

事件概述

蚂蚁集团推出的统一宽表系统 OmniTable 及其相关论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获评 VLDB 2026 工业赛道最佳论文。该系统旨在解决大模型训练中 PB 级语料清洗、去重、质量评分等数据准备环节的复杂工程问题,已在生产环境部署并管理超过 35 PB、3050 亿条记录。

核心信息

1. 痛点与解决方案:从物理表到逻辑宽表
传统大模型数据处理围绕物理表展开,随着数据源和特征增加,导致表数量膨胀(如补一个特征需处理106张表)、血缘关系断裂及排查困难。OmniTable 提出“逻辑统一、物理分离”原则:

  • 逻辑层:将同一数据域呈现为一张逻辑宽表,行代表可追踪的数据实体,列包含原始数据、中间态、衍生特征(如质量、安全、去重签名)等。全局主键 _ai_unique_id_ 确保跨阶段数据一致性。
  • 物理层:底层继续按规模、访问方式拆分存储,由 Catalog 维护逻辑列与物理位置的映射,支持动态调整而不影响上层 Schema。

2. 关键性能指标

  • 规模覆盖:管理 Web、代码、PDF 和 SFT 等多领域数据,最大单张 Web 宽表约 25 PB、3000 亿条记录,含 800+ 逻辑列。
  • 效率提升:在一项真实 SFT 数据准备任务中,端到端周期从约 14 天缩短至 2.5 天,提速 5.6 倍;手工操作步骤从 45 步降至 12 步。
  • 查询性能:在 25 PB 数据上,单样本点查 P50 延迟为 8.3 秒,P99 为 14.7 秒;过滤导出吞吐保持在 18–23 TB/小时。

3. 技术机制

  • 特征计算自动化:工程师只需指定目标批次和特征,系统自动解析依赖 DAG,复用已完成结果,合并共享输入扫描,减少重复计算。
  • 记录级容错:将 UDF 故障隔离至记录级。异常样本被标记为 NULL 并进入错误表,其余正常记录继续处理。在 500 GB 测试中,开启此功能后无需人工介入即可完成任务,耗时从 52 小时降至 6.2 小时。
  • 算子融合与自适应调优:多个读取同一列的特征融合为一次扫描,CPU Hours 减少 55.9%,端到端时间提速 2.7 倍;自适应配置使首次提交成功率达 100%,成本接近专家手调水平。
  • 后台自动治理:持续监控小文件、分区倾斜等问题,自动执行合并、拆分和物化视图构建,采用 Prepare-Execute-Commit 模式保证原子切换,用户无感知。

值得关注

OmniTable 的核心价值在于将数据批次、特征定义、执行状态和列级血缘纳入统一元数据管理,解决了 PB 级数据工程中“数据难定位、特征难回刷、结果难追溯”的问题。虽然引入了少量存储开销(热点列物化增加 8%-15%)和执行开销(记录级容错增加 3%-5%),但大幅节省了工程师在协调、排查和重跑上的时间,为大模型数据工程的规模化提供了新的系统设计参考。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。