百度飞桨开源 HPD-Parsing:高吞吐层级并行文档解析技术

2026/07/23 11:37阅读量 2

百度PaddleOCR团队开源HPD-Parsing,采用层级并行解码机制,将文档解析从串行改为全局协调、局部并行模式。基于InternVL3.5-1B模型,在OmniDocBench v1.6评测集中Token吞吐提升3倍以上,单卡A800实测TPS达4,752.1,解码步数最高压缩18倍,有效缓解长文档解析效率瓶颈。

事件概述

百度飞桨(PaddleOCR)团队近日开源了 HPD-Parsing(Hierarchical Parallel Document Parsing,层级并行文档解析)技术。该技术改变了传统自回归文档解析“一条序列从头写到尾”的模式,采用“全局协调、局部并行”机制:主线布局分支统一理解页面结构,将不同区域动态分发至多个内容分支进行并行解析,并结合渐进式多 token 预测,进一步减少各分支解码步骤,实现多层级高度并行解析。

核心性能数据

HPD-Parsing 以 InternVL3.5-1B 模型为基础。在单卡 NVIDIA A800 GPU 上,OmniDocBench v1.6 评测集的 Token 吞吐(TPS)达到 4,752.1,相较传统自回归基线(TPS 1,554.8)提升超 3 倍;页吞吐(PPS)从 1.02 提升至 2.68。在 512 并发测试中,随着输出序列增长,HPD-Parsing 相对自回归模型的优势持续扩大:解码步数最高压缩 18.04 倍,批量请求吞吐最高提升 3.67 倍,单并发推理时延最高下降 5.8 倍。

技术特点与适用场景

HPD-Parsing 从解码机制上缓解了传统自回归解析中“文档越长、等待越久”的结构性瓶颈。页面越复杂、可并行解析的区域越多,其效率优势越明显。在扫描文档场景中,OmniDocBench v1.6 指标达 94.91%。官方建议:对推理效率有强需求的扫描文档场景用户可部署体验;若对解析效果有更高要求,仍推荐使用 PaddleOCR-VL 系列。

开源与获取

HPD-Parsing 已开源,模型及详细介绍可在 Hugging Face 上获取:HPD-Parsing

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。