百度 PaddleOCR 团队近日开源了 HPD-Parsing(Hierarchical Parallel Document Parsing,层级并行文档解析)技术。将文档解析机制从“一条序列从头写到尾”,转变为“全局协调、局部并行”的模式。
在这种解析模式下,主线布局分支负责统一理解页面结构,并将不同区域动态分发至多个内容分支进行并行解析,同时结合渐进式多 token 预测,进一步减少各分支解码步骤,整体实现多层级高度并行解析。

官方建议应用场景聚焦在扫描文档场景且对于推理效率存在强需求的用户可以部署体验 HPD-Parsing,对于解析效果存在强需求的用户,仍然建议使用PaddleOCR-VL系列作为第一选择。
HPD-Parsing 以 InternVL3.5-1B 为核心,采用动态的基于图块的裁剪(最多 24 个 448×448 的图块)来保留高分辨率细节。它与传统统一解析器的主要区别在于解码范式:HPD-Parsing 并非沿着单一的自回归轨迹生成整个页面,而是使用一个主布局分支来协调全局结构,并生成多个局部内容分支进行并发的区域级解码,每个分支都集成了 P-MTP 算法。


根据介绍,HPD-Parsing 将 1B 参数的基线模型Token吞吐大幅拉升至3倍以上,单卡 NVIDIA A800 GPU 实测,OmniDocBench v1.6 评测集 TPS(Tokens Per Second,每秒 Token 生成量)达 4,752.1。

OmniDocBench v1.6评测集512并发测试,传统自回归基线Token吞吐(TPS)为 1554.8、页吞吐(PPS)为1.02,引入HPD(层级并行解码)技术后,Token吞吐和页吞吐分别提升至4,752.1和2.68。

OmniDocBench v1.6测试集按长度等间隔划分,结果显示,随着输出序列增长,HPD-Parsing相对自回归模型的优势持续扩大,解码步数最高实现18.04倍压缩、批量请求吞吐最高实现3.67倍提升、单并发推理时延最高下降5.8倍。
公告指出,HPD-Parsing 带来的并非固定比例的性能提升,而是从解码机制上缓解了传统自回归解析中“文档越长、等待越久”的结构性瓶颈。页面越复杂,可并行解析的区域越多,其效率优势也越明显。

扫描场景完成技术可行性验证,OmniDocBench v1.6 指标达94.91%。
