HPD-Parsing:让文档解析从串行生成走向分层并行
导语
文档解析正在从传统 OCR 管线转向统一的视觉语言模型(VLM)方案:模型直接读取整页图像,并输出结构化文本、版面关系或可编辑内容。这类统一解析器的优势是端到端、上下文更完整,但也有一个明显代价——输出通常仍沿着一条自回归轨迹逐 token 生成。页面越长、表格和段落越多,串行解码带来的等待时间就越明显。
PaddleOCR 团队提出的 HPD-Parsing(Hierarchical Parallel Document Parsing)正是针对这一瓶颈。它的出发点很直观:解析文档时,页面布局确实需要全局判断;但一旦版面块被识别出来,多个段落、标题、表格单元或局部内容并不天然要求排队生成。
核心要点
- 从整页串行到分层并行:现有统一解析器通常把整页输出压在同一条 token-by-token 路径上。HPD-Parsing 改为“主布局分支 + 多个内容分支”的层级结构。
- 主分支负责全局协调:布局分支先组织页面整体结构,决定文档中不同块之间的关系,并动态分派块级内容解析任务。
- 内容分支并发解码:被分派的块级内容可以同时生成,避免所有内容都等待同一条自回归序列推进。
- P-MTP 进一步减少步数:论文还引入 progressive multi-token prediction,让每个分支内部也能减少解码轮次,而不是完全依赖逐 token 输出。
- 速度收益明确:在公开基准上,HPD-Parsing 达到 4,752 tokens/s,吞吐量是此前最快文档解析模型的 2.62 倍,也是普通自回归基线的 3.06 倍,同时保持有竞争力的解析准确率。
意义与影响
HPD-Parsing 的价值不只是“更快”。它把文档解析任务重新拆解为两个层级:全局布局理解与局部内容转写。这个拆解更符合文档本身的结构,也为 VLM 文档解析提供了不同于整页自回归生成的新路线。
对于实际应用,吞吐量提升意味着批量票据、合同、论文、报告等场景可能获得更低延迟和更高处理密度。尤其在长文档或复杂版面中,单一路径生成的成本会随输出长度增长,而分层并行有机会把可并发的部分提前释放出来。
当然,摘要中没有展开不同文档类型、硬件设置或错误模式的细节,因此还需要结合完整论文评估其泛化能力。但从方法方向看,HPD-Parsing 提醒业界:统一 VLM 解析不必等同于单线程式输出。让模型像团队协作一样先统筹、再并行执行,可能会成为高效文档智能系统的重要设计原则。
评论
正在确认登录状态……
正在加载评论……