返回文章列表
多模态

HPD-Parsing:让文档解析从串行生成走向分层并行

阅读约 2 分钟

导语

文档解析正在从传统 OCR 管线转向统一的视觉语言模型(VLM)方案:模型直接读取整页图像,并输出结构化文本、版面关系或可编辑内容。这类统一解析器的优势是端到端、上下文更完整,但也有一个明显代价——输出通常仍沿着一条自回归轨迹逐 token 生成。页面越长、表格和段落越多,串行解码带来的等待时间就越明显。

PaddleOCR 团队提出的 HPD-Parsing(Hierarchical Parallel Document Parsing)正是针对这一瓶颈。它的出发点很直观:解析文档时,页面布局确实需要全局判断;但一旦版面块被识别出来,多个段落、标题、表格单元或局部内容并不天然要求排队生成。

核心要点

  • 从整页串行到分层并行:现有统一解析器通常把整页输出压在同一条 token-by-token 路径上。HPD-Parsing 改为“主布局分支 + 多个内容分支”的层级结构。
  • 主分支负责全局协调:布局分支先组织页面整体结构,决定文档中不同块之间的关系,并动态分派块级内容解析任务。
  • 内容分支并发解码:被分派的块级内容可以同时生成,避免所有内容都等待同一条自回归序列推进。
  • P-MTP 进一步减少步数:论文还引入 progressive multi-token prediction,让每个分支内部也能减少解码轮次,而不是完全依赖逐 token 输出。
  • 速度收益明确:在公开基准上,HPD-Parsing 达到 4,752 tokens/s,吞吐量是此前最快文档解析模型的 2.62 倍,也是普通自回归基线的 3.06 倍,同时保持有竞争力的解析准确率。

意义与影响

HPD-Parsing 的价值不只是“更快”。它把文档解析任务重新拆解为两个层级:全局布局理解与局部内容转写。这个拆解更符合文档本身的结构,也为 VLM 文档解析提供了不同于整页自回归生成的新路线。

对于实际应用,吞吐量提升意味着批量票据、合同、论文、报告等场景可能获得更低延迟和更高处理密度。尤其在长文档或复杂版面中,单一路径生成的成本会随输出长度增长,而分层并行有机会把可并发的部分提前释放出来。

当然,摘要中没有展开不同文档类型、硬件设置或错误模式的细节,因此还需要结合完整论文评估其泛化能力。但从方法方向看,HPD-Parsing 提醒业界:统一 VLM 解析不必等同于单线程式输出。让模型像团队协作一样先统筹、再并行执行,可能会成为高效文档智能系统的重要设计原则。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
AV-Flamingo:把音频、图像与长视频真正连起来的开放多模态模型
多模态
cctest.ai
多模态

AV-Flamingo:把音频、图像与长视频真正连起来的开放多模态模型

NVIDIA 推出的 AV-Flamingo 面向长而复杂的真实世界音视频场景,不再只盯着短片段,而是强调跨模态、跨时间的联合推理。它通过大规模数据、分阶段训练和带时间戳的链式思考,在多项基准上表现出很强竞争力。

阅读全文