D-RAC:用多模态文档规范化重构企业 RAG 的切分入口
导语
企业知识库里的文档很少是整齐的纯文本。PDF、DOCX、PPTX、XLSX 以及扫描件往往包含多栏排版、跨页表格、页眉页脚和层级复杂的标题。传统解析器容易打乱阅读顺序、压平表格结构,甚至让检索系统从一开始就看不到关键信息。D-RAC(Document Retrieval-Aware Chunking)试图解决的,正是 RAG 流程中经常被忽略的“摄取入口”问题。
核心方法
D-RAC 延续了 W-RAC 的思路,但把适用范围从网页扩展到企业文档。它的流程主要分为三步:
- 统一输入格式:先将可渲染的文档确定性地转换为 PDF,再生成页面图像。这样做不是简单抽取字符,而是尽量保留原始视觉布局。
- 一次多模态转换:多模态大模型查看页面后,输出面向检索优化的 Markdown。标题层级会被明确表达,装饰性图片会被舍弃;表格则被改写成带有列标题、能够独立理解的陈述句。
- 基于标识符分块:Markdown 被确定性解析成可寻址的元素,之后由轻量级语言模型只根据这些元素的 ID 制定分块计划,而不是重新阅读并改写全文。
其中一个关键设计是禁止把互斥选项随意合并。例如,“16 年或 20 年”不能被压缩成含义模糊的表达。对于企业检索来说,这类细节关系到数字、条件和适用范围能否在召回后保持原意。
为什么值得关注
许多所谓的“智能分块”方案,实际上把成本和风险集中在全文重写阶段:模型需要再次生成大量源文本,既消耗 token,也可能产生幻觉。D-RAC 将多模态理解限制在文档转换环节,并在后续分块阶段不再生成源文本,因此理论上更有利于控制成本、保持确定性,也便于追踪每个检索单元来自文档的什么位置。
论文摘要给出的测试范围包括 RAG-Multi-Corpus 基准中的 236 份、795 页 PDF,覆盖五个企业领域。D-RAC 完成整批文档的转换与切分耗时 72 分钟,报告为零错误。需要注意的是,现有素材并未提供完整的检索质量对比数据,因此还不能仅凭处理速度和流程设计断言它在生产环境中一定优于固定长度切分或传统解析器。
仍需验证的环节
D-RAC 的成败很大程度上取决于 PDF 规范化和 Markdown 转换是否可靠。跨页表格、页脚中的标题、扫描质量不佳的页面,以及复杂的合并单元格,仍可能成为新的错误来源。如果转换阶段损坏了结构,后面的检索感知分块只是在更精细地组织错误内容。实际部署时,应特别关注坏解析器基线、表格跨页测试和端到端检索指标,而不只是分块是否成功。
总体而言,D-RAC 的价值不在于提出一个更复杂的切分规则,而在于重新安排 RAG 的处理顺序:先用多模态能力恢复文档结构,再用确定性解析和轻量规划完成分块。这为异构企业文档进入统一检索管线提供了一条较清晰的工程路径。
评论
正在确认登录状态……
正在加载评论……