返回文章列表
RAG 与检索

不靠检索也能回答文档问题?IAR把知识内化拆成三步

阅读约 3 分钟

导语

如果模型回答企业手册、法规集合或内部知识库中的问题时,推理阶段不能再看到检索到的原文,它是否真的“学会”了这些文档?这正是论文《Inject, Align, Recover》讨论的文档知识内化问题:把固定语料转化为模型参数中的可用知识,用于检索自由的问答。

核心方法:把一次微调拆成三种职责

IAR 的关键并不是简单增加继续预训练数据,而是将训练过程分成三个阶段:

  • Inject(注入):把源文档转化为续写、改写,以及指令条件下的重构任务,让模型从不同形式接触文档内容。其目标是先提高知识暴露和吸收,而不是立即追求问答格式的表现。
  • Align(对齐):在已经注入知识的模型上使用仅答案式问答监督,使模型学会根据问题调取并组织已内化的信息。换言之,知识“存在”与知识“能被问出来”被分开处理。
  • Recover(恢复):将领域适配后的检查点与原始指令模型合并,尽量找回训练过程中可能受损的通用能力。

这一设计针对的是传统微调中的典型矛盾:模型可能更擅长目标文档问答,却在指令遵循、广泛知识和其他通用任务上退化;也可能保留通用能力,却没有真正吸收文档内容。IAR 试图通过阶段化训练和模型合并,分别优化这两端。

实验结果说明了什么

论文在 Common Corpus 与 CCI 两个文档语料上,测试了 Llama、Phi、Qwen 和 SmolLM 四个模型家族。与 Vanilla SFT 相比,IAR 在 8 个数据集—模型设置中的 7 个设置上,在论文报告的四项指标上都取得改进。平均来看,领域问答准确率提升 3.6 个百分点;由 IFEval、MMLU 和 MSBench 组成的通用性能均值提升 12.1 个百分点。

作者还报告了扩展的 Common Corpus 对比。LoRA 和 FAPM 能够在个别通用指标上胜出,但如果同时考虑文档内化效果,IAR 仍处于强势方法之列。这意味着单项通用能力的最高分,并不一定等于整体折中最优。

意义与局限

这项工作的价值在于重新定义了评估问题:文档曝光、问答可访问性和通用能力保持,应该被分别测量和优化,而不是被压缩成一次统一的监督微调。对于数据规模固定、推理成本敏感,或不希望暴露检索链路的场景,这种思路提供了不同于标准 RAG 的路线。

不过,检索自由并不自动意味着知识可靠。模型将文档转化为参数后,事实更新、来源追溯和错误纠正都可能更困难;而文中结果也主要说明在给定语料、模型和评测设置下的性能变化。实际部署仍需结合文档更新频率、可解释性和事实核验要求,判断参数内化是否适合替代检索。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Google推出“首选来源”按钮,试图缓解AI搜索的流量冲击
RAG 与检索
cctest.ai
RAG 与检索

Google推出“首选来源”按钮,试图缓解AI搜索的流量冲击

Google允许出版商在网站上嵌入“首选来源”按钮,让读者主动选择希望在搜索、Discover和Google News中优先看到的媒体。此举既是用户体验功能,也反映出AI搜索减少传统网页点击后,Google对内容生态压力的回应。

阅读全文