返回文章列表
多模态

OmniConfess:让多模态模型说清楚答案究竟听信了谁

阅读约 3 分钟

导语

多模态大语言模型可以同时处理文本、图像、音频和视频,但“看得更多”并不意味着“判断更可靠”。当不同证据之间存在冲突,或模型错误地依赖某个通道时,生成结果仍可能出现幻觉。一个现实问题是:模型给出错误答案后,我们往往只能看到结果,却难以判断究竟是哪类输入支撑了这个错误判断。

论文 OmniConfess 将重点放在“追溯答案依据”上。它是一种无需额外训练的推理时方法,目标不是简单地让模型少说,而是分析一条已经生成的候选回答,找出其中每个 token 对不同证据通道的依赖。

核心方法

OmniConfess 的流程可以概括为三步:

  1. 固定候选回答:先让模型生成或接收一条候选响应,不立即重新自由生成。
  2. 逐通道干预并重评分:在控制文本、图像、音频、视频等证据通道的条件下,对候选回答进行 token 级重新评分,比较不同通道变化对各个 token 的影响。
  3. 形成“证词”并修正:将 token 与证据通道之间的依赖关系整理为结构化 confession。对于有充分依据的内容,方法尽量保留;对于主要由无关或相互矛盾证据驱动的承诺,则引导模型进行修正。

这里的“confession”并不是让模型用自然语言解释自己,而是一种更细粒度的证据依赖记录。它把原本难以观察的生成过程,转化为可以按 token、按通道检查的信号。

评测与边界

为验证方法,研究团队构建了 OmniHalluBench。该基准包含 3540 个样本,来自六个数据集,覆盖文本、图像、音频和视频场景,同时包含判断任务与自由形式生成任务。论文摘要称,OmniConfess 在这些异构模态和任务设置下都能缓解幻觉。

不过,当前素材没有提供具体基线、指标或各任务的提升幅度,因此不宜据此判断它在不同模型上的实际收益大小。方法的计算开销、通道干预的稳定性,以及当多个通道共同导致错误时能否准确归因,也仍值得通过完整论文和代码进一步核验。

意义与影响

OmniConfess 的价值在于,它把多模态幻觉治理从“结果是否错误”推进到“错误依赖了什么证据”。这为推理时安全控制提供了一个更具诊断性的方向:系统不必默认删除所有不确定内容,而是尝试区分有依据的陈述与证据来源可疑的陈述。

如果这一思路能够在更多模型和真实应用中保持稳定,它可能帮助多模态系统实现更精细的事实校正,也为后续研究提供一种分析跨模态证据冲突的工具。与此同时,token 级归因并不自动等于因果解释,最终效果仍需要更全面的实验与开源实现验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Kandinsky 6.0 Video:让视频生成同时具备画面、声音与口型同步
多模态
cctest.ai
多模态

Kandinsky 6.0 Video:让视频生成同时具备画面、声音与口型同步

Kandinsky 6.0 Video 是一组面向文本或图像输入的音视频生成模型,可输出带有同步 44 kHz 音频和唇形匹配的 5 秒视频。其核心是连接视频与音频生成流的双流 CrossDiT 架构,并以开源方式发布代码、权重和 Diffusers 集成。

阅读全文