REBASE:无需训练的一次示例分割,关键在于先“擦掉背景”
导语
训练自由的 in-context segmentation 试图解决一个很实际的问题:当系统遇到一个从未见过的新目标类别时,能否只凭一张带标注的参考图,就在另一张查询图中完成目标分割?这类方法不需要重新训练模型,也不必为不断增加的新类别维护额外参数,因此很适合开放世界视觉应用。
来自 Hugging Face Daily Papers 的论文《REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation》把焦点放在一个容易被低估的瓶颈上:跨图像相似度图并不总是可靠。已有方法通常用视觉基础模型建立参考图与查询图之间的语义对应,再把得到的位置提示交给 SAM 这类可提示分割模型。但如果两张图有相似背景,比如都在相近场景、材质或上下文中拍摄,背景区域也会获得较高相似度,导致提示点偏离真正目标。
核心要点
- 问题不是 SAM 本身,而是提示从哪里来。 对训练自由分割来说,分割网络往往依赖前一步生成的点提示或密集先验;一旦相似度图被背景“抬高”,后续分割就容易被带偏。
- REBASE 显式建模参考图背景。 方法从参考图中识别低秩的背景特征子空间,并把参考图和查询图的特征投影到该子空间的正交补上。直观理解,就是先从特征表示里削弱“像背景”的成分,再做目标匹配。
- 匹配更干净,提示更稳。 在背景干扰被压制后,系统用相似度加权的最远点采样生成正向点提示,同时结合更精炼的密集相似度先验,为可提示分割模型提供输入。
- 全过程无需训练。 论文强调 REBASE 不进行参数更新,也不依赖额外训练流程,仍能在 PACO-Part、FSS-1000 以及 ISIC2018 等跨域数据集上达到训练自由方法的新 SOTA。
意义与影响
REBASE 的价值在于,它没有把一次示例分割的提升完全寄托于更大的模型或更多训练数据,而是针对“相似度污染”提出了一个明确的几何处理思路:既然背景会形成稳定但无关的对应关系,就把这部分子空间从特征中剥离出去。
这对实际部署很有启发。很多视觉系统需要在低样本、类别持续变化、甚至跨领域的环境中工作,例如细粒度部件分割、医学图像中的新目标定位,或工业检测中的临时类别识别。若能在不训练的条件下提升提示定位质量,就可以降低更新成本和显存负担。
当然,摘要中没有给出具体指标和消融细节,因此 REBASE 在不同视觉骨干、不同参考标注质量下的稳定性,还需要进一步阅读论文全文验证。但从方法动机看,“先去背景,再做语义对应”是一个简洁且可迁移的原则,可能成为训练自由分割管线中的重要组件。
评论
正在确认登录状态……
正在加载评论……