SULAND v2:面向无人机/无人车地雷识别的RGB数据集与域外评测基准
导语
RGB 相机便宜、易部署,因而常被视为无人机和无人地面车执行地表地雷巡检时的现实选择。但在排雷辅助这样安全敏感的场景里,模型“看起来能检测”远远不够:数据标注是否可靠、测试集是否反映域外变化、不同架构是否真正可比,都会直接影响后续系统是否值得信任。SULAND v2 正是围绕这些问题,对已有 SULAND 数据集进行了一次系统性重审与基准重建。
核心要点
- 重新审校数据,而非更换图像:研究团队保留了原始图像和数据划分,逐帧检查并在 Label Studio 中手工修正标注,使 v1 与 v2 仍可直接对比。
- 修复多类标注问题:原始数据中存在漏标、误标、边界框定位不准、部分可见目标判定标准不一致、视觉伪影、时间序列标注不一致等问题。
- 纠正关键 OOD 错误:研究发现原 SULAND 的域外测试部分存在类别 ID 约定反转,这会显著扭曲 OOD 评估结果。
- 规模与覆盖:SULAND v2 包含 33,771 张 RGB 图像和 12,433 个边界框,面向 PFM-1 与 PMA-2 等地表地雷目标检测。
- 跨架构基准:论文在统一协议下评测了 9 个检测器家族、35 种配置,覆盖一阶段、两阶段、Transformer 以及开放词汇检测方案。
关键结果
数据清洗带来的影响非常直接。仅标注修正,就让 YOLOv8 在同分布 IID 测试上的 mAP@50 提升 14.6 到 19.6 个百分点;而修复 OOD 类别 ID 约定后,YOLOv8 的平均 OOD mAP@50 约提升 25 个百分点。这说明,基准数据中的“看似小错误”可能足以改变模型优劣判断。
在 SULAND v2 上,YOLOv12-Small 获得最高 IID mAP@50,为 0.908;但域外表现最强的则是 RF-DETR-Large,OOD mAP@50 为 0.799,召回率为 0.675。更重要的是,域 shift 下模型排名会明显重排,模型规模也不能稳定预测鲁棒性。
意义与影响
这项工作提醒我们,安全关键 AI 不能只依赖单一测试集分数。对于无人机/无人车辅助地雷巡检,真正重要的是模型能否在不同地面纹理、光照、视角和采集条件下保持可靠。SULAND v2 的价值不只是“更干净的数据集”,还在于它提供了一个可复现实验框架,用来区分训练标签质量、评估真值一致性和域外泛化能力。
对研究者而言,它为 RGB 地雷检测提供了更可信的公共基准;对应用方而言,它再次强调:IID 高精度并不等于作业就绪,部署前必须进行面向域外场景的独立验证。
评论
正在确认登录状态……
正在加载评论……