TimeLens2:让视频多模态模型说清“证据发生在何时”
TimeLens2 将视频时序定位重新表述为“区间集合”问题,让模型不仅回答视频里发生了什么,还能给出支撑答案的时间片段。其 2B、4B、8B 版本在多项基准中相对 Qwen3-VL 骨干模型取得明显提升。
阅读全文TimeLens2 将视频时序定位重新表述为“区间集合”问题,让模型不仅回答视频里发生了什么,还能给出支撑答案的时间片段。其 2B、4B、8B 版本在多项基准中相对 Qwen3-VL 骨干模型取得明显提升。
阅读全文REBASE 提出一种训练自由的 in-context segmentation 方法,通过移除参考图像中的背景特征子空间,降低跨图像匹配时的背景干扰。它与 SAM 等可提示分割模型结合,在多个数据集上刷新训练自由方法表现。
阅读全文VideoChat3 试图同时解决开源视频多模态模型的三类痛点:泛化不足、计算成本高、开放程度不完整。它以 4B 参数规模,在通用、长视频与流式视频理解任务上强调效率与覆盖面的平衡。
阅读全文一篇 arXiv 论文提出 BitMind Forensics:通过开放式对抗竞赛持续刷新训练分布的深度伪造检测系统。其在 19 个公开数据集上的结果显示,动态检测框架在野外图像、视频与生成式媒体评测中明显优于多种静态开源检测器。
阅读全文VideoRAE 试图把冻结的视频基础模型表征,转化为既能重建、又适合生成模型使用的视频潜变量。相比传统 3D-VAE,它更强调语义与时空结构,而不只是像素级还原。
阅读全文一篇 arXiv 新论文以满文历史文献为案例,探索用“多专家+页面级路由”解决低资源、多书体 OCR 难题。系统复用微调过程中的检查点作为专家,并由轻量分类器按视觉风格分发页面。
阅读全文一篇面向 ABAW11 多任务学习挑战的论文提出:在人脸情感分析中,与其强行使用统一架构,不如针对效价-唤醒、表情类别和面部动作单元分别选择特征融合与后处理策略。
阅读全文一篇新论文提出 VisionScreen,将语言建模中的 Screening 机制扩展到图像识别,让视觉 token 能显式排除低相关图像块。作者认为,这为 ViT 依赖 softmax 相对权重的特征聚合方式提供了另一种路径。
阅读全文这篇 arXiv 论文提出一种结构感知的音乐到舞蹈生成框架,把编舞拆解为可解释的“原子动作”序列,再生成连贯的人体运动。相比只把动作看作连续信号的方法,它更强调节奏、结构和可控性。
阅读全文一篇已被 ACM MM 2026 接收的论文提出 Peak-End-Net,将心理学中的“峰终定律”引入视频美学评价,让模型更关注视频中的高光时刻与结尾体验。
阅读全文一篇 arXiv 新论文提出 TCA-Net,聚焦低光图像增强中“亮度—色度”双流重新融合的可靠性问题。其核心是用固定置信阈值替代传统 Top-K 稀疏注意力的固定配额选择。
阅读全文PiVoT 提出一种基于变分推断的训练-free 多目标检测与跟踪框架,重点解决雷达点云中目标多、杂波重、数据稀缺时的实时处理难题。它无需外部聚类或检测器,可联合估计目标状态、形状、存在概率、数据关联与测量率。
阅读全文一篇 arXiv 新论文提出 Spatial Texture-Atlas Splatting,将高频纹理从逐片元计算中解耦出来,烘焙进紧凑纹理图集。研究称该方法在保持高视觉质量的同时,最高可比 3DGS 快 5 倍,并支持消费级硬件实时 4K 60FPS 渲染。
阅读全文RainDancer 面向雨天视频恢复,引入事件相机的高时间分辨率线索,并通过“先分解、再交互”的方式降低跨模态干扰。论文强调在 RGB 与事件流中分别拆分雨水和背景,再进行组件级融合。
阅读全文