视频扩散模型为何不懂物理?问题可能藏在注意力机制里
导语
视频扩散模型已经能够生成画面细节丰富、风格稳定的视频,但“看起来像真的”并不等于遵循现实世界的物理规律。物体可能突然改变运动方向,连续帧之间也可能出现不符合惯性的位移、形变或遮挡关系。针对这一问题,来自 BUPT-CIST 的研究者没有优先引入外部物理模拟器或专门的数据集,而是回到模型内部,观察运动轨迹究竟是在生成过程中如何形成的。
从“生成画面”到“规划运动”
论文将文本生成视频中的早期去噪阶段视为一种隐含的运动规划过程。研究发现,模型往往先确定主体的大致形状和位置,再逐步补充纹理与细节。也就是说,某些空间布局一旦在早期阶段被确定,后续去噪过程通常会围绕这一选择展开,留给模型修正运动轨迹的空间十分有限。
为定位真正影响运动的模块,研究结合了两类分析:一是观察跨注意力在不同时间步上的轨迹模式,二是通过因果分析评估不同注意力头对结果的贡献。结果表明,只有一部分注意力头在运动规划中发挥关键作用,它们并非平均地参与所有生成任务。
RoPE 如何导致错误轨迹
进一步的自注意力分析将问题指向旋转位置编码(RoPE)。RoPE 原本用于表达序列或空间位置信息,但在视频扩散模型的早期去噪阶段,它可能造成过强的空间注意力衰减:距离较远的候选区域难以继续获得足够关注。
这会带来一种“过早锁定”效应。模型可能先选中一个并不符合物理规律的位置,随后相邻帧中的合理候选区域被压制,最终形成跳跃、漂移或不连贯的运动。问题的关键因此不只是模型缺少物理常识,也可能是注意力机制过早缩小了搜索范围。
轻量级改动与意义
研究提出按去噪步骤调整 RoPE 频率的策略。在需要探索运动方案的早期阶段,降低过度的空间注意力衰减,使模型保留更多候选区域;随着生成过程推进,再逐步恢复更适合细节建模的位置约束。这一方法不依赖大规模额外训练,也可以与训练式方案结合。
论文报告的免训练和训练式实验均显示,该改动有助于提升生成视频的物理连贯性。更重要的是,这项工作把视频生成中的物理错误与内部注意力机制联系起来,为后续研究提供了一个可解释的诊断角度:改进视频模型不一定只能增加数据或引入外部先验,也可以从生成过程中的搜索与锁定机制入手。
不过,现有材料没有给出完整的实验指标、适用模型范围或不同物理场景下的详细对比。因此,RoPE 频率缩放能否在更多架构和复杂运动中稳定奏效,还需要进一步验证。
评论
正在确认登录状态……
正在加载评论……