Luce:让单张图片生成的 3D 资产真正支持重光照
Luce 提出一种融合几何与 PBR 材质的多模态 Gaussian 表示,并通过统一的材质感知潜空间,从单张图片生成可重光照的 3D 资产。该方法在 Toys4K 上取得了优于现有基线的结果,并能输出可选的纹理网格。
阅读全文Luce 提出一种融合几何与 PBR 材质的多模态 Gaussian 表示,并通过统一的材质感知潜空间,从单张图片生成可重光照的 3D 资产。该方法在 Toys4K 上取得了优于现有基线的结果,并能输出可选的纹理网格。
阅读全文高德发布流式3D重建模型ABot-Recon,以连续12帧局部画面为上下文,尝试解决长序列重建中的误差累积、速度下降和显存膨胀问题。官方称,该模型已在多个公开数据集上取得较优结果,并开放代码、权重和体验入口。
阅读全文Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延展、首尾帧控制、360p 快速预览和最高 4K 输出等能力,重点提升生成式视频的可控性与生产效率。
阅读全文SparsePR提出一种无需再训练的稀疏注意力方案,通过响应耦合分区和探针拟合残差重建,降低视频Transformer的注意力计算成本。在四个视频生成与世界模型上,该方法以22.0%至26.0%的实际执行密度实现质量保持,并取得1.48至2.61倍端到端加速。
阅读全文InfinityEdit 面向持续到来的视频流,尝试让模型在每个新片段中执行编辑指令,同时保持画面的时间连续性。它通过轻量级适配器连接历史帧、时间因果关系与编辑文本,为开放式视频编辑提供了一种新路径。
阅读全文4DAnyone试图把未经标定的单目人物视频转化为多视角、跨时间一致的视频,再进一步重建4D人物。其关键在于用参考上下文压缩和目标视角路由,缓解视频扩散模型在多视角生成中的一致性瓶颈。
阅读全文阿里视频生成模型 Wan 3.0 正式开启公测,最引人注意的是它不再只接收文字、图片或音频,还能直接读取 doc、ppt、pdf 等文档。对创作者来说,这意味着视频生成开始从“会画”走向“会讲”。
阅读全文这项工作把“实时编辑”和“长视频一致性”放到同一套系统里解决。作者提出 JoyAI-Video-Edit,用自回归扩散、源锚定蒸馏和长程蒸馏,尝试在低延迟条件下保持画面忠实与时间连贯。
阅读全文InfiniSplat 面向单图新视角合成,试图解决现有前馈式 3D Gaussian Splatting 在大视角变化下结构容易散乱的问题。它用几何引导采样和隐式高斯解码,将高斯表示从像素网格推向更贴近场景表面的布局。
阅读全文Motion Beyond Morphology(MBM)提出一种新的运动迁移思路:不再要求参考对象与目标对象拥有固定结构对应,而是学习可跨形态保留的抽象运动。该方法面向同类、近类与远类对象的视频生成任务,强调运动一致性与目标外观保持。
阅读全文一篇新论文提出 3DarkFusion,将极低照度下的噪声 RGB 与近红外信息放到 3D 空间中融合,无需干净 RGB 图像作为监督。其核心价值在于降低数据采集门槛,并提升不同噪声条件下的鲁棒性。
阅读全文Meshy T2 试图绕开自回归网格生成的速度瓶颈,以 Flow Matching 和顶点级连续潜变量直接生成可用于 3D 流水线的多边形网格。
阅读全文AI 视频创业公司 Pippa 试图用授权、署名页和收益分成来缓和艺术家与生成式 AI 之间的冲突。但它仍绕不开一个关键矛盾:底层模型依然部分建立在未经明确同意抓取的网络内容之上。
阅读全文VideoCoCo 提出一种双引擎视频生成框架:先由智能体把文本提示转写为可执行 Blender 程序,再用生成式视频引擎把模拟草稿转成写实视频。它试图解决文本到视频模型在物理一致性上的短板。
阅读全文O-VAD 提出一种免训练的工业视频异常检测框架,通过对象级分割、跟踪与状态轨迹推理,定位生产流程中的异常物体与异常过程。其核心观点是:前沿视觉语言模型在工业场景失灵,往往不是不会推理,而是缺少足够细的对象证据。
阅读全文ID-V2V 聚焦“身份保持的视频重风格化”:只需编辑关键帧,就能把场景、光照和风格变化传播到整段视频,同时尽量保留人物长相、表情、视线和口型同步。
阅读全文这篇论文关注条件视频生成在 3D 场景长程渲染中的一个关键痛点:镜头回到同一地点时,外观常常被重新生成得不一致。作者提出一种无需后训练的“闭环记忆”机制,利用 3D 引擎已有的位姿、深度与重投影信息提升重访一致性。
阅读全文SANA-Video 2.0 试图在视频扩散 Transformer 中兼顾画质与效率:大部分层使用线性注意力,周期性插入 softmax 注意力作为“锚点”。论文称,该方案可在单张 H100 上实现最高 720p 的高质量视频生成,并显著降低长视频推理成本。
阅读全文Self Gradient Forcing 针对自回归视频扩散模型中的“历史上下文梯度缺口”,尝试让未来帧的损失反向监督早期生成内容如何写入更有用的 KV 记忆。该方法以两阶段训练在不完整回传长序列 rollout 的前提下,提升长视频外推的一致性。
阅读全文这篇工作试图解决一个长期痛点:视频编辑数据难采、成本高、任务类型又不够丰富。FlowMimic提出一种不用掩码的生成与编辑框架,把图像编辑样本实时转成视频编辑样本,并让模型在图像与视频两种模态之间相互“模仿”。
阅读全文HOMIE 面向人-对象中心的视频个性化,试图同时解决“像不像本人”和“互动对不对”这两类难题。它把多模态大模型知识更自然地接入视频生成流程,提升了对参考信息的理解能力。
阅读全文