文章与教程

视觉与视频

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 35 篇文章

CCTest · Blog
SparsePR:用“分区+残差重建”加速视频生成注意力
视觉与视频
cctest.ai
视觉与视频

SparsePR:用“分区+残差重建”加速视频生成注意力

SparsePR提出一种无需再训练的稀疏注意力方案,通过响应耦合分区和探针拟合残差重建,降低视频Transformer的注意力计算成本。在四个视频生成与世界模型上,该方法以22.0%至26.0%的实际执行密度实现质量保持,并取得1.48至2.61倍端到端加速。

阅读全文
CCTest · Blog
跨越形态差异的视频运动迁移:MBM 尝试摆脱“骨架对应”依赖
视觉与视频
cctest.ai
视觉与视频

跨越形态差异的视频运动迁移:MBM 尝试摆脱“骨架对应”依赖

Motion Beyond Morphology(MBM)提出一种新的运动迁移思路:不再要求参考对象与目标对象拥有固定结构对应,而是学习可跨形态保留的抽象运动。该方法面向同类、近类与远类对象的视频生成任务,强调运动一致性与目标外观保持。

阅读全文
CCTest · Blog
O-VAD:让工业视频异常检测从“看整段视频”转向“盯住每个物体”
视觉与视频
cctest.ai
视觉与视频

O-VAD:让工业视频异常检测从“看整段视频”转向“盯住每个物体”

O-VAD 提出一种免训练的工业视频异常检测框架,通过对象级分割、跟踪与状态轨迹推理,定位生产流程中的异常物体与异常过程。其核心观点是:前沿视觉语言模型在工业场景失灵,往往不是不会推理,而是缺少足够细的对象证据。

阅读全文
CCTest · Blog
让生成视频“记得来过”:无需训练的自回归渲染一致性方法
视觉与视频
cctest.ai
视觉与视频

让生成视频“记得来过”:无需训练的自回归渲染一致性方法

这篇论文关注条件视频生成在 3D 场景长程渲染中的一个关键痛点:镜头回到同一地点时,外观常常被重新生成得不一致。作者提出一种无需后训练的“闭环记忆”机制,利用 3D 引擎已有的位姿、深度与重投影信息提升重访一致性。

阅读全文
CCTest · Blog
SANA-Video 2.0:用混合注意力加速高分辨率视频生成
视觉与视频
cctest.ai
视觉与视频

SANA-Video 2.0:用混合注意力加速高分辨率视频生成

SANA-Video 2.0 试图在视频扩散 Transformer 中兼顾画质与效率:大部分层使用线性注意力,周期性插入 softmax 注意力作为“锚点”。论文称,该方案可在单张 H100 上实现最高 720p 的高质量视频生成,并显著降低长视频推理成本。

阅读全文
CCTest · Blog
Self Gradient Forcing:让自回归视频模型学会写好长期记忆
视觉与视频
cctest.ai
视觉与视频

Self Gradient Forcing:让自回归视频模型学会写好长期记忆

Self Gradient Forcing 针对自回归视频扩散模型中的“历史上下文梯度缺口”,尝试让未来帧的损失反向监督早期生成内容如何写入更有用的 KV 记忆。该方法以两阶段训练在不完整回传长序列 rollout 的前提下,提升长视频外推的一致性。

阅读全文
CCTest · Blog
FlowMimic:用像素对流场把图像编辑“迁移”到视频编辑
视觉与视频
cctest.ai
视觉与视频

FlowMimic:用像素对流场把图像编辑“迁移”到视频编辑

这篇工作试图解决一个长期痛点:视频编辑数据难采、成本高、任务类型又不够丰富。FlowMimic提出一种不用掩码的生成与编辑框架,把图像编辑样本实时转成视频编辑样本,并让模型在图像与视频两种模态之间相互“模仿”。

阅读全文