文章与教程

视觉与视频

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 39 篇文章

CCTest · Blog
ShallowStream:先浅层建索引,再深层理解连续视频
视觉与视频
cctest.ai
视觉与视频

ShallowStream:先浅层建索引,再深层理解连续视频

ShallowStream 将多模态大模型的浅层计算用于持续视频编码和检索索引构建,查询时再调用深层能力完成回答。在保持接近现有流式方法效果的同时,论文报告其单帧预填充延迟最高降低 52.1 倍,10 秒端到端延迟最高降低 11.9 倍。

阅读全文
CCTest · Blog
视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化
视觉与视频
cctest.ai
视觉与视频

视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化

一项发表于 arXiv 的研究提出 DM-Align,将视频生成模型的分布蒸馏与人类偏好对齐放进同一优化框架。该方法借鉴 DPO 与 GRPO,从样本分布差异中直接构造偏好梯度,以降低传统强化学习流程的计算与稳定性成本。

阅读全文
CCTest · Blog
Gemini推出Agentic Video Understanding:让模型自己决定“看哪里”
视觉与视频
cctest.ai
视觉与视频

Gemini推出Agentic Video Understanding:让模型自己决定“看哪里”

Google DeepMind为Gemini引入Agentic Video Understanding,使模型能够动态搜索视频片段,并按需调用画面、音频和字幕信息。官方称,该能力在部分基准上可将Token消耗降低最多88%,成本降低最多66%,准确率提升最多7%。

阅读全文
CCTest · Blog
SparsePR:用“分区+残差重建”加速视频生成注意力
视觉与视频
cctest.ai
视觉与视频

SparsePR:用“分区+残差重建”加速视频生成注意力

SparsePR提出一种无需再训练的稀疏注意力方案,通过响应耦合分区和探针拟合残差重建,降低视频Transformer的注意力计算成本。在四个视频生成与世界模型上,该方法以22.0%至26.0%的实际执行密度实现质量保持,并取得1.48至2.61倍端到端加速。

阅读全文
CCTest · Blog
跨越形态差异的视频运动迁移:MBM 尝试摆脱“骨架对应”依赖
视觉与视频
cctest.ai
视觉与视频

跨越形态差异的视频运动迁移:MBM 尝试摆脱“骨架对应”依赖

Motion Beyond Morphology(MBM)提出一种新的运动迁移思路:不再要求参考对象与目标对象拥有固定结构对应,而是学习可跨形态保留的抽象运动。该方法面向同类、近类与远类对象的视频生成任务,强调运动一致性与目标外观保持。

阅读全文
CCTest · Blog
O-VAD:让工业视频异常检测从“看整段视频”转向“盯住每个物体”
视觉与视频
cctest.ai
视觉与视频

O-VAD:让工业视频异常检测从“看整段视频”转向“盯住每个物体”

O-VAD 提出一种免训练的工业视频异常检测框架,通过对象级分割、跟踪与状态轨迹推理,定位生产流程中的异常物体与异常过程。其核心观点是:前沿视觉语言模型在工业场景失灵,往往不是不会推理,而是缺少足够细的对象证据。

阅读全文
CCTest · Blog
让生成视频“记得来过”:无需训练的自回归渲染一致性方法
视觉与视频
cctest.ai
视觉与视频

让生成视频“记得来过”:无需训练的自回归渲染一致性方法

这篇论文关注条件视频生成在 3D 场景长程渲染中的一个关键痛点:镜头回到同一地点时,外观常常被重新生成得不一致。作者提出一种无需后训练的“闭环记忆”机制,利用 3D 引擎已有的位姿、深度与重投影信息提升重访一致性。

阅读全文