返回文章列表
视觉与视频

Gemini Omni 1.1 Flash:生成式视频进入可控迭代阶段

阅读约 2 分钟

导语

生成式视频工具正在从“生成一个片段”转向“参与完整制作流程”。Google DeepMind 发布的 Gemini Omni 1.1 Flash,重点并非单纯提高画质,而是为开发者提供更多可控制、可重复的创作接口。新版本覆盖场景续写、关键帧过渡、低分辨率预览、高清放大和视频参考输入,目标是让生成视频更接近实际的剪辑与制作工作流。

核心要点

  • 延展已有场景:模型可以分析视频末尾最多 10 秒的上下文,再从原片段结束处继续生成。开发者能够以 10 秒为增量延长视频,累计时长最高 40 秒。相比只参考最后一秒的旧方式,更长的上下文有助于维持人物、环境和叙事衔接,但素材并未说明所有场景都能达到同等一致性。
  • 控制首尾帧:用户可以指定一段视频的起始帧和结束帧,由模型生成两者之间的连续画面。这一机制适合设计镜头环绕、推拉变焦、快速转场或循环片段,控制方式比单一文本提示更接近传统视频制作中的关键帧思路。
  • 先低清预览,再生成成片:360p 版本用于故事板、构图和提示词的快速测试。Google 表示,与标准 720p 相比,360p 预览最高可快 60%,成本约为三分之一。最终项目则可输出 1080p 或 4K 版本,从而把探索与交付环节分开。
  • 加入视频参考:多模态输入最多可参考 3 秒视频,用于提供动作、视觉上下文和角色一致性线索。官方示例展示了让角色复现参考舞蹈的用法,但实际效果仍取决于参考素材与提示设计。

对开发者的意义

这些更新把生成式视频的价值从一次性创作,推进到可编排的工作流。场景延展可以减少重新生成整段视频的需要;首尾帧控制则为镜头设计提供了更明确的约束;360p 草稿降低了频繁试错的时间和费用。对视频编辑器、广告创意工具、故事板应用和媒体制作软件而言,这些能力更容易被封装成“预览—调整—输出”的产品流程。

不过,官方信息主要介绍功能和示例,尚未给出更完整的质量评测、不同题材下的一致性数据或 4K 输出的生成耗时。因此,Omni 1.1 Flash 是否适合直接用于专业交付,还需要开发者在具体镜头、人物连续性和后期流程中验证。当前版本可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 开始构建。

Google DeepMind

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SparsePR:用“分区+残差重建”加速视频生成注意力
视觉与视频
cctest.ai
视觉与视频

SparsePR:用“分区+残差重建”加速视频生成注意力

SparsePR提出一种无需再训练的稀疏注意力方案,通过响应耦合分区和探针拟合残差重建,降低视频Transformer的注意力计算成本。在四个视频生成与世界模型上,该方法以22.0%至26.0%的实际执行密度实现质量保持,并取得1.48至2.61倍端到端加速。

阅读全文