Gemini Omni 1.1 Flash:生成式视频进入可控迭代阶段
导语
生成式视频工具正在从“生成一个片段”转向“参与完整制作流程”。Google DeepMind 发布的 Gemini Omni 1.1 Flash,重点并非单纯提高画质,而是为开发者提供更多可控制、可重复的创作接口。新版本覆盖场景续写、关键帧过渡、低分辨率预览、高清放大和视频参考输入,目标是让生成视频更接近实际的剪辑与制作工作流。
核心要点
- 延展已有场景:模型可以分析视频末尾最多 10 秒的上下文,再从原片段结束处继续生成。开发者能够以 10 秒为增量延长视频,累计时长最高 40 秒。相比只参考最后一秒的旧方式,更长的上下文有助于维持人物、环境和叙事衔接,但素材并未说明所有场景都能达到同等一致性。
- 控制首尾帧:用户可以指定一段视频的起始帧和结束帧,由模型生成两者之间的连续画面。这一机制适合设计镜头环绕、推拉变焦、快速转场或循环片段,控制方式比单一文本提示更接近传统视频制作中的关键帧思路。
- 先低清预览,再生成成片:360p 版本用于故事板、构图和提示词的快速测试。Google 表示,与标准 720p 相比,360p 预览最高可快 60%,成本约为三分之一。最终项目则可输出 1080p 或 4K 版本,从而把探索与交付环节分开。
- 加入视频参考:多模态输入最多可参考 3 秒视频,用于提供动作、视觉上下文和角色一致性线索。官方示例展示了让角色复现参考舞蹈的用法,但实际效果仍取决于参考素材与提示设计。
对开发者的意义
这些更新把生成式视频的价值从一次性创作,推进到可编排的工作流。场景延展可以减少重新生成整段视频的需要;首尾帧控制则为镜头设计提供了更明确的约束;360p 草稿降低了频繁试错的时间和费用。对视频编辑器、广告创意工具、故事板应用和媒体制作软件而言,这些能力更容易被封装成“预览—调整—输出”的产品流程。
不过,官方信息主要介绍功能和示例,尚未给出更完整的质量评测、不同题材下的一致性数据或 4K 输出的生成耗时。因此,Omni 1.1 Flash 是否适合直接用于专业交付,还需要开发者在具体镜头、人物连续性和后期流程中验证。当前版本可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 开始构建。
评论
正在确认登录状态……
正在加载评论……