返回文章列表
视觉与视频

Wan 3.0 公测:阿里把视频生成推进到“文档驱动”时代

阅读约 2 分钟

阿里巴巴视频生成模型 Wan 3.0 进入公测,释放出的信号不只是“又一个视频模型上新”,而是视频生成开始明显向信息表达与生产协作靠拢。相比传统只靠提示词生成短片段的模式,Wan 3.0 更像是在尝试把视频模型做成一种可直接承接业务材料的创作接口。

这次升级看点

  • 单次生成时长提升到 30 秒:相比常见的短视频片段生成,30 秒更适合承载完整叙事,也让一镜到底、连续运镜等复杂镜头更容易落地。
  • 输入模态扩展到文档格式:除了文本、图片、音频、视频,Wan 3.0 还支持 doc、xls、ppt、pdf、md 等文件输入。对于教学、汇报、演示、产品介绍类内容,这一点尤其关键。
  • 更强调真实感:模型在人物细节、表情、肢体动作和场景还原上继续强化,目标不是“看起来像”,而是“看起来可信”。
  • 支持视频编辑:它不只是生成,还能修改画面、剧情和台词,说明产品能力已经延伸到后期编辑环节。

为什么这很重要

Wan 3.0 的变化,本质上是视频模型使用门槛在下降、应用边界在上升。过去,视频生成更多服务于创意展示或概念预览;现在,当 PPT、PDF、表格都能作为输入时,视频模型就开始具备“把资料变成表达”的能力。这意味着它不仅适合做广告、短片,也可能进入培训课件、销售演示、业务汇报、方案说明等更高频的办公场景。

另一个值得注意的方向是“全能参考”能力的强化。模型不再只关注画面是否漂亮,而是要稳定保留角色、道具、空间关系、风格和声音等细粒度信息。这种趋势说明,视频生成正在从单点图像美学,转向更完整的内容一致性与可控性。

当然,素材也提到,Wan 3.0 在声音质感和文字准确度上仍有提升空间。换句话说,它已经把视频生成推到了一个更实用的位置,但距离真正替代人工编辑,还有一段路要走。

总体来看,Wan 3.0 的公测更像一次方向性验证:视频模型不再只追求“生成一段好看的视频”,而是在尝试成为一种连接文档、知识与视觉表达的通用工具。若后续 API 完全开放、价格和调用体验进一步成熟,它有机会进入更广泛的企业内容生产流程。

来源链接:量子位

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
跨越形态差异的视频运动迁移:MBM 尝试摆脱“骨架对应”依赖
视觉与视频
cctest.ai
视觉与视频

跨越形态差异的视频运动迁移:MBM 尝试摆脱“骨架对应”依赖

Motion Beyond Morphology(MBM)提出一种新的运动迁移思路:不再要求参考对象与目标对象拥有固定结构对应,而是学习可跨形态保留的抽象运动。该方法面向同类、近类与远类对象的视频生成任务,强调运动一致性与目标外观保持。

阅读全文