返回文章列表
多模态

黑森林实验室发布 Flux3:多模态模型走向音视频原生生成

阅读约 2 分钟

导语

德国人工智能初创公司黑森林实验室(Black Forest Labs)发布了多模态基础模型 Flux3。根据公开摘要,Flux3 基于 Self-Flow 架构构建,并为图像、视频、音频及动作等不同模态配置专用编解码器,目标是实现对物理环境与数字环境的统一理解与生成。

这次发布的重点不只是“能看图、能生成视频”,而是把音频、视频和动作信息放进同一个模型框架中处理。尤其是其原生音频生成能力,以及一次性输出最长 20 秒音视频同步片段的描述,使 Flux3 更接近面向复杂场景内容生成的基础模型。

核心要点

  • 多模态范围更广:Flux3 覆盖图像、视频、音频与动作等信息形态,不再局限于文本到图像或文本到视频的单一生成链路。
  • 采用 Self-Flow 架构:摘要中提到该模型基于 Self-Flow 架构打造,但目前公开材料未提供更多技术细节,因此仍需等待论文、技术报告或实际测试进一步验证。
  • 强调音视频同步生成:Flux3 可一次性输出最长 20 秒的音视频同步片段,这意味着模型尝试同时处理画面、声音与时间一致性问题。
  • 支持多种视频生成入口:其能力涵盖文本到视频、图像到视频、视频到视频等方向,显示出模型并非只面向从零生成,也可用于视频改写、延展或转换类任务。

意义与影响

多模态模型正在从“拼接式能力”走向更原生的一体化建模。过去许多系统往往由文本模型、图像模型、视频模型和音频模块组合完成任务,链路长且一致性难以保证。Flux3 所强调的统一理解与生成,代表了行业对端到端多模态基础模型的持续探索。

如果其音视频同步能力在实际场景中表现稳定,Flux3 可能会对短视频创作、广告素材生成、影视预演、虚拟角色内容和交互式媒体产生影响。不过,摘要尚未披露模型规模、训练数据、授权方式、评测结果和开放计划等关键信息,因此外界还很难判断它与现有主流多模态模型的真实差距。

总体来看,Flux3 的价值在于把“原生音频”“视频生成”和“动作建模”放到同一叙事中,为多模态基础模型提供了新的观察样本。真正的考验则在于后续是否有更透明的技术资料、可复现实验和可用产品形态。

来源:OSChina

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
AV-Flamingo:把音频、图像与长视频真正连起来的开放多模态模型
多模态
cctest.ai
多模态

AV-Flamingo:把音频、图像与长视频真正连起来的开放多模态模型

NVIDIA 推出的 AV-Flamingo 面向长而复杂的真实世界音视频场景,不再只盯着短片段,而是强调跨模态、跨时间的联合推理。它通过大规模数据、分阶段训练和带时间戳的链式思考,在多项基准上表现出很强竞争力。

阅读全文