首页 AI实时资讯内容详情

FLUX 3 多模态 AI 模型登场:支持单次生成 20 秒多样化视频

2026-07-24 3 暗号导航联盟

7月24日消息来自IT之家, Black Labs在昨日, 也就是7月23日, 发布了博文, 宣布以Early方式上线推出名为Flux 3的多模态基础模型, 该模型采用统一架构来联合学习图像、视频以及音频。

IT之家援引博文介绍, 在训练方面, 这款模型是基于Self - Flow(自监督流匹配)学习框架进行扩展的, 它同步对视频、图像以及音频展开训练, 并且是在FLUX.1和FLUX.2系列的基础之上, 将其应用范围扩大到多模态生成与理解任务。

FLUX 3能够于单次生成之时输出时长最长达20秒的视频, 并且还附带原生音频。官方宣称这个模型支持文生视频、图生视频、视频生视频、输入视频同音频续写、关键帧转视频、多语言对话以及多镜头串联来呈现出不同的效果。

多模态视频分类_多模态视频理解_

带着声音, 时长为 10 秒, 分辨率是 720p 的视频, 在人工评测上面它的性能方面,结果得以显现, 里面表明, FLUX 3 和 Grok Video 相比之下, 具备在胜率方面为 69%的局势, FLUX 3 与 2.0 去对比, 它的胜率是 52%, FLUX 3 和 Omni Flash 比较起来, 胜率依旧是 52%。

朝机器人领域, Black Labs正和Mimic着手合作, 针对把FLUX 3用作机器人行为预判模型展开研究, 而且有先后步骤, 先前期探讨, 达成初步共识后深入钻研直至取得成果。

在图像能力上边, 官方表明 FLUX3 能够达成图像生成以及编辑, 涵盖多种风格, 有着多种宽高比, 还有多种分辨率。

相关标签: # FLUX3 # 多模态AI # 视频生成 # 机器人行为预测 # 图像编辑