FLUX 3

Black Forest Labs 面向视觉创作的多模态前沿模型。
用文本或图像生成带原生音频的视频 — 最长 20 秒,支持 720p / 1080p。

什么是 FLUX 3?

FLUX 3 是 Black Forest Labs 在 FLUX / FLUX.2 图像系列之后发布的新一代多模态基础模型。它不再把静态图像当作孤立任务,而是在统一架构中联合学习图像、视频与音频。目标不仅是「更好看的画面」,而是更理解场景如何呈现、运动如何展开、事件如何发声。共享骨干支撑静帧与短视频创作。在 Flux.art 可立即使用 FLUX 3 Video:文生视频与图生视频、可选原生音频、草稿预览,时长最长 20 秒。

原生多模态架构

FLUX 3 被设计为跨图像、视频与音频信号训练的统一多模态系统,而不是训练后再硬拼的多套独立模型。

更强的场景理解

通过同时学习场景外观、运动与声音,FLUX 3 把握结构、运动与视觉因果,而不只是孤立像素纹理。

静帧与动态一体

同一模型家族面向高质量图像生成,以及可选音频的短视频,有助于同一战役中观感更一致。

面向创作工作流

从营销视觉到社媒短片与品牌叙事,FLUX 3 瞄准生产向的创意场景,而不只是实验室演示。

为什么创作者该关注 FLUX 3

FLUX 3 标志着从「只做静帧」迈向把视觉视为多模态、时间连续问题的模型。对每周都要交付内容的团队而言,这会影响质量、一致性与工作流设计。

既往 FLUX 模型擅长高质量静帧生成与编辑。FLUX 3 保留这一创作基因,并在同一训练范式下加入原生视频与可选音频。共享表征有助于关键帧风格与短片观感更一致,减少在无关图像/视频工具之间切换时常见的风格漂移。对营销、产品叙事与社媒内容而言,统一模型家族往往更易落地。

FLUX 3 能力一览

研究 FLUX 3 图像与视频工作流时,创作者最该了解的能力点。

FLUX 3 Video

生成最长约 20 秒的短视频,并可选用原生音频。擅长表情表现、事件关联声音与多语言场景,适合广告与社媒内容。

FLUX 3 Image

图像合成与编辑,在复杂提示词与多语言文字渲染上较既往 FLUX 更强,风格覆盖更广,适合营销、产品与设计资产。

统一多模态骨干

同一架构跨图像、视频与音频训练,让静帧与动态共享对物体、光照与场景结构更一致的理解。

提示词遵循与文字

更强的复杂提示词遵循与多语言高精度文字——对海报、UI 稿、包装与多语言战役至关重要。

面向生产的风格广度

支持多种输出风格与画幅,团队可在写实、插画与品牌化视觉之间探索,而无需为每种格式更换模型家族。

贴合创作者工作流

面向创意工具、媒体、设计与电商叙事——与团队已在用的 FLUX.2 级图像工作类似,并扩展到短视频。

FLUX 3 适合哪些真实工作流

把 FLUX 3 映射到具体创作任务,便于规划战役与内容路线图。

如何使用 FLUX 3

在 Flux.art 上几步即可生成 FLUX 3 Video。

1

打开视频生成器

进入 AI 视频生成器,选择 FLUX 3,支持文生视频与图生视频。

2

设置时长、画质与音频

选择 5–20 秒(或 Auto)、720p/1080p、原生音频,以及可选的草稿模式做快速预览。

3

填写提示词或上传分镜图

描述场景,或上传最多 10 张参考图——首张作起始帧,末张作结束帧。

4

生成并下载

提交任务,预览带同步音频的 MP4,下载或用草稿模式继续迭代。

FLUX 3 常见问题

关于 FLUX 3 以及与 FLUX.2 差异的常见问题。






试用 FLUX 3 Video

用文本或图像生成带原生音频的短片 — 现已在 Flux.art 上线。