FLUX 3

Black Forest Labs 面向视觉创作的多模态前沿模型。
同一架构覆盖图像、带原生音频的视频与更强的动态表现 — 服务创作者与团队。

什么是 FLUX 3?

FLUX 3 是 Black Forest Labs 在 FLUX / FLUX.2 图像系列之后发布的新一代多模态基础模型。它不再把静态图像当作孤立任务,而是在统一架构中联合学习图像、视频与音频。目标不仅是「更好看的画面」,而是更理解场景如何呈现、运动如何展开、事件如何发声。共享骨干支撑静帧与短视频创作。围绕 FLUX 3 的产品线包括 FLUX 3 Video(可选原生音频)与 FLUX 3 Image(合成与编辑)。本页说明 FLUX 3 是什么、为何多模态模型对创作者重要,以及上线本平台后你可以期待什么。

原生多模态架构

FLUX 3 被设计为跨图像、视频与音频信号训练的统一多模态系统,而不是训练后再硬拼的多套独立模型。

更强的场景理解

通过同时学习场景外观、运动与声音,FLUX 3 把握结构、运动与视觉因果,而不只是孤立像素纹理。

静帧与动态一体

同一模型家族面向高质量图像生成,以及可选音频的短视频,有助于同一战役中观感更一致。

面向创作工作流

从营销视觉到社媒短片与品牌叙事,FLUX 3 瞄准生产向的创意场景,而不只是实验室演示。

为什么创作者该关注 FLUX 3

FLUX 3 标志着从「只做静帧」迈向把视觉视为多模态、时间连续问题的模型。对每周都要交付内容的团队而言,这会影响质量、一致性与工作流设计。

既往 FLUX 模型擅长高质量静帧生成与编辑。FLUX 3 保留这一创作基因,并在同一训练范式下加入原生视频与可选音频。共享表征有助于关键帧风格与短片观感更一致,减少在无关图像/视频工具之间切换时常见的风格漂移。对营销、产品叙事与社媒内容而言,统一模型家族往往更易落地。

FLUX 3 能力一览

研究 FLUX 3 图像与视频工作流时,创作者最该了解的能力点。

FLUX 3 Video

生成最长约 20 秒的短视频,并可选用原生音频。擅长表情表现、事件关联声音与多语言场景,适合广告与社媒内容。

FLUX 3 Image

图像合成与编辑,在复杂提示词与多语言文字渲染上较既往 FLUX 更强,风格覆盖更广,适合营销、产品与设计资产。

统一多模态骨干

同一架构跨图像、视频与音频训练,让静帧与动态共享对物体、光照与场景结构更一致的理解。

提示词遵循与文字

更强的复杂提示词遵循与多语言高精度文字——对海报、UI 稿、包装与多语言战役至关重要。

面向生产的风格广度

支持多种输出风格与画幅,团队可在写实、插画与品牌化视觉之间探索,而无需为每种格式更换模型家族。

贴合创作者工作流

面向创意工具、媒体、设计与电商叙事——与团队已在用的 FLUX.2 级图像工作类似,并扩展到短视频。

FLUX 3 适合哪些真实工作流

把 FLUX 3 映射到具体创作任务,便于规划战役与内容路线图。

如何为 FLUX 3 做好准备

在 FLUX 3 上线本平台前,用下列步骤准备好多模态创作工作流。

1

关注本站更新

FLUX 3 即将在此上线。请关注本页与生成器入口,了解 Image / Video 开放进度。

2

打磨提示词与品牌体系

现在就强化提示词、参考图纪律与品牌规范。这些资产会在 FLUX 3 Image / Video 进入流水线后平滑迁移。

3

定义动态与音频规格

记录哪些镜头需要原生音频、哪些适合后期配乐,以及目标时长、画幅与语言需求,便于上线后更快试点。

4

今天继续用 FLUX.2 创作

继续用本平台已上线的生产级图像模型交付。你现在积累的技能与资产,会在 FLUX 3 到来后继续沿用。

FLUX 3 常见问题

关于 FLUX 3 以及与 FLUX.2 差异的常见问题。






FLUX 3 即将推出

把 FLUX 3 视为视觉 AI 的多模态未来。敬请期待 — 平台接入即将到来。