FLUX 3 是 Black Forest Labs 在 FLUX / FLUX.2 图像系列之后发布的新一代多模态基础模型。它不再把静态图像当作孤立任务,而是在统一架构中联合学习图像、视频与音频。目标不仅是「更好看的画面」,而是更理解场景如何呈现、运动如何展开、事件如何发声。共享骨干支撑静帧与短视频创作。围绕 FLUX 3 的产品线包括 FLUX 3 Video(可选原生音频)与 FLUX 3 Image(合成与编辑)。本页说明 FLUX 3 是什么、为何多模态模型对创作者重要,以及上线本平台后你可以期待什么。
FLUX 3 被设计为跨图像、视频与音频信号训练的统一多模态系统,而不是训练后再硬拼的多套独立模型。
通过同时学习场景外观、运动与声音,FLUX 3 把握结构、运动与视觉因果,而不只是孤立像素纹理。
同一模型家族面向高质量图像生成,以及可选音频的短视频,有助于同一战役中观感更一致。
从营销视觉到社媒短片与品牌叙事,FLUX 3 瞄准生产向的创意场景,而不只是实验室演示。
FLUX 3 标志着从「只做静帧」迈向把视觉视为多模态、时间连续问题的模型。对每周都要交付内容的团队而言,这会影响质量、一致性与工作流设计。
研究 FLUX 3 图像与视频工作流时,创作者最该了解的能力点。
生成最长约 20 秒的短视频,并可选用原生音频。擅长表情表现、事件关联声音与多语言场景,适合广告与社媒内容。
图像合成与编辑,在复杂提示词与多语言文字渲染上较既往 FLUX 更强,风格覆盖更广,适合营销、产品与设计资产。
同一架构跨图像、视频与音频训练,让静帧与动态共享对物体、光照与场景结构更一致的理解。
更强的复杂提示词遵循与多语言高精度文字——对海报、UI 稿、包装与多语言战役至关重要。
支持多种输出风格与画幅,团队可在写实、插画与品牌化视觉之间探索,而无需为每种格式更换模型家族。
面向创意工具、媒体、设计与电商叙事——与团队已在用的 FLUX.2 级图像工作类似,并扩展到短视频。
把 FLUX 3 映射到具体创作任务,便于规划战役与内容路线图。
在 FLUX 3 上线本平台前,用下列步骤准备好多模态创作工作流。
FLUX 3 即将在此上线。请关注本页与生成器入口,了解 Image / Video 开放进度。
现在就强化提示词、参考图纪律与品牌规范。这些资产会在 FLUX 3 Image / Video 进入流水线后平滑迁移。
记录哪些镜头需要原生音频、哪些适合后期配乐,以及目标时长、画幅与语言需求,便于上线后更快试点。
继续用本平台已上线的生产级图像模型交付。你现在积累的技能与资产,会在 FLUX 3 到来后继续沿用。
关于 FLUX 3 以及与 FLUX.2 差异的常见问题。