FLUX 3 是 Black Forest Labs 在 FLUX / FLUX.2 图像系列之后发布的新一代多模态基础模型。它不再把静态图像当作孤立任务,而是在统一架构中联合学习图像、视频与音频。目标不仅是「更好看的画面」,而是更理解场景如何呈现、运动如何展开、事件如何发声。共享骨干支撑静帧与短视频创作。在 Flux.art 可立即使用 FLUX 3 Video:文生视频与图生视频、可选原生音频、草稿预览,时长最长 20 秒。
FLUX 3 被设计为跨图像、视频与音频信号训练的统一多模态系统,而不是训练后再硬拼的多套独立模型。
通过同时学习场景外观、运动与声音,FLUX 3 把握结构、运动与视觉因果,而不只是孤立像素纹理。
同一模型家族面向高质量图像生成,以及可选音频的短视频,有助于同一战役中观感更一致。
从营销视觉到社媒短片与品牌叙事,FLUX 3 瞄准生产向的创意场景,而不只是实验室演示。
FLUX 3 标志着从「只做静帧」迈向把视觉视为多模态、时间连续问题的模型。对每周都要交付内容的团队而言,这会影响质量、一致性与工作流设计。
研究 FLUX 3 图像与视频工作流时,创作者最该了解的能力点。
生成最长约 20 秒的短视频,并可选用原生音频。擅长表情表现、事件关联声音与多语言场景,适合广告与社媒内容。
图像合成与编辑,在复杂提示词与多语言文字渲染上较既往 FLUX 更强,风格覆盖更广,适合营销、产品与设计资产。
同一架构跨图像、视频与音频训练,让静帧与动态共享对物体、光照与场景结构更一致的理解。
更强的复杂提示词遵循与多语言高精度文字——对海报、UI 稿、包装与多语言战役至关重要。
支持多种输出风格与画幅,团队可在写实、插画与品牌化视觉之间探索,而无需为每种格式更换模型家族。
面向创意工具、媒体、设计与电商叙事——与团队已在用的 FLUX.2 级图像工作类似,并扩展到短视频。
把 FLUX 3 映射到具体创作任务,便于规划战役与内容路线图。
在 Flux.art 上几步即可生成 FLUX 3 Video。
进入 AI 视频生成器,选择 FLUX 3,支持文生视频与图生视频。
选择 5–20 秒(或 Auto)、720p/1080p、原生音频,以及可选的草稿模式做快速预览。
描述场景,或上传最多 10 张参考图——首张作起始帧,末张作结束帧。
提交任务,预览带同步音频的 MP4,下载或用草稿模式继续迭代。
关于 FLUX 3 以及与 FLUX.2 差异的常见问题。