Loading

Flux 3 AI 视频生成器

自带原生音频的多模态 AI 视频 —— 三种创作方式

Flux 3 是 FLUX 家族于 2026 年 7 月发布的多模态生成模型——它基于统一架构处理视频、图像与音频,而不再依赖彼此独立的工具。将一段文本提示词、一张图像,或一组参考图像、片段与音频轨道,转化为与画面同时生成同步音效的精致视频。选择 480p 以求速度,或选择 720p 以求平衡,将时长设置为 4 到 15 秒,并从包括自适应在内的七种宽高比中选择。

早期的 FLUX 版本专注于静态图像,而 Flux 3 将这一系列拓展到了动态与声音领域,每种模态在训练中都相互强化。在 LoveGen AI 上,你可以通过三种方式运用它。文本生视频根据书面描述生成完整的片段。图像生视频可让起始帧动起来,并能向可选的结束帧插值,以实现可控的过渡。参考生视频最多可接受 9 张参考图像(在提示词中以 @Image1、@Image2 引用)、最多 3 段参考视频和最多 3 段参考音频轨道,让你能够在多次生成之间延续角色、风格、运动与情绪。无需订阅——你只需为所生成的内容付费。

如何使用 Flux 3

01

第 1 步:选择你的模式

选择「文本」以根据提示词生成,选择「图像」以让照片动起来(可选结束帧),或选择「参考」以用最多 9 张图像加参考视频和音频来引导视频。

02

第 2 步:撰写提示词与设置

描述场景与运动,然后设置分辨率(480p/720p)、时长(4–15s 或自动)、宽高比,以及是否生成同步音频。

03

第 3 步:生成并下载

点击生成,让 Flux 3 渲染出带原生音频的视频。在浏览器中预览,准备就绪后下载 MP4。

Flux 3 技术规格

提供方Black Forest Labs
发布日期July 2026
分辨率480p, 720p
视频时长4–15 seconds(或自动)
宽高比21:9, 16:9, 4:3, 1:1, 3:4, 9:16, 自动
音频生成原生同步音频(默认开启)
输入模式文本生视频、图像生视频(首/尾帧)、参考生视频
参考输入最多 9 images、3 videos、3 audio(≤12 total)

为什么选择 Flux 3

单一多模态模型

Flux 3 无需拼接多个独立工具,而是在一个统一架构内同时生成画面与同步声音——将 FLUX 家族标志性的画面品质带入动态影像。

原生同步音频

每条视频都自带 AI 生成的音频——音效、环境声和语音——与画面完美对齐,且无需额外付费,默认开启,也可关闭。

参考驱动的一致性

通过最多九张参考图像加参考视频与音频来引导生成,让角色、风格与氛围在多个片段之间保持一致。

Flux 3 与其他 AI 视频生成器对比

FeatureFlux 3Seedance 2.0 MiniHappy Horse 1.0Veo 3.1
提供方Black Forest LabsByteDanceHappy Horse AIGoogle DeepMind
最高分辨率720p720p1080p1080p
最长时长15s15s15s8s
原生音频支持支持支持支持
输入模式文本、图像、参考文本、图像、参考文本、图像、参考文本、图像
最适合多模态创作速度与成本电影级运动照片级真实感

用 Flux 3 你能创作什么

01

热点与社交内容

快速制作带电影级运动和内置音频的 TikTok、Reels 和 Shorts——非常适合在热点爆发当天就跟上潮流。

02

产品与广告片段

用首/尾帧控制和同步声音,将产品照片转化为简短的宣传片。

03

角色一致性

使用参考图像并配合 @Image 引用,在多个片段间保持角色或风格一致。

04

图像转动态流程

先用 Flux 2 Pro 等图像模型生成静态画面,再为其配上匹配的声音,将其转化为动态视频。

05

声音驱动的片段

在图像或视频之外提供参考音频,以引导情绪、节奏和环境氛围。

06

故事板与预演

在投入完整制作之前,根据文本提示词快速可视化场景和镜头。

探索相关 AI 视频生成器

Flux 3 常见问题

什么是 Flux 3?

Flux 3 是 FLUX 模型家族于 2026 年 7 月发布的最新一代产品。与专注于静态图像的早期 FLUX 版本不同,Flux 3 是多模态的——它能在一次处理中生成带同步音频的视频。在 LoveGen AI 上,你可以以 480p 或 720p、4 到 15 秒的时长使用文本生视频、图像生视频和参考生视频。

Flux 3 与 Flux 2 Pro、FLUX.2 有何不同?

Flux 2 Pro 和 FLUX.2 是图像模型——它们生成静态图片。Flux 3 将这一系列拓展到了动态与声音:这是一个能生成带同步音频视频的多模态模型。如果你需要静态图片,请使用 Flux 2 Pro;如果你想让这些画面动起来并发出声音,请使用 Flux 3。

它支持哪些输入模式?

三种:文本生视频(根据提示词生成)、图像生视频(让起始帧动起来,并可选结束帧以实现可控过渡)、参考生视频(用最多 9 张参考图像,外加最多 3 段参考视频和 3 段参考音频轨道来引导结果)。

它会生成音频吗?

会。同步音频——包括音效、环境声和语音——默认生成,无需额外付费。如果你只需要无声画面,也可以将其关闭。

有哪些可用的分辨率、时长和宽高比?

分辨率为 480p(最快)和 720p。时长为 4 到 15 秒,或自动。宽高比包括 21:9、16:9、4:3、1:1、3:4、9:16 和自动。

计费方式是怎样的?

无需订阅——你按生成次数使用积分付费。费用随分辨率和时长变化,因此较短的 480p 片段比较长的 720p 视频更便宜。