Loading

Flux 3 AI 视频生成器

画面与声音同步生成 —— 三种 AI 视频创作方式

Flux 3 是 FLUX 家族于 2026 年 7 月发布的多模态生成模型 —— 用一套统一架构同时处理视频、图像与音频,而不是把它们拆成互不相通的工具。输入一段文本、一张图像,或一组首帧与尾帧,即可得到画面与同步声音一并生成的成片。选 720p 求快、1080p 求细节,时长 5 到 20 秒可调,八种宽高比(含自适应)任选。

早期的 FLUX 专注于静态图像,Flux 3 则把这个家族拓展到动态影像与声音,各模态在训练中相互增强。在 LoveGen AI 上有三种用法:文本生视频,从一段文字描述直接产出完整片段;图像生视频,让一张静态首帧延展成连贯自然的运动;首尾帧生视频,给定起始图与结束图,由模型补全两者之间的画面,让你精确控制镜头如何开始、如何结束。无需订阅,只为实际生成的内容付费。

如何使用 Flux 3

01

第 1 步:选择你的模式

选择「文本」从提示词生成,「图像」让一张照片动起来,或「首尾帧」提供起始帧与结束帧、由 Flux 3 在两者之间补全过渡。

02

第 2 步:填写提示词并选择设置

描述场景与运动,然后设置分辨率(720p/1080p)、时长(5–20 秒或自动)、宽高比,以及是否生成同步音频。

03

第 3 步:生成并下载

点击生成,让 Flux 3 渲染视频并同步生成音频。在浏览器中预览,准备就绪后下载 MP4。

Flux 3 技术规格

提供方Black Forest Labs
发布日期2026 年 7 月
分辨率720p、1080p
视频时长5–20 秒(或自动)
宽高比21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16, 自动
音频生成原生同步音频(默认开启)
输入模式文本生视频、图像生视频、首尾帧生视频
输入图像PNG、JPEG、WebP

为什么选择 Flux 3

单一多模态模型

Flux 3 无需拼接多个独立工具,而是在一个统一架构内同时生成画面与同步声音——将 FLUX 家族标志性的画面品质带入动态影像。

音画同步生成

每条视频都自带 AI 生成的音频——音效、环境声和语音——与画面完美对齐,且无需额外付费,默认开启,也可关闭。

首帧与尾帧控制

给定起始图与结束图,Flux 3 会补全两者之间的运动,让你精确控制镜头如何开场、如何收尾,不必只靠提示词碰运气。

Flux 3 与其他 AI 视频生成器对比

FeatureFlux 3Seedance 2.0 MiniHappy Horse 1.0Veo 3.1
提供方Black Forest LabsByteDanceHappy Horse AIGoogle DeepMind
最高分辨率1080p720p1080p1080p
最长时长20s15s15s8s
原生音频支持支持支持支持
输入模式文本、图像、首尾帧文本、图像、参考文本、图像、参考文本、图像
最适合多模态创作速度与成本电影级运动照片级真实感

用 Flux 3 你能创作什么

01

热点与社交内容

快速制作带电影级运动和内置音频的 TikTok、Reels 和 Shorts——非常适合在热点爆发当天就跟上潮流。

02

产品与广告片段

用首/尾帧控制和同步声音,将产品照片转化为简短的宣传片。

03

无缝过渡与循环

把同一张图同时用作首帧和尾帧,得到干净的循环片段;用两张不同的图,则能让一个场景变形过渡到另一个。

04

从静态图像到动态视频

先用 Flux 2 Pro 等图像模型生成静态画面,再为其配上匹配的声音,将其转化为动态视频。

05

1080p 主镜头

需要在大屏幕上呈现更多细节时,可用 1080p 渲染关键镜头,最长可达 20 秒。

06

故事板与预演

在投入完整制作之前,根据文本提示词快速可视化场景和镜头。

探索相关 AI 视频生成器

Flux 3 常见问题

什么是 Flux 3?

Flux 3 是 FLUX 模型家族的最新一代,于 2026 年 7 月发布。与此前专注静态图像的 FLUX 版本不同,Flux 3 是多模态的 —— 一次生成即可产出带同步音频的视频。在 LoveGen AI 上,你可以用它做文本生视频、图像生视频和首尾帧生视频,分辨率 720p 或 1080p,时长 5 到 20 秒。

Flux 3 与 Flux 2 Pro、FLUX.2 有何不同?

Flux 2 Pro 和 FLUX.2 是图像模型——它们生成静态图片。Flux 3 将这一系列拓展到了动态与声音:这是一个能生成带同步音频视频的多模态模型。如果你需要静态图片,请使用 Flux 2 Pro;如果你想让这些画面动起来并发出声音,请使用 Flux 3。

它支持哪些输入模式?

三种:文本生视频(从提示词直接生成)、图像生视频(让一张起始帧延展成自然运动),以及首尾帧生视频(给定起始图与结束图,Flux 3 在两者之间插值补全整个镜头)。

它会生成音频吗?

会。同步音频——包括音效、环境声和语音——默认生成,无需额外付费。如果你只需要无声画面,也可以将其关闭。

有哪些可用的分辨率、时长和宽高比?

分辨率为 720p 和 1080p。时长 5 到 20 秒,也可选自动让模型自行决定 —— 首尾帧模式需要指定具体时长,不支持自动。宽高比包括 21:9、2:1、16:9、4:3、1:1、3:4、9:16 和自动。

计费方式是怎样的?

无需订阅 —— 按次用积分付费。费用随分辨率与时长变化,较短的 720p 片段比更长的 1080p 视频便宜。