Loading

Grok Imagine AI 视频生成器

用 xAI Aurora 引擎创作风格化 AI 视频

Grok Imagine 是 xAI 推出的视频生成模型,由 Aurora 自回归引擎驱动,并使用 Colossus 超算上的 11 万张 NVIDIA GB200 GPU 训练而成。它支持文生视频与图生视频,可生成 480p 或 720p、时长 6 秒或 10 秒并自带音频的视频;Fun、Normal、Spicy 三种风格模式还能让你一键调整画面的创意风格。

Grok Imagine 1.0 于 2026 年 2 月 2 日正式开放使用,此前已于 2025 年推出预览版。模型采用 xAI 的 Aurora 架构,以自回归方式逐帧预测并顺序生成画面,技术路线不同于扩散模型。训练依托 Colossus 超级计算机和 11 万张 NVIDIA GB200 GPU,是迄今 AI 视频领域规模最大的训练基础设施之一;公开平台曾在 30 天内生成超过 12.45 亿条视频。

LoveGen AI 提供两种输入模式。文生视频支持最长 2,000 个字符的提示词,并提供 16:9、9:16、1:1、3:2、2:3 五种宽高比,覆盖横屏、竖屏、方形和经典摄影画幅。图生视频支持上传一张参考图(JPG、JPEG、PNG 或 WebP,最大 20 MB),再根据提示词为图片添加动态。两种模式均以 24 fps 生成,可选择 6 秒或 10 秒,最高输出 720p。

Grok Imagine 的核心亮点是风格模式。Normal 的效果均衡且忠实于提示词;Fun 更俏皮、夸张,鼓励富有创意的解读;Spicy 则呈现更大胆、更具戏剧张力的效果。Aurora 会在一次生成过程中同步完成画面与音频,包括带口型同步的对白、背景音乐和环境音效,无需另行后期合成。2026 年 3 月 2 日,xAI 推出 Extend from Frame,可将上一段视频的最后一帧作为下一段的起始帧,连续扩展画面。模型平均约 30 秒即可生成一段 6 秒或 10 秒的视频。LoveGen AI 会在后台异步执行任务;提交后,成片会自动出现在素材库中,方便你预览、下载,并在同一工作区与 Sora 2、Veo 3.1、Seedance 2.0 和 Happy Horse 1.0 直接对比。

如何使用 Grok Imagine

01

第一步:选择文生视频或图生视频

选择仅通过提示词创作的文生视频,或上传参考图并让画面动起来的图生视频。

02

第二步:设置参数

选择时长(6 秒或 10 秒)、分辨率(480p 或 720p)、宽高比(仅 T2V)和风格模式(Fun 或 Normal)。

03

第三步:生成并下载

点击“生成”。Aurora 通常会在约 30 秒内返回一段自带音频的成片,你可以直接预览、下载,或在素材库中与其他模型并排对比。

Grok Imagine 技术规格

提供方xAI
引擎Aurora — 自回归逐帧预测
最新版本Grok Imagine 1.0(2026 年 2 月 2 日正式上线)
训练基础设施Colossus 超算,110,000 张 NVIDIA GB200 GPU
输入模式文本生成视频、图像生成视频
风格模式Fun、Normal、Spicy
视频时长6 秒或 10 秒(xAI 还通过 Extend from Frame 提供 15 秒)
分辨率480p、720p
帧率24 fps
宽高比(T2V)16:9, 9:16, 1:1, 3:2, 2:3
图像输入(I2V)1 张图——JPG / JPEG / PNG / WebP,最大 20 MB
音频原生——对白(带口型同步)、背景音乐、音效
生成速度平均每条约 30 秒
结果有效期生成视频链接在完成后 24 小时内有效

为什么选择 Grok Imagine

Aurora 自回归引擎

Grok Imagine 基于 Aurora——xAI 的逐帧自回归视频模型,用 110,000 张 NVIDIA GB200 GPU 训练而成,与扩散式竞品在底层架构上截然不同,也是其动作质感独特的关键原因。

三种开箱即用的风格模式

Fun、Normal、Spicy 让你无需重写提示词即可调整创意风格。多数视频模型只提供一种效果,Grok Imagine 则能让同一提示词呈现三种不同方向。

原生音频,单次前向生成

对白(带口型同步)、环境音、背景音乐与画面联合生成——没有独立音频流程,也不会有同步偏移。

Grok Imagine 与其他 AI 视频生成器对比

FeatureGrok ImagineSora 2Veo 3.1Seedance 2.0
提供方xAIOpenAIGoogle DeepMindByteDance
架构Aurora(自回归)扩散扩散扩散
最高分辨率720p1080p1080p1080p
时长选项6 秒、10 秒(通过 Extend 达 15 秒)4s, 8s, 12s4s, 6s, 8s4-15s
风格模式Fun, Normal, Spicy单一模式单一模式单一模式
图像输入1 张图(I2V)1 张图 + Cameos最多 3 张1–2 张
宽高比(T2V)16:9, 9:16, 1:1, 3:2, 2:316:9, 9:16, 1:1, 3:2, 2:316:9, 9:1616:9、9:16、1:1,另 +4 种
原生音频
平均生成速度~30s~60s~45s~40s

适合创作者、营销与故事讲述者

01

社交媒体短片

用 9:16 或 1:1 生成 6 秒或 10 秒短片,适合 TikTok、Reels 和 Shorts。Fun 模式让内容活力满满,原生音频已就绪。

02

图像动画

上传现有照片或插画,让它动起来——非常适合产品图、角色画稿或幕后剪影。

03

概念分镜板

用 480p 快速试出多个风格方向,确认后再以 720p 重渲——非常适合创意发散与提案。

04

广告与推广片

16:9 横屏用于主视觉,9:16 竖屏用于垂直渠道。风格模式让你不重写提示词即可匹配品牌调性——俏皮或克制,任你选。

05

故事板

用 6 秒短片快速呈现脚本中的关键情节,并通过同步对白反复调整构图与运动,再切换到支持更长时长的模型。

06

教育内容

把图表、照片与概念插画动画化为短片,配上原生旁白音频——比静态幻灯片更能抓住注意力。

探索相关 AI 视频生成器

Grok Imagine 常见问题

什么是 Grok Imagine?

Grok Imagine 是 xAI 推出的视频生成模型,基于 Aurora 自回归引擎,并使用 Colossus 超算上的 11 万张 NVIDIA GB200 GPU 训练。它支持文生视频与图生视频,还提供 Fun、Normal、Spicy 三种风格模式,可让同一提示词呈现不同的创意效果。

Grok Imagine 是什么时候发布的?

Grok Imagine 在 2025 年作为预览版发布,并于 2026 年 2 月 2 日正式发布 1.0 版本。xAI 持续迭代——最近一次是 2026 年 3 月 2 日上线的 Extend from Frame,将多段链式拼接以获得每段最长 15 秒的序列。

支持哪些时长和分辨率?

Grok Imagine 可生成 6 秒或 10 秒的视频,分辨率为 480p 或 720p,帧率 24 fps,平均每条约 30 秒生成完成。

支持哪些宽高比?

文本生成视频支持 16:9、9:16、1:1、3:2、2:3,覆盖横屏、竖屏、方形和经典摄影构图。图像生成视频会保留你上传参考图的宽高比。

Fun、Normal、Spicy 三种模式有什么区别?

Normal 模式输出平衡、忠实;Fun 模式偏向俏皮、夸张、有创意;Spicy 模式解锁更大胆、更戏剧化的内容。同一提示词在不同模式下可呈现明显不同的电影氛围。

Grok Imagine 会生成音频吗?

是的。Aurora 原生在一次前向中生成对白(带口型同步)、背景音乐和环境音效,无需后期分开处理。