
Grok Imagine AI 视频生成器
用 xAI Aurora 引擎创作风格化 AI 视频
Grok Imagine 是 xAI 推出的视频生成模型,由 Aurora 自回归引擎驱动,并使用 Colossus 超算上的 11 万张 NVIDIA GB200 GPU 训练而成。它支持文生视频与图生视频,可生成 480p 或 720p、时长 6 秒或 10 秒并自带音频的视频;Fun、Normal、Spicy 三种风格模式还能让你一键调整画面的创意风格。
Grok Imagine 1.0 于 2026 年 2 月 2 日正式开放使用,此前已于 2025 年推出预览版。模型采用 xAI 的 Aurora 架构,以自回归方式逐帧预测并顺序生成画面,技术路线不同于扩散模型。训练依托 Colossus 超级计算机和 11 万张 NVIDIA GB200 GPU,是迄今 AI 视频领域规模最大的训练基础设施之一;公开平台曾在 30 天内生成超过 12.45 亿条视频。
LoveGen AI 提供两种输入模式。文生视频支持最长 2,000 个字符的提示词,并提供 16:9、9:16、1:1、3:2、2:3 五种宽高比,覆盖横屏、竖屏、方形和经典摄影画幅。图生视频支持上传一张参考图(JPG、JPEG、PNG 或 WebP,最大 20 MB),再根据提示词为图片添加动态。两种模式均以 24 fps 生成,可选择 6 秒或 10 秒,最高输出 720p。
Grok Imagine 的核心亮点是风格模式。Normal 的效果均衡且忠实于提示词;Fun 更俏皮、夸张,鼓励富有创意的解读;Spicy 则呈现更大胆、更具戏剧张力的效果。Aurora 会在一次生成过程中同步完成画面与音频,包括带口型同步的对白、背景音乐和环境音效,无需另行后期合成。2026 年 3 月 2 日,xAI 推出 Extend from Frame,可将上一段视频的最后一帧作为下一段的起始帧,连续扩展画面。模型平均约 30 秒即可生成一段 6 秒或 10 秒的视频。LoveGen AI 会在后台异步执行任务;提交后,成片会自动出现在素材库中,方便你预览、下载,并在同一工作区与 Sora 2、Veo 3.1、Seedance 2.0 和 Happy Horse 1.0 直接对比。
如何使用 Grok Imagine
第一步:选择文生视频或图生视频
选择仅通过提示词创作的文生视频,或上传参考图并让画面动起来的图生视频。
第二步:设置参数
选择时长(6 秒或 10 秒)、分辨率(480p 或 720p)、宽高比(仅 T2V)和风格模式(Fun 或 Normal)。
第三步:生成并下载
点击“生成”。Aurora 通常会在约 30 秒内返回一段自带音频的成片,你可以直接预览、下载,或在素材库中与其他模型并排对比。
Grok Imagine 技术规格
| 提供方 | xAI |
| 引擎 | Aurora — 自回归逐帧预测 |
| 最新版本 | Grok Imagine 1.0(2026 年 2 月 2 日正式上线) |
| 训练基础设施 | Colossus 超算,110,000 张 NVIDIA GB200 GPU |
| 输入模式 | 文本生成视频、图像生成视频 |
| 风格模式 | Fun、Normal、Spicy |
| 视频时长 | 6 秒或 10 秒(xAI 还通过 Extend from Frame 提供 15 秒) |
| 分辨率 | 480p、720p |
| 帧率 | 24 fps |
| 宽高比(T2V) | 16:9, 9:16, 1:1, 3:2, 2:3 |
| 图像输入(I2V) | 1 张图——JPG / JPEG / PNG / WebP,最大 20 MB |
| 音频 | 原生——对白(带口型同步)、背景音乐、音效 |
| 生成速度 | 平均每条约 30 秒 |
| 结果有效期 | 生成视频链接在完成后 24 小时内有效 |
为什么选择 Grok Imagine
Aurora 自回归引擎
Grok Imagine 基于 Aurora——xAI 的逐帧自回归视频模型,用 110,000 张 NVIDIA GB200 GPU 训练而成,与扩散式竞品在底层架构上截然不同,也是其动作质感独特的关键原因。
三种开箱即用的风格模式
Fun、Normal、Spicy 让你无需重写提示词即可调整创意风格。多数视频模型只提供一种效果,Grok Imagine 则能让同一提示词呈现三种不同方向。
原生音频,单次前向生成
对白(带口型同步)、环境音、背景音乐与画面联合生成——没有独立音频流程,也不会有同步偏移。
Grok Imagine 与其他 AI 视频生成器对比
| Feature | Grok Imagine | Sora 2 | Veo 3.1 | Seedance 2.0 |
|---|---|---|---|---|
| 提供方 | xAI | OpenAI | Google DeepMind | ByteDance |
| 架构 | Aurora(自回归) | 扩散 | 扩散 | 扩散 |
| 最高分辨率 | 720p | 1080p | 1080p | 1080p |
| 时长选项 | 6 秒、10 秒(通过 Extend 达 15 秒) | 4s, 8s, 12s | 4s, 6s, 8s | 4-15s |
| 风格模式 | Fun, Normal, Spicy | 单一模式 | 单一模式 | 单一模式 |
| 图像输入 | 1 张图(I2V) | 1 张图 + Cameos | 最多 3 张 | 1–2 张 |
| 宽高比(T2V) | 16:9, 9:16, 1:1, 3:2, 2:3 | 16:9, 9:16, 1:1, 3:2, 2:3 | 16:9, 9:16 | 16:9、9:16、1:1,另 +4 种 |
| 原生音频 | 是 | 是 | 是 | 是 |
| 平均生成速度 | ~30s | ~60s | ~45s | ~40s |
适合创作者、营销与故事讲述者
社交媒体短片
用 9:16 或 1:1 生成 6 秒或 10 秒短片,适合 TikTok、Reels 和 Shorts。Fun 模式让内容活力满满,原生音频已就绪。
图像动画
上传现有照片或插画,让它动起来——非常适合产品图、角色画稿或幕后剪影。
概念分镜板
用 480p 快速试出多个风格方向,确认后再以 720p 重渲——非常适合创意发散与提案。
广告与推广片
16:9 横屏用于主视觉,9:16 竖屏用于垂直渠道。风格模式让你不重写提示词即可匹配品牌调性——俏皮或克制,任你选。
故事板
用 6 秒短片快速呈现脚本中的关键情节,并通过同步对白反复调整构图与运动,再切换到支持更长时长的模型。
教育内容
把图表、照片与概念插画动画化为短片,配上原生旁白音频——比静态幻灯片更能抓住注意力。
探索相关 AI 视频生成器
Grok Imagine 常见问题
什么是 Grok Imagine?
Grok Imagine 是 xAI 推出的视频生成模型,基于 Aurora 自回归引擎,并使用 Colossus 超算上的 11 万张 NVIDIA GB200 GPU 训练。它支持文生视频与图生视频,还提供 Fun、Normal、Spicy 三种风格模式,可让同一提示词呈现不同的创意效果。
Grok Imagine 是什么时候发布的?
Grok Imagine 在 2025 年作为预览版发布,并于 2026 年 2 月 2 日正式发布 1.0 版本。xAI 持续迭代——最近一次是 2026 年 3 月 2 日上线的 Extend from Frame,将多段链式拼接以获得每段最长 15 秒的序列。
支持哪些时长和分辨率?
Grok Imagine 可生成 6 秒或 10 秒的视频,分辨率为 480p 或 720p,帧率 24 fps,平均每条约 30 秒生成完成。
支持哪些宽高比?
文本生成视频支持 16:9、9:16、1:1、3:2、2:3,覆盖横屏、竖屏、方形和经典摄影构图。图像生成视频会保留你上传参考图的宽高比。
Fun、Normal、Spicy 三种模式有什么区别?
Normal 模式输出平衡、忠实;Fun 模式偏向俏皮、夸张、有创意;Spicy 模式解锁更大胆、更戏剧化的内容。同一提示词在不同模式下可呈现明显不同的电影氛围。
Grok Imagine 会生成音频吗?
是的。Aurora 原生在一次前向中生成对白(带口型同步)、背景音乐和环境音效,无需后期分开处理。


