Loading

Grok Imagine AI-videogenerator

Skapa stiliserade AI-videor med xAI:s Aurora-motor i Grok Imagine

Grok Imagine är xAI:s modell för videogenerering. Den drivs av den autoregressiva Aurora-motorn och har tränats på superdatorn Colossus med 110 000 NVIDIA GB200-GPU:er. Modellen skapar klipp på 6 eller 10 sekunder i 480p eller 720p med inbyggt ljud, stöder både text-till-video och bild-till-video och erbjuder tre tydliga stillägen — Fun, Normal och Spicy — som ändrar instruktionens kreativa uttryck med ett klick.

Grok Imagine 1.0 blev allmänt tillgänglig den 2 februari 2026 efter en förhandsversion under 2025. Modellen bygger på Aurora, xAI:s autoregressiva arkitektur för bildruteprediktion. Till skillnad från diffusionsmodeller bygger Aurora upp videosekvensen bildruta för bildruta. Träningen genomfördes på superdatorn Colossus med 110 000 NVIDIA GB200-GPU:er — en av de största träningsplattformarna för AI-video hittills. Den offentliga plattformen har redan skapat mer än 1,245 miljarder videor under en period på 30 dagar.

LoveGen AI erbjuder två inmatningslägen. Text-till-video tar emot instruktioner på upp till 2 000 tecken och stöder fem bildformat: 16:9, 9:16, 1:1, 3:2 och 2:3. De täcker liggande, stående, kvadratiska och klassiska fotografiska format. Bild-till-video animerar en referensbild (JPG, JPEG, PNG eller WebP, upp till 20 MB) utifrån din instruktion. Båda lägena genererar video med 24 fps, en längd på 6 eller 10 sekunder och en upplösning på upp till 720p.

Valet av stilläge är modellens tydligaste särdrag. Normal ger ett balanserat resultat som följer instruktionen noggrant. Fun föredrar lekfulla, överdrivna och kreativa tolkningar. Spicy ger ett djärvare och mer dramatiskt uttryck. Aurora skapar dialog med läppsynk, bakgrundsmusik och omgivningsljud tillsammans med videon i en enda process, så separat efterbehandling behövs inte. Den 2 mars 2026 lanserade xAI Extend from Frame. Funktionen kopplar ihop klipp genom att använda den sista bildrutan i ett klipp som den första i nästa. Ett färdigt klipp på 6 eller 10 sekunder tar i genomsnitt cirka 30 sekunder att generera. Genereringen sker asynkront i LoveGen AI: När jobbet är inskickat visas videon i ditt galleri, där du kan förhandsgranska, ladda ner och jämföra den direkt med Sora 2, Veo 3.1, Seedance 2.0 och Happy Horse 1.0.

Så använder du Grok Imagine

01

Steg 1: Välj Text-till-video eller Bild-till-video

Växla mellan text-till-video för generering enbart från text, eller bild-till-video för att animera en referensbild du laddar upp.

02

Steg 2: Välj dina inställningar

Välj längd (6s eller 10s), upplösning (480p eller 720p), bildformat (endast T2V) och stilläge (Fun eller Normal).

03

Steg 3: Generera och ladda ner

Klicka på Generera. Aurora levererar ett färdigt klipp med inbyggt ljud på cirka 30 sekunder — förhandsgranska, ladda ner eller jämför sida vid sida med andra modeller i ditt galleri.

Tekniska specifikationer för Grok Imagine

LeverantörxAI
MotorAurora — autoregressiv bildruteprediktion
Senaste versionGrok Imagine 1.0 (allmänt tillgänglig 2 feb 2026)
TräningsinfrastrukturColossus superdator, 110 000 NVIDIA GB200 GPU:er
IndatametoderText-till-video, Bild-till-video
StillägenFun, Normal, Spicy
Videolängd6 eller 10 sekunder (xAI erbjuder även 15s via Extend from Frame)
Upplösningar480p, 720p
Bildfrekvens24 fps
Bildformat (T2V)16:9, 9:16, 1:1, 3:2, 2:3
Bildindata (I2V)1 bild — JPG / JPEG / PNG / WebP, upp till 20 MB
LjudInbyggt — dialog (med läppsynk), bakgrundsmusik, ljudeffekter
Genereringshastighet~30 sekunder i snitt per klipp
Resultatets giltighetGenererade videolänkar är giltiga i 24 timmar efter slutförande

Varför välja Grok Imagine

Aurora autoregressiv motor

Grok Imagine är byggd på Aurora, xAI:s autoregressiva videomodell tränad på 110 000 NVIDIA GB200 GPU:er — ett fundamentalt annorlunda tillvägagångssätt än diffusionsbaserade konkurrenter, vilket är en viktig anledning till att dess rörelser känns unika.

Tre inbyggda stillägen

Fun, Normal och Spicy låter dig styra det kreativa uttrycket utan att skriva om instruktionen. De flesta videomodeller ger ett enda uttryck; Grok Imagine ger tre från samma indata.

Inbyggt ljud i ett enda svep

Dialog med läppsynk, omgivningsljud och bakgrundsmusik produceras tillsammans med videon — inget separat ljudsteg och ingen risk för osynk.

Grok Imagine jämfört med andra AI-videogeneratorer

FeatureGrok ImagineSora 2Veo 3.1Seedance 2.0
LeverantörxAIOpenAIGoogle DeepMindByteDance
ArkitekturAurora (autoregressiv)DiffusionDiffusionDiffusion
Max upplösning720p1080p1080p1080p
Längdalternativ6s, 10s (15s via Extend)4s, 8s, 12s4s, 6s, 8s4–15s
StillägenFun, Normal, SpicyEndast ett lägeEndast ett lägeEndast ett läge
Bildindata1 bild (I2V)1 bild + CameosUpp till 3 bilder1–2 bilder
Bildformat (T2V)16:9, 9:16, 1:1, 3:2, 2:316:9, 9:16, 1:1, 3:2, 2:316:9, 9:1616:9, 9:16, 1:1, +4 till
Inbyggt ljudJaJaJaJa
Snittfart generering~30s~60s~45s~40s

Perfekt för kreatörer, marknadsförare och berättare

01

Klipp för sociala medier

Generera korta 6 eller 10 sekunders videor i 9:16 eller 1:1 för TikTok, Reels och Shorts. Välj Fun-läget för energiskt innehåll som sticker ut i flödet med inbyggt ljud.

02

Animering av bilder

Ladda upp ett befintligt fotografi eller en illustration och förvandla den till en rörlig sekvens — perfekt för produktbilder, karaktärskonst eller bakom kulisserna-bilder.

03

Konceptskisser

Skapa snabbt flera stilmässiga versioner av samma scen i 480p, välj den inriktning du gillar och rendera sedan om den i 720p — idealiskt för idéarbete och pitchar.

04

Annonser och kampanjer

Använd liggande 16:9 för framträdande placeringar och stående 9:16 för vertikala kanaler. Med väljaren för stilläge kan du anpassa varumärkets ton — lekfull eller balanserad — utan att skriva om instruktionen.

05

Storyboarding

Visualisera snabbt scener från ett manus som 6 sekunders klipp med synkroniserad dialog. Iterera på inramning och rörelse innan du går vidare till en modell för längre format.

06

Utbildningsinnehåll

Animera diagram, foton och konceptillustrationer till korta, engagerande klipp med inbyggd berättarröst som håller kvar uppmärksamheten bättre än statiska bilder.

Utforska relaterade AI-videogeneratorer

Vanliga frågor om Grok Imagine

Vad är Grok Imagine?

Grok Imagine är xAI:s modell för videogenerering, byggd på den autoregressiva Aurora-motorn och tränad på superdatorn Colossus med 110 000 NVIDIA GB200-GPU:er. Den stöder text-till-video och bild-till-video samt stillägena Fun, Normal och Spicy, som ändrar instruktionens kreativa uttryck.

När släpptes Grok Imagine?

Grok Imagine lanserades som förhandsversion 2025 och nådde allmän tillgänglighet med version 1.0 den 2 februari 2026. xAI fortsätter att skicka uppdateringar — senast 'Extend from Frame' den 2 mars 2026, som kedjar ihop klipp för sekvenser upp till 15 sekunder per klipp.

Vilka längder och upplösningar stöds?

Grok Imagine genererar klipp på 6 eller 10 sekunder i antingen 480p eller 720p, renderade i 24 fps. Den genomsnittliga genereringstiden är cirka 30 sekunder per klipp.

Vilka bildformat är tillgängliga?

Text-till-video stöder 16:9, 9:16, 1:1, 3:2 och 2:3 — vilket täcker liggande, stående, kvadratiskt och klassiskt fotoformat. Bild-till-video behåller bildförhållandet från din uppladdade referensbild.

Vad är skillnaden mellan lägena Fun, Normal och Spicy?

Normal-läget producerar balanserade renderingar som följer din instruktion noga. Fun-läget drar åt det lekfulla och överdrivet kreativa hållet. Spicy-läget ger ett djärvare och mer dramatiskt resultat. Samma instruktion i olika lägen kan ge märkbart olika filmiska stämningar.

Genererar Grok Imagine ljud?

Ja. Aurora skapar synkroniserad dialog med läppsynk, bakgrundsmusik och omgivande ljudeffekter direkt i genereringsprocessen — inget separat efterbehandlingssteg behövs.