Loading

Grok Imagine KI-Videogenerator

Stilisierte KI-Videos mit der Aurora-Engine von xAI in Grok Imagine erstellen

Grok Imagine ist das Videogenerierungsmodell von xAI. Es basiert auf der autoregressiven Aurora-Engine und wurde auf dem Colossus-Supercomputer mit 110.000 NVIDIA GB200-GPUs trainiert. Das Modell erzeugt 6- oder 10-sekündige Clips in 480p oder 720p mit integriertem Audio, unterstützt Text-zu-Video und Bild-zu-Video und bietet drei unterschiedliche Stilmodi — Fun, Normal und Spicy. So lässt sich die kreative Ausrichtung eines Prompts mit einem Klick ändern.

Grok Imagine 1.0 ist seit dem 2. Februar 2026 allgemein verfügbar; zuvor war das Modell 2025 als Vorschau gestartet. Es basiert auf Aurora, der autoregressiven Architektur von xAI zur Vorhersage einzelner Frames. Anders als Diffusionsmodelle erzeugt Aurora die Bildfolge schrittweise. Für das Training kam der Colossus-Supercomputer mit 110.000 NVIDIA GB200-GPUs zum Einsatz — eine der bislang größten Trainingsinfrastrukturen für KI-Video. Auf der öffentlichen Plattform wurden innerhalb eines Zeitraums von 30 Tagen bereits mehr als 1,245 Milliarden Videos erstellt.

In LoveGen AI stehen zwei Eingabemodi zur Verfügung. Text-zu-Video verarbeitet Prompts mit bis zu 2.000 Zeichen und unterstützt fünf Seitenverhältnisse: 16:9, 9:16, 1:1, 3:2 und 2:3. Damit lassen sich Querformat, Hochformat, Quadrat und klassische Fotoformate abdecken. Bild-zu-Video animiert ein einzelnes Referenzbild (JPG, JPEG, PNG oder WebP, bis zu 20 MB) anhand deines Prompts. Beide Modi erzeugen Videos mit 24 fps, einer Länge von 6 oder 10 Sekunden und einer Auflösung von bis zu 720p.

Besonders charakteristisch ist die Auswahl des Stilmodus. Normal liefert ausgewogene Ergebnisse, die dem Prompt eng folgen. Fun bevorzugt verspielte, übertriebene und kreative Interpretationen. Spicy sorgt für mutigere und dramatischere Ergebnisse. Aurora erzeugt lippensynchrone Dialoge, Hintergrundmusik und Umgebungsgeräusche gemeinsam mit dem Video in einem einzigen Durchlauf; eine separate Nachbearbeitung ist nicht nötig. Am 2. März 2026 veröffentlichte xAI Extend from Frame. Die Funktion verbindet Clips, indem sie das letzte Bild eines Clips als Startbild des nächsten verwendet. Ein fertiger Clip von 6 oder 10 Sekunden benötigt im Durchschnitt etwa 30 Sekunden. Die Generierung läuft in LoveGen AI asynchron: Nach dem Absenden erscheint das fertige Video in deiner Galerie und kann dort angesehen, heruntergeladen und direkt mit Sora 2, Veo 3.1, Seedance 2.0 und Happy Horse 1.0 verglichen werden.

So benutzt du Grok Imagine

01

Schritt 1: Text-zu-Video oder Bild-zu-Video wählen

Wähle Text-zu-Video, um ausschließlich aus einem Prompt zu generieren, oder Bild-zu-Video, um ein hochgeladenes Referenzbild zu animieren.

02

Schritt 2: Einstellungen wählen

Wähle Länge (6s oder 10s), Auflösung (480p oder 720p), Seitenverhältnis (nur T2V) und Stilmodus (Fun oder Normal).

03

Schritt 3: Generieren und herunterladen

Klicke auf „Generieren“. Aurora liefert in rund 30 Sekunden einen fertigen Clip mit integriertem Audio. Du kannst ihn in der Vorschau ansehen, herunterladen oder in deiner Galerie direkt mit anderen Modellen vergleichen.

Technische Daten von Grok Imagine

AnbieterxAI
EngineAurora — autoregressive Frame-Vorhersage
Aktuelle VersionGrok Imagine 1.0 (allgemeine Verfügbarkeit am 2. Februar 2026)
TrainingsinfrastrukturColossus-Supercomputer, 110.000 NVIDIA GB200 GPUs
EingabemodiText-zu-Video, Bild-zu-Video
StilmodiFun, Normal, Spicy
Videolänge6 oder 10 Sekunden (xAI bietet via Extend from Frame auch 15s)
Auflösungen480p, 720p
Bildrate24 fps
Seitenverhältnisse (T2V)16:9, 9:16, 1:1, 3:2, 2:3
Bildeingabe (I2V)1 Bild — JPG / JPEG / PNG / WebP, bis 20 MB
AudioNativ — Dialog (mit Lippensynchronität), Hintergrundmusik, Soundeffekte
Generierungsgeschwindigkeit~30 Sekunden im Schnitt pro Clip
Gültigkeit des ErgebnissesGenerierte Video-Links bleiben nach Fertigstellung 24 Stunden gültig

Warum Grok Imagine wählen

Autoregressive Aurora-Engine

Grok Imagine basiert auf Aurora, dem frame-für-frame-autoregressiven Videomodell von xAI, trainiert auf 110.000 NVIDIA GB200 GPUs — ein grundlegend anderer Ansatz als bei diffusionsbasierten Konkurrenten und ein Hauptgrund, warum sich seine Bewegung anders anfühlt.

Drei integrierte Stilmodi

Fun, Normal und Spicy ermöglichen es, den kreativen Ton zu wechseln, ohne den Prompt umzuschreiben. Die meisten Videomodelle bieten einen Look; Grok Imagine liefert drei aus derselben Eingabe.

Integriertes Audio in einem Durchlauf

Dialog mit Lippensynchronität, Umgebung und Hintergrundmusik entstehen zusammen mit dem Video — ohne separate Audio-Stufe, ohne Synchronisations-Drift.

Grok Imagine vs. andere KI-Videogeneratoren

FeatureGrok ImagineSora 2Veo 3.1Seedance 2.0
AnbieterxAIOpenAIGoogle DeepMindByteDance
ArchitekturAurora (autoregressiv)DiffusionDiffusionDiffusion
Max. Auflösung720p1080p1080p1080p
Längen-Optionen6s, 10s (15s via Extend)4s, 8s, 12s4s, 6s, 8s4-15s
StilmodiFun, Normal, SpicyEin ModusEin ModusEin Modus
Bildeingabe1 Bild (I2V)1 Bild + CameosBis zu 3 Bilder1–2 Bilder
Seitenverhältnisse (T2V)16:9, 9:16, 1:1, 3:2, 2:316:9, 9:16, 1:1, 3:2, 2:316:9, 9:1616:9, 9:16, 1:1, +4 weitere
Integriertes AudioJaJaJaJa
Durchschnittliche Generierungsgeschwindigkeit~30s~60s~45s~40s

Perfekt für Creator, Marketer und Storyteller

01

Social-Media-Clips

Erstelle kurze 6- oder 10-sekündige Videos im Format 9:16 oder 1:1 für TikTok, Reels und Shorts. Der Fun-Modus sorgt für energiegeladene, aufmerksamkeitsstarke Inhalte mit integriertem Audio.

02

Bildanimationen

Lade ein bestehendes Foto oder eine Illustration hoch und verwandle es in eine bewegte Sequenz — perfekt für Produktfotos, Character-Art oder Behind-the-Scenes-Stills.

03

Concept Boards

Erzeuge schnell mehrere stilistische Varianten derselben Szene in 480p, lege die gewünschte Richtung fest und rendere sie anschließend in 720p neu — ideal für Ideenfindung und Präsentationen.

04

Werbung und Promos

Nutze das Querformat 16:9 für prominente Platzierungen und das Hochformat 9:16 für vertikale Kanäle. Mit dem Stilmodus passt du den Markenton an — verspielt oder ausgewogen — ohne den Prompt umzuschreiben.

05

Storyboarding

Visualisiere Schlüsselmomente eines Drehbuchs schnell als 6-sekündige Clips mit synchronen Dialogen. Verfeinere Bildausschnitt und Bewegung, bevor du zu einem Modell für längere Videos wechselst.

06

Bildungsinhalte

Animiere Diagramme, Fotos und Konzeptillustrationen zu kurzen, ansprechenden Clips mit automatisch erzeugtem Voice-over, das die Aufmerksamkeit besser hält als statische Folien.

Verwandte KI-Videogeneratoren entdecken

Häufige Fragen zu Grok Imagine

Was ist Grok Imagine?

Grok Imagine ist das Videogenerierungsmodell von xAI. Es basiert auf der autoregressiven Aurora-Engine und wurde auf dem Colossus-Supercomputer mit 110.000 NVIDIA GB200-GPUs trainiert. Das Modell unterstützt Text-zu-Video und Bild-zu-Video sowie die drei Stilmodi Fun, Normal und Spicy, mit denen sich die kreative Ausrichtung eines Prompts ändern lässt.

Wann wurde Grok Imagine veröffentlicht?

Grok Imagine startete 2025 als Vorschau und erreichte am 2. Februar 2026 die Version 1.0 mit allgemeiner Verfügbarkeit. xAI veröffentlicht weiter Updates — zuletzt Extend from Frame am 2. März 2026, das Clips zu Sequenzen von bis zu 15 Sekunden pro verkettetem Clip verbindet.

Welche Längen und Auflösungen werden unterstützt?

Grok Imagine erzeugt Clips von 6 oder 10 Sekunden in 480p oder 720p, gerendert mit 24 fps. Die durchschnittliche Generierungszeit liegt bei rund 30 Sekunden pro Clip.

Welche Seitenverhältnisse sind verfügbar?

Text-zu-Video unterstützt 16:9, 9:16, 1:1, 3:2 und 2:3 — Quer-, Hoch-, Quadrat- und klassische Fotoformate. Bild-zu-Video übernimmt das Seitenverhältnis des hochgeladenen Referenzbildes.

Was unterscheidet die Modi Fun, Normal und Spicy?

Normal liefert ausgewogene, prompt-treue Ergebnisse. Fun zielt auf verspielte, übertriebene, kreative Interpretationen. Spicy schaltet mutigere, dramatischere Ausgaben frei. Derselbe Prompt in unterschiedlichen Modi erzeugt spürbar andere cineastische Stimmungen.

Erzeugt Grok Imagine Audio?

Ja. Aurora erzeugt lippensynchrone Dialoge, Hintergrundmusik und Umgebungsgeräusche gemeinsam mit dem Video in einem einzigen Durchlauf. Eine separate Nachbearbeitung ist nicht erforderlich.