
Grok Imagine KI-Videogenerator
Stilisierte KI-Videos mit der Aurora-Engine von xAI in Grok Imagine erstellen
Grok Imagine ist das Videogenerierungsmodell von xAI. Es basiert auf der autoregressiven Aurora-Engine und wurde auf dem Colossus-Supercomputer mit 110.000 NVIDIA GB200-GPUs trainiert. Das Modell erzeugt 6- oder 10-sekündige Clips in 480p oder 720p mit integriertem Audio, unterstützt Text-zu-Video und Bild-zu-Video und bietet drei unterschiedliche Stilmodi — Fun, Normal und Spicy. So lässt sich die kreative Ausrichtung eines Prompts mit einem Klick ändern.
Grok Imagine 1.0 ist seit dem 2. Februar 2026 allgemein verfügbar; zuvor war das Modell 2025 als Vorschau gestartet. Es basiert auf Aurora, der autoregressiven Architektur von xAI zur Vorhersage einzelner Frames. Anders als Diffusionsmodelle erzeugt Aurora die Bildfolge schrittweise. Für das Training kam der Colossus-Supercomputer mit 110.000 NVIDIA GB200-GPUs zum Einsatz — eine der bislang größten Trainingsinfrastrukturen für KI-Video. Auf der öffentlichen Plattform wurden innerhalb eines Zeitraums von 30 Tagen bereits mehr als 1,245 Milliarden Videos erstellt.
In LoveGen AI stehen zwei Eingabemodi zur Verfügung. Text-zu-Video verarbeitet Prompts mit bis zu 2.000 Zeichen und unterstützt fünf Seitenverhältnisse: 16:9, 9:16, 1:1, 3:2 und 2:3. Damit lassen sich Querformat, Hochformat, Quadrat und klassische Fotoformate abdecken. Bild-zu-Video animiert ein einzelnes Referenzbild (JPG, JPEG, PNG oder WebP, bis zu 20 MB) anhand deines Prompts. Beide Modi erzeugen Videos mit 24 fps, einer Länge von 6 oder 10 Sekunden und einer Auflösung von bis zu 720p.
Besonders charakteristisch ist die Auswahl des Stilmodus. Normal liefert ausgewogene Ergebnisse, die dem Prompt eng folgen. Fun bevorzugt verspielte, übertriebene und kreative Interpretationen. Spicy sorgt für mutigere und dramatischere Ergebnisse. Aurora erzeugt lippensynchrone Dialoge, Hintergrundmusik und Umgebungsgeräusche gemeinsam mit dem Video in einem einzigen Durchlauf; eine separate Nachbearbeitung ist nicht nötig. Am 2. März 2026 veröffentlichte xAI Extend from Frame. Die Funktion verbindet Clips, indem sie das letzte Bild eines Clips als Startbild des nächsten verwendet. Ein fertiger Clip von 6 oder 10 Sekunden benötigt im Durchschnitt etwa 30 Sekunden. Die Generierung läuft in LoveGen AI asynchron: Nach dem Absenden erscheint das fertige Video in deiner Galerie und kann dort angesehen, heruntergeladen und direkt mit Sora 2, Veo 3.1, Seedance 2.0 und Happy Horse 1.0 verglichen werden.
So benutzt du Grok Imagine
Schritt 1: Text-zu-Video oder Bild-zu-Video wählen
Wähle Text-zu-Video, um ausschließlich aus einem Prompt zu generieren, oder Bild-zu-Video, um ein hochgeladenes Referenzbild zu animieren.
Schritt 2: Einstellungen wählen
Wähle Länge (6s oder 10s), Auflösung (480p oder 720p), Seitenverhältnis (nur T2V) und Stilmodus (Fun oder Normal).
Schritt 3: Generieren und herunterladen
Klicke auf „Generieren“. Aurora liefert in rund 30 Sekunden einen fertigen Clip mit integriertem Audio. Du kannst ihn in der Vorschau ansehen, herunterladen oder in deiner Galerie direkt mit anderen Modellen vergleichen.
Technische Daten von Grok Imagine
| Anbieter | xAI |
| Engine | Aurora — autoregressive Frame-Vorhersage |
| Aktuelle Version | Grok Imagine 1.0 (allgemeine Verfügbarkeit am 2. Februar 2026) |
| Trainingsinfrastruktur | Colossus-Supercomputer, 110.000 NVIDIA GB200 GPUs |
| Eingabemodi | Text-zu-Video, Bild-zu-Video |
| Stilmodi | Fun, Normal, Spicy |
| Videolänge | 6 oder 10 Sekunden (xAI bietet via Extend from Frame auch 15s) |
| Auflösungen | 480p, 720p |
| Bildrate | 24 fps |
| Seitenverhältnisse (T2V) | 16:9, 9:16, 1:1, 3:2, 2:3 |
| Bildeingabe (I2V) | 1 Bild — JPG / JPEG / PNG / WebP, bis 20 MB |
| Audio | Nativ — Dialog (mit Lippensynchronität), Hintergrundmusik, Soundeffekte |
| Generierungsgeschwindigkeit | ~30 Sekunden im Schnitt pro Clip |
| Gültigkeit des Ergebnisses | Generierte Video-Links bleiben nach Fertigstellung 24 Stunden gültig |
Warum Grok Imagine wählen
Autoregressive Aurora-Engine
Grok Imagine basiert auf Aurora, dem frame-für-frame-autoregressiven Videomodell von xAI, trainiert auf 110.000 NVIDIA GB200 GPUs — ein grundlegend anderer Ansatz als bei diffusionsbasierten Konkurrenten und ein Hauptgrund, warum sich seine Bewegung anders anfühlt.
Drei integrierte Stilmodi
Fun, Normal und Spicy ermöglichen es, den kreativen Ton zu wechseln, ohne den Prompt umzuschreiben. Die meisten Videomodelle bieten einen Look; Grok Imagine liefert drei aus derselben Eingabe.
Integriertes Audio in einem Durchlauf
Dialog mit Lippensynchronität, Umgebung und Hintergrundmusik entstehen zusammen mit dem Video — ohne separate Audio-Stufe, ohne Synchronisations-Drift.
Grok Imagine vs. andere KI-Videogeneratoren
| Feature | Grok Imagine | Sora 2 | Veo 3.1 | Seedance 2.0 |
|---|---|---|---|---|
| Anbieter | xAI | OpenAI | Google DeepMind | ByteDance |
| Architektur | Aurora (autoregressiv) | Diffusion | Diffusion | Diffusion |
| Max. Auflösung | 720p | 1080p | 1080p | 1080p |
| Längen-Optionen | 6s, 10s (15s via Extend) | 4s, 8s, 12s | 4s, 6s, 8s | 4-15s |
| Stilmodi | Fun, Normal, Spicy | Ein Modus | Ein Modus | Ein Modus |
| Bildeingabe | 1 Bild (I2V) | 1 Bild + Cameos | Bis zu 3 Bilder | 1–2 Bilder |
| Seitenverhältnisse (T2V) | 16:9, 9:16, 1:1, 3:2, 2:3 | 16:9, 9:16, 1:1, 3:2, 2:3 | 16:9, 9:16 | 16:9, 9:16, 1:1, +4 weitere |
| Integriertes Audio | Ja | Ja | Ja | Ja |
| Durchschnittliche Generierungsgeschwindigkeit | ~30s | ~60s | ~45s | ~40s |
Perfekt für Creator, Marketer und Storyteller
Social-Media-Clips
Erstelle kurze 6- oder 10-sekündige Videos im Format 9:16 oder 1:1 für TikTok, Reels und Shorts. Der Fun-Modus sorgt für energiegeladene, aufmerksamkeitsstarke Inhalte mit integriertem Audio.
Bildanimationen
Lade ein bestehendes Foto oder eine Illustration hoch und verwandle es in eine bewegte Sequenz — perfekt für Produktfotos, Character-Art oder Behind-the-Scenes-Stills.
Concept Boards
Erzeuge schnell mehrere stilistische Varianten derselben Szene in 480p, lege die gewünschte Richtung fest und rendere sie anschließend in 720p neu — ideal für Ideenfindung und Präsentationen.
Werbung und Promos
Nutze das Querformat 16:9 für prominente Platzierungen und das Hochformat 9:16 für vertikale Kanäle. Mit dem Stilmodus passt du den Markenton an — verspielt oder ausgewogen — ohne den Prompt umzuschreiben.
Storyboarding
Visualisiere Schlüsselmomente eines Drehbuchs schnell als 6-sekündige Clips mit synchronen Dialogen. Verfeinere Bildausschnitt und Bewegung, bevor du zu einem Modell für längere Videos wechselst.
Bildungsinhalte
Animiere Diagramme, Fotos und Konzeptillustrationen zu kurzen, ansprechenden Clips mit automatisch erzeugtem Voice-over, das die Aufmerksamkeit besser hält als statische Folien.
Verwandte KI-Videogeneratoren entdecken

Sora 2
OpenAIs cineastischer Videogenerator mit physikalisch stimmigen Bewegungen und Clips von bis zu 20 Sekunden.

Veo 3.1
Google DeepMinds 1080p-Videomodell für die Videoerzeugung aus Einzelbildern und die Audiogenerierung.

Seedance 2.0
ByteDances Videomodell mit Web-Suche-Integration und synchronem Audio.
Happy Horse 1.0
Alibabas #1 Videomodell mit cineastischer Bewegungsqualität und 7-sprachiger Lippensynchronität.
Kling 2.5 Turbo
Kuaishous schneller 1080p-Videogenerator, optimiert auf Geschwindigkeit und Kosteneffizienz.

Veo 4
Googles Videomodell der nächsten Generation mit 4K-Hochskalierung und Spatial Audio.
Häufige Fragen zu Grok Imagine
Was ist Grok Imagine?
Grok Imagine ist das Videogenerierungsmodell von xAI. Es basiert auf der autoregressiven Aurora-Engine und wurde auf dem Colossus-Supercomputer mit 110.000 NVIDIA GB200-GPUs trainiert. Das Modell unterstützt Text-zu-Video und Bild-zu-Video sowie die drei Stilmodi Fun, Normal und Spicy, mit denen sich die kreative Ausrichtung eines Prompts ändern lässt.
Wann wurde Grok Imagine veröffentlicht?
Grok Imagine startete 2025 als Vorschau und erreichte am 2. Februar 2026 die Version 1.0 mit allgemeiner Verfügbarkeit. xAI veröffentlicht weiter Updates — zuletzt Extend from Frame am 2. März 2026, das Clips zu Sequenzen von bis zu 15 Sekunden pro verkettetem Clip verbindet.
Welche Längen und Auflösungen werden unterstützt?
Grok Imagine erzeugt Clips von 6 oder 10 Sekunden in 480p oder 720p, gerendert mit 24 fps. Die durchschnittliche Generierungszeit liegt bei rund 30 Sekunden pro Clip.
Welche Seitenverhältnisse sind verfügbar?
Text-zu-Video unterstützt 16:9, 9:16, 1:1, 3:2 und 2:3 — Quer-, Hoch-, Quadrat- und klassische Fotoformate. Bild-zu-Video übernimmt das Seitenverhältnis des hochgeladenen Referenzbildes.
Was unterscheidet die Modi Fun, Normal und Spicy?
Normal liefert ausgewogene, prompt-treue Ergebnisse. Fun zielt auf verspielte, übertriebene, kreative Interpretationen. Spicy schaltet mutigere, dramatischere Ausgaben frei. Derselbe Prompt in unterschiedlichen Modi erzeugt spürbar andere cineastische Stimmungen.
Erzeugt Grok Imagine Audio?
Ja. Aurora erzeugt lippensynchrone Dialoge, Hintergrundmusik und Umgebungsgeräusche gemeinsam mit dem Video in einem einzigen Durchlauf. Eine separate Nachbearbeitung ist nicht erforderlich.