
Générateur vidéo IA Grok Imagine
Créez des vidéos IA stylisées avec le moteur Aurora de xAI dans Grok Imagine
Grok Imagine est le modèle de génération vidéo de xAI, propulsé par le moteur autorégressif Aurora et entraîné sur le supercalculateur Colossus avec 110 000 GPU NVIDIA GB200. Il génère des clips de 6 ou 10 secondes en 480p ou 720p avec audio natif, prend en charge le texte vers vidéo et l'image vers vidéo, et propose trois modes de style distincts — Fun, Normal et Spicy — pour changer la tonalité créative d'un prompt en un clic.
Grok Imagine 1.0 est devenu disponible pour tous le 2 février 2026, après une sortie en avant-première en 2025. Le modèle repose sur Aurora, l'architecture autorégressive de prédiction d'images de xAI, qui génère les images séquentiellement de gauche à droite plutôt que par diffusion. L'entraînement s'est déroulé sur le supercalculateur Colossus avec 110 000 GPU NVIDIA GB200 — l'une des plus grandes infrastructures d'entraînement dédiées à la vidéo IA à ce jour — et la plateforme publique a déjà produit plus de 1,245 milliard de vidéos en l'espace de 30 jours.
LoveGen AI propose deux modes d'entrée. Le mode texte vers vidéo accepte des prompts de 2 000 caractères maximum et cinq formats — 16:9, 9:16, 1:1, 3:2 et 2:3 — adaptés aux cadrages paysage, portrait, carré et photographiques classiques. Le mode image vers vidéo accepte une image de référence (JPG, JPEG, PNG ou WebP, jusqu'à 20 Mo) et l'anime selon votre prompt. Les deux modes génèrent à 24 fps, pour une durée de 6 ou 10 secondes et une résolution maximale de 720p.
Le sélecteur de styles constitue la grande particularité de Grok Imagine. Normal produit un résultat équilibré et fidèle au prompt ; Fun privilégie des interprétations ludiques, exagérées et créatives ; Spicy offre des résultats plus audacieux et dramatiques. Aurora génère le son en même temps que la vidéo, en un seul traitement — dialogues avec synchronisation labiale, musique de fond et ambiance sonore compris — sans étape de postproduction distincte. Le 2 mars 2026, xAI a lancé Extend from Frame, qui relie les clips en utilisant la dernière image de l'un comme première image du suivant. Un clip final de 6 ou 10 secondes est généré en environ 30 secondes en moyenne. La génération s'effectue de façon asynchrone dans LoveGen AI : envoyez la tâche, puis retrouvez la vidéo terminée dans votre galerie pour la prévisualiser, la télécharger et la comparer directement à Sora 2, Veo 3.1, Seedance 2.0 et Happy Horse 1.0 dans le même espace de travail.
Comment utiliser Grok Imagine
Étape 1 : Choisissez Texte vers vidéo ou Image vers vidéo
Basculez entre le texte vers vidéo pour une génération uniquement à partir d'un prompt, ou l'image vers vidéo pour animer une image de référence que vous téléversez.
Étape 2 : Choisissez vos paramètres
Sélectionnez la durée (6s ou 10s), la résolution (480p ou 720p), le format (T2V uniquement) et le mode de style (Fun ou Normal).
Étape 3 : Générer et télécharger
Cliquez sur « Générer ». Aurora fournit un clip final avec son intégré en environ 30 secondes. Vous pouvez ensuite le prévisualiser, le télécharger ou le comparer côte à côte avec d'autres modèles dans votre galerie.
Spécifications techniques de Grok Imagine
| Fournisseur | xAI |
| Moteur | Aurora — prédiction autorégressive d'images |
| Dernière version | Grok Imagine 1.0 (disponibilité générale le 2 février 2026) |
| Infrastructure d'entraînement | Supercalculateur Colossus, 110 000 GPU NVIDIA GB200 |
| Modes d'entrée | Texte vers vidéo, Image vers vidéo |
| Modes de style | Fun, Normal, Spicy |
| Durée vidéo | 6 ou 10 secondes (xAI propose aussi 15s via Extend from Frame) |
| Résolutions | 480p, 720p |
| Images par seconde | 24 fps |
| Formats (T2V) | 16:9, 9:16, 1:1, 3:2, 2:3 |
| Entrée image (I2V) | 1 image — JPG / JPEG / PNG / WebP, jusqu'à 20 Mo |
| Audio | Natif — dialogue (avec synchronisation labiale), musique de fond, effets sonores |
| Vitesse de génération | ~30 secondes en moyenne par clip |
| Validité du résultat | Les liens de la vidéo générée restent valides 24 heures après la génération |
Pourquoi choisir Grok Imagine
Moteur autorégressif Aurora
Grok Imagine repose sur Aurora, le modèle vidéo autorégressif image par image de xAI entraîné sur 110 000 GPU NVIDIA GB200 — une approche fondamentalement différente des concurrents basés sur la diffusion et une raison clé de la singularité de son mouvement.
Trois modes de style prêts à l'emploi
Fun, Normal et Spicy permettent d'ajuster le ton créatif sans réécrire le prompt. La plupart des modèles vidéo offrent un seul rendu ; Grok Imagine en propose trois à partir de la même entrée.
Son intégré en un seul traitement
Dialogue avec synchronisation labiale, ambiance et musique de fond sont produits en même temps que la vidéo — pas d'étape audio séparée, pas de décalage de synchronisation.
Grok Imagine vs autres générateurs vidéo IA
| Feature | Grok Imagine | Sora 2 | Veo 3.1 | Seedance 2.0 |
|---|---|---|---|---|
| Fournisseur | xAI | OpenAI | Google DeepMind | ByteDance |
| Architecture | Aurora (autorégressif) | Diffusion | Diffusion | Diffusion |
| Résolution max | 720p | 1080p | 1080p | 1080p |
| Options de durée | 6s, 10s (15s via Extend) | 4s, 8s, 12s | 4s, 6s, 8s | 4-15s |
| Modes de style | Fun, Normal, Spicy | Mode unique | Mode unique | Mode unique |
| Entrée image | 1 image (I2V) | 1 image + Cameos | Jusqu'à 3 images | 1–2 images |
| Formats (T2V) | 16:9, 9:16, 1:1, 3:2, 2:3 | 16:9, 9:16, 1:1, 3:2, 2:3 | 16:9, 9:16 | 16:9, 9:16, 1:1, +4 autres |
| Audio natif | Oui | Oui | Oui | Oui |
| Vitesse moyenne de génération | ~30s | ~60s | ~45s | ~40s |
Parfait pour créateurs, marketeurs et conteurs
Clips pour réseaux sociaux
Générez de courtes vidéos de 6 ou 10 secondes au format 9:16 ou 1:1 pour TikTok, Reels et Shorts. Choisissez le mode Fun pour créer du contenu énergique qui capte l'attention dans le fil, avec son intégré.
Animations d'images
Téléversez une photographie ou une illustration existante et transformez-la en séquence animée — parfait pour les photos produits, l'art de personnage ou les coulisses.
Planches de concept
Créez rapidement plusieurs versions stylistiques d'une même scène en 480p, retenez la direction qui vous plaît, puis effectuez un nouveau rendu en 720p — idéal pour la recherche d'idées et les présentations.
Publicités et promos
Utilisez le format paysage 16:9 pour les emplacements les plus visibles et le format portrait 9:16 pour les canaux verticaux. Le sélecteur de style permet d'adapter le ton de la marque — ludique ou équilibré — sans réécrire le prompt.
Storyboard
Visualisez rapidement les moments clés d'un script sous forme de clips de 6 secondes avec dialogues synchronisés. Affinez le cadrage et le mouvement avant de passer à un modèle de plus longue durée.
Contenu éducatif
Animez schémas, photos et illustrations conceptuelles sous forme de courts clips attrayants, avec une voix off générée automatiquement qui retient mieux l'attention que des diapositives statiques.
Découvrez des générateurs vidéo IA associés

Sora 2
Le générateur vidéo cinématographique d'OpenAI avec mouvement réaliste et durée de 20s.

Veo 3.1
Modèle vidéo 1080p de Google DeepMind capable de créer une vidéo à partir d'images et de générer le son.

Seedance 2.0
Modèle vidéo de ByteDance avec recherche web intégrée et audio synchronisé.
Happy Horse 1.0
Modèle n°1 d'Alibaba avec qualité de mouvement cinématographique et synchronisation labiale en 7 langues.
Kling 2.5 Turbo
Générateur vidéo 1080p rapide de Kuaishou, optimisé pour la vitesse et l'efficacité.

Veo 4
Modèle vidéo nouvelle génération de Google avec mise à l'échelle 4K et audio spatial.
Foire aux questions sur Grok Imagine
Qu'est-ce que Grok Imagine ?
Grok Imagine est le modèle de génération vidéo de xAI, construit sur le moteur autorégressif Aurora et entraîné sur le supercalculateur Colossus avec 110 000 GPU NVIDIA GB200. Il prend en charge le texte vers vidéo et l'image vers vidéo, avec trois modes de style — Fun, Normal et Spicy — qui modifient le ton de tout prompt.
Quand Grok Imagine a-t-il été lancé ?
Grok Imagine est sorti en avant-première en 2025 et a atteint la version 1.0 avec disponibilité générale le 2 février 2026. xAI continue de publier des mises à jour — la plus récente étant Extend from Frame le 2 mars 2026, qui enchaîne les clips pour des séquences allant jusqu'à 15 secondes par clip enchaîné.
Quelles durées et résolutions sont prises en charge ?
Grok Imagine génère des clips de 6 ou 10 secondes en 480p ou 720p, rendus à 24 fps. Le temps moyen de génération est d'environ 30 secondes par clip.
Quels formats sont disponibles ?
Le texte vers vidéo prend en charge 16:9, 9:16, 1:1, 3:2 et 2:3 — couvrant paysage, portrait, carré et cadrages photographiques classiques. L'image vers vidéo conserve le format de l'image de référence que vous téléversez.
Quelle est la différence entre Fun, Normal et Spicy ?
Normal produit des rendus équilibrés et fidèles. Fun s'oriente vers des interprétations ludiques, exagérées et créatives. Spicy débloque des sorties plus audacieuses et dramatiques. Le même prompt dans différents modes peut produire des ambiances cinématographiques sensiblement différentes.
Grok Imagine génère-t-il de l'audio ?
Oui. Aurora génère en un seul traitement les dialogues avec synchronisation labiale, la musique de fond et l'ambiance sonore en même temps que la vidéo. Aucune étape de postproduction distincte n'est nécessaire.