
Generador de vídeo con IA Grok Imagine
Crea vídeos con IA y dales estilo con el motor Aurora de xAI
Grok Imagine es el modelo de generación de vídeo de xAI, impulsado por el motor autorregresivo Aurora y entrenado en la supercomputadora Colossus con 110.000 GPU NVIDIA GB200. Genera clips de 6 o 10 segundos a 480p o 720p con audio integrado, admite texto a vídeo e imagen a vídeo e incluye tres modos de estilo —Fun, Normal y Spicy— que cambian el tono creativo de cualquier prompt con un clic.
Grok Imagine 1.0 pasó a estar disponible para todo el público el 2 de febrero de 2026, después de lanzarse en versión preliminar en 2025. El modelo se basa en Aurora, la arquitectura autorregresiva de predicción de fotogramas de xAI, que genera la secuencia de izquierda a derecha en lugar de utilizar difusión. El entrenamiento se realizó en la supercomputadora Colossus con 110.000 GPU NVIDIA GB200 —una de las mayores infraestructuras de entrenamiento de vídeo con IA hasta la fecha— y la plataforma pública ya ha producido más de 1.245 millones de vídeos en un solo periodo de 30 días.
El modelo ofrece dos modos de entrada en LoveGen AI. Texto a vídeo admite prompts de hasta 2.000 caracteres y cinco relaciones de aspecto —16:9, 9:16, 1:1, 3:2 y 2:3— para formatos horizontales, verticales, cuadrados y fotográficos clásicos. Imagen a vídeo admite una imagen de referencia (JPG, JPEG, PNG o WebP, de hasta 20 MB) y la anima según tu prompt. Ambos modos generan a 24 fps, con duraciones de 6 o 10 segundos y una resolución máxima de 720p.
Su función más característica es el selector de estilos. Normal mantiene el resultado equilibrado y fiel al prompt; Fun favorece interpretaciones divertidas, exageradas y creativas; y Spicy produce resultados más atrevidos y dramáticos. Aurora genera el audio junto con el vídeo en un único proceso —incluidos el diálogo con sincronización labial, la música de fondo y los efectos ambientales—, sin necesidad de una fase de posproducción aparte. El 2 de marzo de 2026, xAI lanzó Extend from Frame, que enlaza clips usando el último fotograma de uno como inicio del siguiente. Un clip terminado de 6 o 10 segundos tarda unos 30 segundos de media. La generación se ejecuta de forma asíncrona en LoveGen AI: envía la tarea y el vídeo terminado aparecerá en tu galería para que puedas previsualizarlo, descargarlo y compararlo directamente con Sora 2, Veo 3.1, Seedance 2.0 y Happy Horse 1.0 en el mismo espacio de trabajo.
Cómo usar Grok Imagine
Paso 1: Elige Texto a vídeo o Imagen a vídeo
Usa Texto a vídeo para generar solo a partir de un prompt o Imagen a vídeo para animar una imagen de referencia que subas.
Paso 2: Elige tu configuración
Selecciona la duración (6 o 10 s), la resolución (480p o 720p), la relación de aspecto (solo en T2V) y el modo de estilo (Fun o Normal).
Paso 3: Generar y descargar
Haz clic en Generar. Aurora entregará un clip terminado con audio integrado en unos 30 segundos. Desde la galería podrás previsualizarlo, descargarlo o compararlo con otros modelos.
Especificaciones técnicas de Grok Imagine
| Proveedor | xAI |
| Motor | Aurora — predicción autorregresiva de fotogramas |
| Última versión | Grok Imagine 1.0 (disponibilidad general el 2 de febrero de 2026) |
| Infraestructura de entrenamiento | Supercomputadora Colossus, 110.000 GPU NVIDIA GB200 |
| Modos de entrada | Texto a vídeo, Imagen a vídeo |
| Modos de estilo | Fun, Normal, Spicy |
| Duración del vídeo | 6 o 10 segundos (xAI también permite llegar a 15 s mediante Extend from Frame) |
| Resoluciones | 480p, 720p |
| Fotogramas por segundo | 24 fps |
| Relaciones de aspecto (T2V) | 16:9, 9:16, 1:1, 3:2, 2:3 |
| Entrada de imagen (I2V) | 1 imagen — JPG / JPEG / PNG / WebP, hasta 20 MB |
| Audio | Nativo — diálogo (con sincronía labial), música de fondo, efectos de sonido |
| Velocidad de generación | ~30 segundos en promedio por clip |
| Validez del resultado | Los enlaces de los vídeos generados siguen disponibles durante 24 horas después de terminar la generación |
Por qué elegir Grok Imagine
Motor autorregresivo Aurora
Grok Imagine se basa en Aurora, el modelo de vídeo autorregresivo fotograma a fotograma de xAI, entrenado con 110.000 GPU NVIDIA GB200. Su enfoque difiere por completo del de los competidores basados en difusión y explica, en buena medida, que el movimiento tenga un aspecto distinto.
Tres modos de estilo de fábrica
Fun, Normal y Spicy te permiten ajustar el tono creativo sin reescribir el prompt. La mayoría de los modelos te dan un solo look; Grok Imagine te entrega tres a partir de la misma entrada.
Audio nativo en una sola pasada
El diálogo con sincronía labial, el sonido ambiental y la música de fondo se generan junto con el vídeo, sin una fase de audio aparte ni problemas de sincronización.
Grok Imagine frente a otros generadores de vídeo con IA
| Feature | Grok Imagine | Sora 2 | Veo 3.1 | Seedance 2.0 |
|---|---|---|---|---|
| Proveedor | xAI | OpenAI | Google DeepMind | ByteDance |
| Arquitectura | Aurora (autorregresivo) | Difusión | Difusión | Difusión |
| Resolución máxima | 720p | 1080p | 1080p | 1080p |
| Opciones de duración | 6s, 10s (15s vía Extend) | 4s, 8s, 12s | 4s, 6s, 8s | 4-15s |
| Modos de estilo | Fun, Normal, Spicy | Un solo modo | Un solo modo | Un solo modo |
| Entrada de imagen | 1 imagen (I2V) | 1 imagen + Cameos | Hasta 3 imágenes | 1–2 imágenes |
| Relaciones de aspecto (T2V) | 16:9, 9:16, 1:1, 3:2, 2:3 | 16:9, 9:16, 1:1, 3:2, 2:3 | 16:9, 9:16 | 16:9, 9:16, 1:1, +4 más |
| Audio nativo | Sí | Sí | Sí | Sí |
| Velocidad media de generación | ~30s | ~60s | ~45s | ~40s |
Perfecto para creadores, marketers y narradores
Clips para redes sociales
Genera vídeos cortos de 6 o 10 segundos en formato 9:16 o 1:1 para TikTok, Reels y Shorts. Elige el modo Fun para crear contenido enérgico que llame la atención en el feed, con audio integrado.
Animaciones de imágenes
Sube una fotografía o ilustración existente y conviértela en una secuencia en movimiento —perfecto para fotos de producto, arte de personajes o tomas detrás de cámaras.
Tableros de concepto
Genera varias versiones estilísticas de la misma escena a 480p rápidamente, fija la dirección que prefieras y vuelve a renderizar a 720p —ideal para ideación y propuestas.
Anuncios y promos
Usa el formato horizontal 16:9 para ubicaciones destacadas y el vertical 9:16 para canales móviles. El selector de estilo te permite adaptar el tono de la marca —divertido o equilibrado— sin reescribir el prompt.
Guion gráfico
Visualiza rápidamente los momentos clave de un guion como clips de 6 segundos con diálogo sincronizado. Ajusta el encuadre y el movimiento antes de pasar a un modelo de mayor duración.
Contenido educativo
Anima diagramas, fotos e ilustraciones de concepto en clips cortos y atractivos con narración nativa que mantiene la atención mejor que las diapositivas estáticas.
Explora otros generadores de vídeo con IA

Sora 2
Generador cinematográfico de OpenAI con movimiento físicamente preciso y duración de 20s.

Veo 3.1
Modelo de vídeo 1080p de Google DeepMind que genera vídeo a partir de fotogramas y también crea audio.

Seedance 2.0
Modelo de vídeo de ByteDance con búsqueda web integrada y audio sincronizado.
Happy Horse 1.0
Modelo n.º 1 de Alibaba con calidad de movimiento cinematográfica y sincronía labial en 7 idiomas.
Kling 2.5 Turbo
Generador rápido de vídeo 1080p de Kuaishou, optimizado para ofrecer velocidad y reducir costes.

Veo 4
Modelo de vídeo de nueva generación de Google con escalado a 4K y audio espacial.
Preguntas frecuentes sobre Grok Imagine
¿Qué es Grok Imagine?
Grok Imagine es el modelo de generación de vídeo de xAI, basado en el motor autorregresivo Aurora y entrenado en la supercomputadora Colossus con 110.000 GPU NVIDIA GB200. Admite texto a vídeo e imagen a vídeo y ofrece tres modos de estilo —Fun, Normal y Spicy— que cambian el tono creativo de cualquier prompt.
¿Cuándo se lanzó Grok Imagine?
Grok Imagine se lanzó como vista previa en 2025 y alcanzó la versión 1.0 con disponibilidad general el 2 de febrero de 2026. xAI sigue lanzando actualizaciones; la más reciente es Extend from Frame del 2 de marzo de 2026, que encadena clips para secuencias de hasta 15 segundos por clip encadenado.
¿Qué duraciones y resoluciones admite?
Grok Imagine genera clips de 6 o 10 segundos a 480p o 720p, renderizados a 24 fps. El tiempo medio de generación es de unos 30 segundos por clip.
¿Qué relaciones de aspecto están disponibles?
El modo Texto a vídeo admite 16:9, 9:16, 1:1, 3:2 y 2:3, por lo que cubre encuadres horizontales, verticales, cuadrados y fotográficos clásicos. Imagen a vídeo conserva la relación de aspecto de la imagen de referencia que subas.
¿Cuál es la diferencia entre los modos Fun, Normal y Spicy?
Normal produce resultados equilibrados y fieles. Fun se inclina hacia interpretaciones juguetonas, exageradas y creativas. Spicy desbloquea contenido más atrevido y dramático. El mismo prompt en distintos modos puede dar atmósferas cinematográficas notablemente diferentes.
¿Grok Imagine genera audio?
Sí. Aurora genera en un único proceso diálogo con sincronización labial, música de fondo y efectos ambientales junto con el vídeo, sin necesidad de una fase de posproducción aparte.