Loading

Grok Imagine AI 영상 생성기

xAI의 Aurora 엔진으로 개성 있는 AI 영상 만들기

Grok Imagine은 Aurora 자기회귀 엔진을 기반으로 한 xAI의 영상 생성 모델로, Colossus 슈퍼컴퓨터의 NVIDIA GB200 GPU 110,000개를 사용해 학습했습니다. 480p 또는 720p로 6초·10초 영상을 만들 수 있고 네이티브 오디오가 함께 생성됩니다. 텍스트→영상과 이미지→영상을 모두 지원하며, Fun·Normal·Spicy 세 가지 스타일 모드로 프롬프트의 창의적인 분위기를 클릭 한 번에 바꿀 수 있습니다.

Grok Imagine 1.0은 2025년 프리뷰 공개 후 2026년 2월 2일 정식 출시되었습니다. xAI의 Aurora 아키텍처는 확산 방식을 사용하는 대신 프레임을 순서대로 예측하는 자기회귀 방식으로 영상을 생성합니다. 학습에는 Colossus 슈퍼컴퓨터와 NVIDIA GB200 GPU 110,000개가 사용됐으며, 이는 지금까지 AI 영상 분야에서 가장 큰 규모의 학습 인프라 중 하나입니다. 공개 서비스에서는 30일 동안 12억 4,500만 개가 넘는 영상이 생성되기도 했습니다.

LoveGen AI에서는 두 가지 입력 모드를 제공합니다. 텍스트→영상은 최대 2,000자의 프롬프트를 입력할 수 있으며 16:9, 9:16, 1:1, 3:2, 2:3 등 다섯 가지 화면비를 지원합니다. 이미지→영상은 참조 이미지 한 장(JPG, JPEG, PNG 또는 WebP, 최대 20MB)을 업로드하면 프롬프트에 따라 자연스럽게 움직임을 더합니다. 두 모드 모두 24fps로 6초 또는 10초 영상을 생성하며, 최대 해상도는 720p입니다.

가장 큰 특징은 스타일 모드입니다. Normal은 프롬프트에 충실하면서 균형 잡힌 결과를 만들고, Fun은 장난스럽고 과장된 창의적 해석을 더하며, Spicy는 더 과감하고 극적인 결과를 보여 줍니다. Aurora는 립싱크 대사, 배경 음악, 주변 음향을 영상과 함께 한 번의 생성 과정에서 만들기 때문에 별도의 후처리가 필요하지 않습니다. 2026년 3월 2일 xAI가 공개한 Extend from Frame은 한 클립의 마지막 프레임을 다음 클립의 시작 프레임으로 활용해 영상을 이어 줍니다. 6초 또는 10초 영상 한 편의 평균 생성 시간은 약 30초입니다. LoveGen AI에서는 작업이 비동기로 진행되며, 완성된 영상은 갤러리에 자동으로 추가됩니다. 같은 작업 공간에서 미리 보거나 다운로드하고, Sora 2, Veo 3.1, Seedance 2.0, Happy Horse 1.0과 바로 비교할 수 있습니다.

Grok Imagine 사용법

01

1단계: 텍스트→영상 또는 이미지→영상 선택

프롬프트만으로 만드는 텍스트→영상과 업로드한 참조 이미지에 움직임을 더하는 이미지→영상 중에서 선택합니다.

02

2단계: 설정 선택

길이(6초 또는 10초), 해상도(480p 또는 720p), 화면비(T2V만 해당), 스타일 모드(Fun 또는 Normal)를 선택합니다.

03

3단계: 생성 및 다운로드

‘생성’을 클릭하세요. Aurora가 약 30초 만에 네이티브 오디오가 포함된 영상을 완성합니다. 갤러리에서 미리 보거나 다운로드하고, 다른 모델의 결과와 나란히 비교할 수 있습니다.

Grok Imagine 기술 사양

제공자xAI
엔진Aurora — 자기회귀 프레임 예측
최신 버전Grok Imagine 1.0(2026년 2월 2일 정식 출시)
학습 인프라Colossus 슈퍼컴퓨터, NVIDIA GB200 GPU 110,000개
입력 모드텍스트→영상, 이미지→영상
스타일 모드Fun, Normal, Spicy
비디오 길이6초 또는 10초(xAI는 Extend from Frame으로 15초도 지원)
해상도480p, 720p
프레임 속도24 fps
화면비(T2V)16:9, 9:16, 1:1, 3:2, 2:3
이미지 입력(I2V)이미지 1장 — JPG / JPEG / PNG / WebP, 최대 20MB
오디오네이티브 — 대사(립싱크), 배경 음악, 효과음
생성 속도클립당 평균 약 30초
결과 유효 기간생성된 영상 링크는 완료 후 24시간 동안 유효

Grok Imagine을 선택해야 하는 이유

Aurora 자기회귀 엔진

Grok Imagine은 NVIDIA GB200 GPU 110,000개로 학습한 xAI의 프레임 단위 자기회귀 영상 모델 Aurora를 기반으로 합니다. 확산 모델과는 근본적으로 다른 접근 방식이며, 움직임에서 고유한 질감이 느껴지는 핵심 이유이기도 합니다.

기본 제공되는 세 가지 스타일 모드

Fun·Normal·Spicy를 사용하면 프롬프트를 다시 쓰지 않고도 창의적인 분위기를 조절할 수 있습니다. 대부분의 영상 모델이 한 가지 결과만 보여 주는 반면, Grok Imagine은 같은 입력에서 세 가지 스타일을 제공합니다.

단일 패스 네이티브 오디오

립싱크 대사, 주변 음향, 배경 음악을 영상과 동시에 생성합니다. 별도의 오디오 작업이 필요 없고 영상과 소리가 어긋날 걱정도 줄어듭니다.

Grok Imagine과 다른 AI 영상 생성기 비교

FeatureGrok ImagineSora 2Veo 3.1Seedance 2.0
제공자xAIOpenAIGoogle DeepMindByteDance
아키텍처Aurora(자기회귀)확산확산확산
최대 해상도720p1080p1080p1080p
길이 옵션6초, 10초(Extend로 15초)4s, 8s, 12s4s, 6s, 8s4-15s
스타일 모드Fun, Normal, Spicy단일 모드단일 모드단일 모드
이미지 입력이미지 1장(I2V)이미지 1장 + Cameos최대 3장1~2장
화면비(T2V)16:9, 9:16, 1:1, 3:2, 2:316:9, 9:16, 1:1, 3:2, 2:316:9, 9:1616:9, 9:16, 1:1 외 4종
네이티브 오디오지원지원지원지원
평균 생성 속도~30s~60s~45s~40s

크리에이터, 마케터, 스토리텔러에게 적합

01

소셜 미디어 클립

TikTok, Reels, Shorts에 맞는 9:16 또는 1:1 비율의 6초·10초 영상을 만들어 보세요. Fun 모드는 네이티브 오디오와 함께 피드에서 시선을 사로잡는 활기찬 콘텐츠를 만드는 데 적합합니다.

02

이미지 애니메이션

기존 사진이나 일러스트를 업로드해 움직이는 영상으로 바꿔 보세요. 제품 사진, 캐릭터 아트, 비하인드 컷에 잘 어울립니다.

03

콘셉트 보드

같은 장면을 480p에서 여러 스타일로 빠르게 시험해 보고, 마음에 드는 방향을 정한 뒤 720p로 다시 렌더링하세요. 아이디어 구상과 제안 작업에 유용합니다.

04

광고와 프로모

주요 광고 영역에는 16:9 가로형을, 세로형 채널에는 9:16을 사용하세요. 프롬프트를 다시 쓰지 않아도 스타일 모드로 발랄하거나 차분한 브랜드 분위기를 맞출 수 있습니다.

05

스토리보드

대본의 주요 장면을 동기화된 대사가 포함된 6초 영상으로 빠르게 시각화하세요. 더 긴 영상을 만드는 모델로 넘어가기 전에 구도와 움직임을 반복해서 다듬을 수 있습니다.

06

교육 콘텐츠

다이어그램, 사진, 콘셉트 일러스트를 짧고 흥미로운 영상으로 만들고 자동 생성된 내레이션을 더해 정적인 슬라이드보다 오래 시선을 붙잡아 보세요.

관련 AI 영상 생성기 살펴보기

Grok Imagine 자주 묻는 질문

Grok Imagine이란?

Grok Imagine은 Aurora 자기회귀 엔진을 기반으로 한 xAI의 영상 생성 모델입니다. Colossus 슈퍼컴퓨터의 NVIDIA GB200 GPU 110,000개를 사용해 학습했으며, 텍스트→영상과 이미지→영상을 모두 지원합니다. Fun·Normal·Spicy 세 가지 스타일 모드로 같은 프롬프트의 분위기를 다르게 표현할 수 있습니다.

Grok Imagine은 언제 출시되었나요?

2025년 프리뷰로 공개된 뒤 2026년 2월 2일 버전 1.0으로 정식 출시되었습니다. xAI는 이후에도 업데이트를 이어 가고 있으며, 2026년 3월 2일에는 클립을 연결해 최대 15초까지 확장할 수 있는 Extend from Frame을 선보였습니다.

어떤 길이와 해상도를 지원하나요?

Grok Imagine은 6초 또는 10초 영상을 480p 또는 720p, 24fps로 생성합니다. 클립당 평균 생성 시간은 약 30초입니다.

어떤 화면비를 지원하나요?

텍스트→영상은 16:9, 9:16, 1:1, 3:2, 2:3을 지원해 가로형, 세로형, 정사각형과 클래식 사진 비율을 모두 활용할 수 있습니다. 이미지→영상은 업로드한 참조 이미지의 화면비를 그대로 유지합니다.

Fun, Normal, Spicy 모드의 차이는?

Normal은 균형 잡히고 프롬프트에 충실한 결과를 만듭니다. Fun은 장난스럽고 과장된 창의적 해석을 더하고, Spicy는 더 과감하고 극적인 결과를 보여 줍니다. 같은 프롬프트라도 모드에 따라 시네마틱한 분위기가 눈에 띄게 달라집니다.

Grok Imagine도 오디오를 생성하나요?

네. Aurora는 립싱크 대사, 배경 음악, 주변 음향을 영상과 함께 한 번의 생성 과정에서 만들기 때문에 별도의 후처리가 필요하지 않습니다.