O Grok Imagine gerou 1.245 mil milhões de vídeos nos 30 dias que antecederam o lançamento da versão 1.0 no início de fevereiro de 2026. Esse lançamento elevou o modelo para clips de 720p e 10 segundos, com áudio nativo muito melhorado. Com o encerramento do Sora 2 da OpenAI previsto para 24 de setembro de 2026, o Grok Imagine posiciona-se agora ao lado do Google Veo 3.1 e do Kling 3.0 como as principais APIs de vídeo do futuro, sendo a mais económica das três.

Curioso sobre como o chatbot do Grok se compara ao ChatGPT nas tarefas do dia a dia? Consulte a nossa comparação completa Grok vs ChatGPT.

O que separa um clip utilizável do Grok Imagine de um crédito desperdiçado é quase sempre o prompt. Este guia é o manual prático de prompts para a geração de vídeo com Grok Imagine: a fórmula que produz resultados limpos, 20 exemplos prontos a usar agrupados pelos casos de utilização que realmente importam, os antipadrões que arruínam as gerações, as especificações da API xAI e o custo por clip, e o que fazer quando um clip fica desfocado ou é recusado.

Os pontos principais

  • O Grok Imagine gera clips de 1 a 15 segundos em 480p ou 720p com áudio nativo (música, SFX, diálogo, sincronização labial) na API grok-imagine-video.
  • A API xAI cobra $0.05 por segundo, cerca de $4.20 por minuto. Um clip de 6 segundos custa $0.30 e um de 15 segundos $0.75, incluindo áudio nativo.
  • A fórmula de prompt que funciona em 90% dos casos: [Sujeito] + [Ação] + [Ambiente] + [Estilo] + [Câmara e iluminação].
  • Um sujeito, uma ação, um movimento de câmara por prompt. Instruções múltiplas e concorrentes dividem a atenção do modelo e produzem um resultado visual confuso.
  • Três modos de falha explicam quase todos os maus clips: excesso de informação no prompt, recusas por política de conteúdo e o limite máximo de 15 segundos.

Especificações de vídeo do Grok Imagine em resumo

Do editor

Todos os modelos de IA numa só aplicação

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 e mais numa só aplicação nativa para Mac e iPhone.

Descarregue já!

Eis o que o modelo produz efetivamente a partir de maio de 2026.

EspecificaçãoInterface de consumidorAPI xAI
Duração6s (gratuito, Lite), 10s (SuperGrok e superior)1 a 15 segundos, modo de edição limitado a 8,7s
Resolução720p (padrão nos planos pagos), 480p (Lite)480p (padrão) ou 720p
Proporções1:1, 16:9, 9:16, 4:31:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3
Taxa de fotogramas24 fps24 fps
ÁudioNativo, automáticoNativo, automático
Variações por prompt4Configurável
VelocidadeCerca de 17 segundos por clipAté alguns minutos para 15s a 720p

A documentação da xAI indica explicitamente o intervalo de 1 a 15 segundos e os dois níveis de resolução. Alguns blogues de terceiros mencionam saída a 1080p, mas isso não consta na ficha técnica oficial da xAI à data da redação. Tome 720p como o teto real.

A fórmula de prompt que produz clips limpos

A maioria dos clips dececionantes do Grok Imagine resulta de prompts vagos, não do modelo em si. A estrutura que produz consistentemente resultados limpos é [Sujeito] + [Ação] + [Ambiente] + [Estilo] + [Câmara e iluminação]. Cada elemento desempenha um papel específico, e a ausência de um deles é normalmente a razão pela qual um clip parece genérico. O mesmo raciocínio por blocos aplica-se também a modelos de texto e imagem, e o nosso guia completo de prompts de IA aborda a fórmula geral.

Sujeito é a única entidade em foco: uma pessoa, um veículo, um objeto ou uma criatura. Resista à tentação de descrever dois sujeitos no mesmo prompt; se precisar de dois, coloque um em primeiro plano e o outro no ambiente.

Ação é o verbo. O que está o sujeito a fazer? A caminhar, a correr, a verter café, a olhar para cima, a virar-se para a câmara. A ação impulsiona o movimento ao longo dos 24 fotogramas por segundo; verbos fracos produzem uma saída de aspeto estático.

Ambiente é o local onde a ação decorre. Um cânion no deserto, um café cyberpunk, uma encosta coberta de neve, uma cozinha ao nascer do sol. O ambiente define a iluminação e a paleta de cores e diz ao modelo qual atmosfera deve renderizar.

Estilo é o registo visual. Cinematográfico, fotorrealista, anime, claymation, aguarela, comercial de alimentação. As palavras de estilo indicam ao modelo em que parte dos seus dados de treino deve apoiar-se; sem elas, obtém-se um clip de aspeto genérico.

Câmara e iluminação é a cinematografia. Plano geral, grande plano, lento avanço, plano de seguimento, recuo de drone, acompanhados de uma indicação de iluminação como "hora dourada", "iluminação neon" ou "luz suave da manhã". É a diferença entre um clip plano e um que parece intencional.

Um exemplo funcional que usa todos os elementos: "Um buggy todo-o-terreno laranja fortemente modificado corre em direção à câmara a alta velocidade através de um cânion no deserto, levantando uma enorme nuvem de poeira, plano geral cinematográfico, hora dourada, fotorrealista." Essa frase nomeia o sujeito (buggy modificado), a ação (correr em direção à câmara), o ambiente (cânion no deserto), o estilo (cinematográfico, fotorrealista) e a câmara e iluminação (plano geral, hora dourada). O modelo não tem nenhuma ambiguidade sobre o que renderizar nem como iluminar, o que explica por que acerta no clip em cerca de 17 segundos.

20 prompts prontos a usar por caso de utilização

A fórmula adapta-se a diferentes géneros. Seguem-se 20 prompts prontos a usar, agrupados pelo tipo de conteúdo que se pretende criar. Cada um preenche todos os elementos da fórmula e inclui uma proporção de ecrã, para poder colá-los diretamente no Grok Imagine e ajustar a partir daí.

Ação e dinamismo

"Um surfista talha uma onda turquesa ao pôr do sol, a prancha cortando uma linha de spray limpa, plano de seguimento com drone, ângulo baixo, cinematográfico, 16:9."

"Um piloto de motocross lança-se de um salto de terra, rotação no ar, poeira levantada por baixo da mota, filmado de baixo, lente olho de peixe, fotorrealista, 16:9."

"Um praticante de parkour salta entre telhados na hora dourada, mãos agarrando a borda, plano cinematográfico amplo com seguimento lateral, 16:9."

"Um cavalo galopa por um campo envolto em névoa ao amanhecer, cascos a atirar terra húmida, câmara lenta, cinematográfico, 16:9."

Cinematográfico e narrativo

"Um marinheiro curtido agarra o leme de um navio ao crepúsculo, spray salgado na barba, ondas a bater em penhascos escarpados, estilo documental, iluminação natural, 16:9."

"Um detetive entra num beco encharcado de chuva, reflexos neon nas poças, lento avanço de câmara, estilo noir, profundidade de campo reduzida, 16:9."

"Um astronauta caminha por uma planície marciana vermelha, capacete a refletir o sol do amanhecer, plano de seguimento amplo, fotorrealista, 16:9."

"Dois estranhos trocam um olhar numa plataforma de comboio apinhada, luz quente e suave, plano médio cinematográfico, 16:9."

Produto e publicidade

"Lento avanço sobre uma chávena de café fumegante num balcão de mármore, luz quente da manhã vinda de uma janela de cozinha, profundidade de campo reduzida, estilo comercial de alimentação, 1:1."

"Um par de auscultadores sem fio elegantes roda lentamente sobre uma superfície preta brilhante, iluminação fria de estúdio, estilo comercial de produto, 1:1."

"Um frasco de perfume apanha um feixe de luz dourada, gotículas a deslizar pelo vidro, macro, estilo comercial de luxo, 9:16."

"Unboxing de um novo ténis de corrida, mãos a levantar a tampa, iluminação suave de cima, estilo social-commerce, 9:16."

Social, meme e personalidade

"Um golden retriever com óculos de aviador conduz um descapotável pela Pacific Coast Highway, língua de fora, ambiente de verão, cinematográfico mas divertido, 9:16."

"Um barista robô verte latte art num copo de vidro, vapor a enrolar-se para cima, café cyberpunk com neon ao fundo, estilo anime, plano médio próximo, 9:16."

"Um pinguim de smoking a sapateado sobre uma placa de gelo flutuante, neve a cair, tom cómico, estilo de animação desenhada à mão, 1:1."

"Uma avó a tricotar a uma velocidade relâmpago, lã a voar, fundo de cozinha desordenada, movimento exagerado, tom de comédia leve, 16:9."

Anime e estilizado

"Uma jovem espadachim de pé no cimo de um penhasco a enfrentar uma tempestade, cabelo ao vento, relâmpago atrás dela, estilo anime inspirado no Studio Ghibli, plano geral, 16:9."

"Um lobo solitário caminha por uma floresta de cogumelos luminosos à noite, ambiente etéreo, estilo pictórico, lento plano de seguimento lateral, 16:9."

"Uma cidade flutuante nas nuvens, dirigíveis a derivar entre torres, hora dourada, estilo anime cinematográfico, plano de estabelecimento amplo, 16:9."

"Uma criança robô a regar uma única flor num planeta árido, tempestades de areia ao fundo, ambiente melancólico, estilo aguarela, 1:1."

Prompts para animações de imagem para vídeo

Quando se parte de uma imagem existente, o prompt deve descrever apenas o movimento. Os elementos visuais já estão fixos na imagem de origem, e pedir ao modelo que adicione elementos novos que não constam da imagem original é a forma mais rápida de obter um resultado descoordenado. Mantenha os prompts de imagem para vídeo com uma ou duas frases e apoie-se em verbos de ação.

Três padrões que funcionam consistentemente:

"A câmara avança lentamente em direção ao rosto do sujeito, o cabelo eleva-se suavemente com uma brisa."

"O sujeito pisca duas vezes e sorri suavemente; a luz quente desloca-se da esquerda para a direita pela cena."

"A chuva cai continuamente no fundo, as insígnias neon cintilam, sem movimento de câmara."

Quanto mais curto o prompt, melhor. Se a imagem de origem for um retrato, peça uma única ação facial e um pequeno movimento de câmara. Se for um plano geral de ambiente, peça movimento atmosférico (vento, chuva, poeira, folhas a cair) e deixe a câmara parada.

Antipadrões: o que destrói os seus prompts

Três hábitos sabotam os prompts do Grok Imagine mais do que qualquer outra coisa, e correspondem à maioria das queixas do tipo "porque ficou tão desfocado".

Acumular vários sujeitos ou ações num único prompt. "Um feiticeiro lança uma bola de fogo a um dragão enquanto arqueiros chovem setas de um muro de castelo durante uma trovoada" soa a cinematográfico, mas o modelo divide a atenção e não renderiza nada bem. Reduza a um sujeito, uma ação, um movimento de câmara. Encadeie momentos extra gerando vários clips e editando, ou utilize Extend From Frame numa plataforma parceira como o PixVerse.

Tratar o prompt como uma lista de referências de estilo. "Wes Anderson encontra Blade Runner com um toque de Studio Ghibli" produz um resultado médio que não se parece com nenhuma dessas referências. O modelo colapsa estilos concorrentes numa renderização genérica de nível médio. Escolha um registo de estilo e mantenha-o; se precisar de combinar influências, faça-o na edição ou acumulando vários clips com estilos diferentes.

Prompts com mais de três frases. O cumprimento de instruções do Grok Imagine degrada-se após a terceira frase; começa a ignorar cláusulas anteriores e a dar demasiado peso à última instrução. Duas frases curtas e bem construídas superam geralmente uma lista de cinco. Se precisar mesmo de precisão de plano, mude para o modo personalizado e utilize os parâmetros explícitos de câmara, movimento e iluminação em vez de os incluir em prosa.

Como gerar um vídeo com Grok Imagine

O caminho mais rápido é a interface de consumidor:

  1. Aceda a grok.com/imagine no navegador ou abra a aplicação Grok em iOS, Android ou Mac.
  2. Escolha Vídeo em vez de Imagem e selecione um modo criativo (Normal, Divertido, Personalizado ou Picante). Para os limites por plano em cada nível, consulte o nosso guia de preços do Grok.
  3. Escreva um prompt seguindo a fórmula ou cole um dos exemplos acima.
  4. Escolha a proporção e a duração (6 segundos no plano gratuito/Lite, 10 segundos no SuperGrok e superior).
  5. Prima gerar; o Grok devolve quatro variações em cerca de 17 segundos, escolha uma e descarregue o MP4.

Não existe um passo separado de "guardar áudio" porque a faixa de áudio está integrada na saída. Se precisar de substituir a música ou adicionar narração mais tarde, faça isso no seu editor, não no Grok.

A API xAI e o custo real de cada clip

Para os programadores, o fluxo consiste num POST para https://api.x.ai/v1/videos/generations com o modelo grok-imagine-video, seguido de um GET em https://api.x.ai/v1/videos/{request_id} para verificar o estado de conclusão. A latência varia entre dezenas de segundos e alguns minutos para os trabalhos mais longos a 720p. A documentação de geração de vídeo da xAI detalha todos os parâmetros.

O preço é direto ao assunto. O modelo grok-imagine-video é faturado a $0.05 por segundo de vídeo gerado, incluindo áudio nativo. Isso equivale a cerca de $4.20 por minuto. Em comparação, o Google Veo 3.1 Standard ronda os $24 por minuto com áudio, o Kling 3.0 Standard cerca de $5.04 por minuto (Pro é $6.72), e o OpenAI Sora 2 Pro custava cerca de $18 por minuto a 720p antes de a API entrar em fase de encerramento antes da retirada total a 24 de setembro de 2026. Isto coloca o Grok Imagine abaixo do preço mínimo de todas as outras APIs de vídeo em funcionamento, como a xAI sublinhou no anúncio de lançamento. Esses preços por segundo via API são distintos da aplicação de consumidor, onde o plano gratuito do Grok permite testar o Imagine antes de se comprometer com um plano pago.

Três exemplos práticos para orçamentar: um gancho de 6 segundos para Instagram Reels custa cerca de $0.30; um TikTok ou YouTube Short de 15 segundos custa cerca de $0.75; um anúncio de 60 segundos montado a partir de quatro variações de 15 segundos ronda os $3.00 em custos brutos de geração via API, antes de qualquer edição ou seleção. Isso torna a experimentação em série barata: gerar 20 variações de prompt para uma ideia custa cerca de $6 se cada uma tiver 6 segundos, algo difícil de igualar em qualquer outro lado.

Quando a geração corre mal

Três problemas explicam a maioria dos resultados dececionantes do Grok Imagine.

Movimento desfocado ou instável. Quase sempre resulta do problema de excesso de informação no prompt mencionado anteriormente. Se a mesma ideia continuar a voltar desfocada, reduza o prompt a um sujeito, uma ação, um movimento de câmara e uma indicação de estilo, e gere novamente com uma semente diferente.

Recusas diretas ou clips diluídos. Se o Grok devolver uma versão suavizada do seu prompt ou recusar diretamente, o prompt ultrapassou um limite de conteúdo. Semelhanças com pessoas reais (especialmente celebridades e políticos), menores em qualquer contexto e violência gráfica são os gatilhos mais comuns, e mudar para o Modo Picante não os contorna. Reescreva recorrendo a arquétipos e personagens fictícios em vez de pessoas identificadas pelo nome.

Limite máximo de duração. O limite de 15 segundos na API e de 10 segundos na interface de consumidor são fixos. Se precisar de um clip de 30 segundos, gere dois segmentos de 15 segundos com a mesma semente e junte-os no editor, ou utilize o modo Extend em plataformas parceiras como o PixVerse para acrescentar um segundo segmento. O Grok em si não ultrapassa o limite num único pedido.

Usar o Grok Imagine a par de outros modelos de IA

O Grok Imagine trata de vídeo, e pouco mais. Não lida com escrita de longa extensão, código, investigação aprofundada nem edição de documentos da forma como o fazem o ChatGPT, Claude, Gemini ou DeepSeek. A maioria dos criadores acaba por pagar duas ou três subscrições para cobrir as lacunas. O Fello AI a $9.99/mês consolida essa pilha. É uma aplicação nativa para Mac que reúne o ChatGPT, Claude, Gemini, Grok, DeepSeek e Perplexity a um preço único, para poder redigir um prompt com um modelo, refiná-lo com outro e executá-lo no Grok Imagine sem andar a gerir separadores e contas.

Para uma visão mais ampla do produto Grok, consulte a nossa análise do Grok 4.3 e o nosso guia do cliente de secretária do Grok para Mac.

Conclusão

O Grok Imagine é o gerador de vídeo com IA mais rentável do mercado, e o único dos principais a incluir áudio nativo a $4.20 por minuto. O modelo é bom. O que separa um clip utilizável de um crédito desperdiçado é o prompt, e a fórmula acima, juntamente com os 20 exemplos, deverá permitir-lhe atingir 80% da consistência desejada. Para clips de redes sociais, conceitos publicitários, painéis de atmosfera e qualquer trabalho de vídeo de formato curto em que a velocidade e o preço superam o fotorrealismo absoluto, é a ferramenta de eleição. Se precisar de ultrapassar os 15 segundos ou de detalhes em 4K de qualidade cinematográfica, o Kling 3.0 ou o Veo 3.1 são a melhor opção.

O ponto de partida mais simples é grok.com/imagine no plano gratuito. Para o resto da nossa cobertura, explore o arquivo da etiqueta Grok Imagine ou a etiqueta Grok completa. E para saber para onde a xAI vai a seguir, leia tudo o que sabemos sobre o Grok 5.

FAQ

Quanto tempo pode ter um vídeo do Grok Imagine?

O Grok Imagine gera clips entre 1 e 15 segundos. O limite de 15 segundos está disponível apenas através da API xAI. Na interface de consumidor em grok.com/imagine, os utilizadores gratuitos e do SuperGrok Lite obtêm clips de 6 segundos, e os utilizadores do SuperGrok e X Premium+ obtêm até 10 segundos.

Quanto custa a API do Grok Imagine?

$0.05 por segundo de vídeo gerado, incluindo áudio nativo, o que equivale a cerca de $4.20 por minuto. É menos de um quarto do preço do Google Veo 3.1 Standard ($24/min), cerca de 17% mais barato do que o Kling 3.0 Standard ($5.04/min), e uma fração do OpenAI Sora 2 Pro antes de ser descontinuado a 24 de setembro de 2026.

Qual é a fórmula de prompt para vídeo no Grok Imagine?

[Sujeito] + [Ação] + [Ambiente] + [Estilo] + [Câmara e iluminação]. Um sujeito, uma ação, um movimento de câmara por prompt. Duas frases curtas superam cinco. Os 20 exemplos acima seguem todos esta estrutura.

O Grok Imagine consegue animar a minha própria fotografia?

Sim, a conversão de imagem para vídeo é um dos fluxos de trabalho principais. Carregue a imagem estática e escreva um prompt curto que descreva apenas o movimento e a alteração atmosférica que pretende; não descreva novamente o sujeito, pois a imagem de origem já o contém.

Porque ficam os meus vídeos do Grok Imagine desfocados?

Quase sempre por excesso de informação no prompt. Vários sujeitos, várias ações ou uma lista de referências de estilo obrigam o modelo a dividir a atenção e a produzir um resultado confuso. Reduza o prompt a um sujeito, uma ação, um movimento de câmara e uma indicação de estilo, e tente novamente com uma semente diferente.

O Grok Imagine gera áudio?

Sim. Música, efeitos sonoros, áudio ambiente, diálogo e canto são gerados nativamente ao mesmo tempo que o vídeo, com sincronização labial para as personagens. Não há um passo separado para o áudio.