Um prompt para Veo 3 é a descrição de uma cena que precisa acontecer no tempo. Tem som, tem movimento e tem uma câmera parada em algum lugar do ambiente.
Quem vem de gerador de imagem escreve como se estivesse pedindo uma foto. O modelo devolve oito segundos de algo parecido com o pedido, sem ritmo, sem áudio e com a câmera flutuando sozinha pela sala.
A diferença entre um clipe publicável e um clipe estranho quase nunca está no modelo. Está no que você escreveu e, principalmente, no que deixou de escrever.
Por que um prompt para Veo 3 pede mais que um prompt de imagem
Porque o Veo 3 gera áudio junto com a imagem, e cada segundo do clipe precisa de uma instrução: o que acontece, quem fala, o que se ouve ao fundo e para onde a câmera aponta.
Num gerador de imagem, o resultado é um instante congelado. Você descreve o sujeito, a luz e o estilo, e pronto. As regras de um bom comando ali estão bem resolvidas no guia de prompts para criar imagens com IA.
No vídeo, o mesmo texto deixa buracos. O modelo precisa inventar o que preencher: inventa um movimento de câmera, inventa um silêncio, inventa um corte no meio. Essas invenções são o que faz o clipe parecer sintético.
Escrever para vídeo é fechar essas lacunas antes que o modelo as feche por você. Não existe prompt curto e bom para movimento, existe prompt curto que dá sorte.
As seis camadas de um prompt para Veo 3
Sujeito, ação, ambiente, câmera, luz e áudio. Escreva as seis na mesma ordem, sempre, e o resultado fica previsível o suficiente para você repetir.
Ordem importa porque o modelo lê o começo do comando com mais peso. Coloque quem é o protagonista antes de qualquer adjetivo de estilo.
- Sujeito: quem ou o que aparece, com idade, roupa e traço marcante. “Uma barista de uns 30 anos, avental verde, cabelo preso.”
- Ação: um verbo só, com começo e fim dentro de oito segundos. “Serve o café e olha para a câmera.”
- Ambiente: onde, com dois ou três objetos concretos. “Cafeteria pequena, balcão de madeira, chuva na janela.”
- Câmera: plano e movimento. “Plano médio, câmera na mão, leve aproximação.”
- Luz: fonte e clima. “Luz de fim de tarde entrando pela janela, sombras longas.”
- Áudio: diálogo, ruído de fundo e trilha. “Som de máquina de espresso, chuva abafada, sem música.”
Cada camada de um prompt para Veo 3 tem uma função de correção. Quando o clipe sai errado, você sabe qual linha reescrever em vez de refazer o comando inteiro.
📊 Tamanho de referência: um prompt para Veo 3 que funciona costuma ficar entre 60 e 120 palavras. Abaixo disso sobra espaço para o modelo improvisar; acima disso, instruções começam a competir entre si.
Como escrever o áudio, a camada que quase todo mundo esquece
Descreva o som em três partes separadas: a fala entre aspas, o ruído do ambiente e a trilha. Se você não escrever nada, o modelo escolhe por conta própria e costuma escolher música genérica.
A fala vai entre aspas, curta, do jeito que a pessoa diria. Oito segundos comportam mais ou menos vinte palavras faladas em ritmo natural.
Escreva também o idioma e o sotaque, porque o padrão do modelo puxa para o inglês. “Ela diz em português do Brasil, tom calmo: ‘esse aqui sai mais doce’.”
O ruído de fundo é o que dá lugar à cena. Sem ele, o clipe soa gravado dentro de um estúdio vazio, e o cérebro de quem assiste percebe antes dos olhos.
Quando a cena é uma pessoa falando direto para a câmera, vale comparar o esforço. Um roteiro de fala recorrente costuma render mais em um criar avatar com IA, onde o rosto e a voz continuam os mesmos em todos os vídeos, do que em clipes soltos gerados um a um.
⚠️ Erro que arruína o clipe: escrever a fala sem aspas. O modelo trata a frase como descrição de cena e pode desenhá-la como texto na tela, em legenda queimada e cheia de erro de grafia. Sempre entre aspas, sempre com o verbo “diz” antes.
Movimento de câmera: o vocabulário que o modelo entende
Use termos de cinema, não adjetivos. “Travelling lateral lento” produz resultado estável; “câmera bonita e dinâmica” produz movimento aleatório.
O modelo foi treinado com material audiovisual descrito por quem trabalha com câmera. Ele reconhece o jargão com precisão bem maior que a de qualquer descrição poética.
- Planos: close, plano médio, plano americano, plano geral.
- Movimentos: travelling, panorâmica, tilt, dolly in, dolly out, órbita.
- Estabilidade: câmera na mão, tripé fixo, steadicam.
- Lente: grande angular, teleobjetiva, pouca profundidade de campo.
- Velocidade: lento, contínuo, câmera lenta a 120 quadros.
Escolha um movimento por clipe. Dois movimentos no mesmo comando costumam virar um corte, e cortes automáticos quebram a continuidade quando você emenda as cenas depois.
Se o acesso ao modelo e ao Flow ainda não estiver claro para você, o caminho completo está no guia de Veo 3 como usar. A documentação oficial de prompts do Google DeepMind também traz a lista de termos aceitos.
Prompt vago e prompt específico lado a lado
O prompt vago descreve uma sensação; o específico descreve o que a câmera registraria. Só o segundo pode ser repetido com o mesmo resultado.
| Camada | Prompt vago | Prompt específico |
|---|---|---|
| Sujeito | Uma mulher | Barista de uns 30 anos, avental verde, cabelo preso |
| Ação | Fazendo café de forma legal | Serve o café no balcão e olha para a câmera |
| Câmera | Bem cinematográfico | Plano médio, câmera na mão, leve dolly in |
| Luz | Iluminação bonita | Sol de fim de tarde pela janela, sombras longas |
| Áudio | Som agradável | Máquina de espresso, chuva abafada, sem trilha |
| Resultado | Clipe diferente a cada tentativa | Variações pequenas em torno da mesma cena |
Adjetivo de gosto pessoal não é instrução. “Épico”, “moderno” e “profissional” significam coisas diferentes em cada pedaço do material de treino, então o modelo escolhe uma delas sem avisar.
Como corrigir o prompt para Veo 3 quando o clipe sai errado
Reescreva uma camada por vez e gere de novo. Trocar o comando inteiro impede que você descubra qual instrução causou o problema.
Cada defeito comum tem uma linha responsável. Vale guardar esse diagnóstico ao lado do seu comando padrão.
- Rosto que muda no meio do clipe: a descrição do sujeito está genérica. Acrescente dois traços fixos, como cor da roupa e formato do cabelo.
- Câmera que gira sem motivo: falta a camada de câmera. Escreva o plano e um movimento único.
- Corte inesperado no meio: há duas ações no comando. Fique com uma só.
- Boca fora de sincronia: a fala está longa demais para a duração. Corte para até vinte palavras.
- Música que você não pediu: a camada de áudio está vazia. Escreva “sem trilha” de forma explícita.
Esse método de isolar variáveis vale para qualquer gerador de vídeo, não só para o do Google. A lógica é a mesma descrita no guia de Kling AI como usar e no panorama geral de criar vídeo com IA.
Mantenha em um arquivo de texto cada prompt para Veo 3 que funcionou. A partir dele, troque só o sujeito ou só o ambiente para produzir a próxima cena da série sem começar do zero.
Quando a série cresce e o gargalo deixa de ser o clipe e passa a ser o volume de posts, o caminho é montar tudo dentro da mesma plataforma para criar posts para Instagram com IA em vez de juntar arquivos soltos de cinco ferramentas.
O que fazer com o clipe depois que ele sai bom
Um clipe de oito segundos raramente é o post. Ele é uma cena que precisa de abertura, texto na tela, capa e legenda para virar publicação.
A estrutura que segura o espectador nos três primeiros segundos vem do roteiro, não do modelo. Vale ler o passo a passo de criar Reels com IA antes de emendar as cenas.
O frame de capa merece atenção separada, porque é ele que decide o clique na aba de Reels e no feed. Gerar uma miniatura própria em vez de aceitar o frame aleatório costuma render mais visualização, e um criar thumbnail com IA resolve isso em poucos minutos.
O Pubbly é a plataforma de criação de conteúdo com IA que gera vídeos, carrosséis, imagens e legendas a partir do DNA da sua marca, prontos para publicar em minutos.
Vale acompanhar as notas de lançamento do modelo, já que o comportamento muda entre versões. O anúncio oficial do Flow no blog do Google explica o que cada atualização passou a aceitar.
Perguntas frequentes sobre prompt para Veo 3
Preciso escrever o prompt para Veo 3 em inglês?
Não. O modelo entende português e gera fala em português do Brasil quando você pede de forma explícita. Termos técnicos de câmera funcionam bem nos dois idiomas, então escreva a cena em português e mantenha o jargão que você conhece.
Qual o tamanho ideal de um prompt para Veo 3?
Entre 60 e 120 palavras cobre as seis camadas sem sobrecarregar. Comandos muito curtos deixam o modelo improvisar movimento e áudio; comandos muito longos criam instruções que competem entre si e uma delas acaba ignorada.
Existe prompt para Veo 3 pronto que eu possa copiar?
Listas de comandos prontos servem para estudar a estrutura, não para usar direto. Copie o esqueleto de seis camadas, troque sujeito, ambiente e áudio pelo seu contexto, e guarde a versão que funcionou como modelo das próximas.
Como manter o mesmo personagem em vários clipes?
Repita a descrição do sujeito palavra por palavra em todos os comandos, inclusive roupa, idade e cabelo. Mesmo assim há variação entre gerações, e por isso séries com um rosto fixo costumam sair mais consistentes em ferramentas de avatar do que em clipes independentes.
O prompt muda quando eu parto de uma imagem em vez de texto?
Muda bastante. Com uma imagem de referência, o sujeito, o ambiente e a luz já estão definidos, então o comando deve tratar só de ação, câmera e áudio. Descrever de novo o que já aparece na imagem gera conflito e distorce o resultado.
Escrever para vídeo parece intuição, mas na prática funciona como checklist. Quem monta o comando por camadas erra na mesma proporção, com a vantagem de descobrir onde errou.



