Prompt para Veo 3: criador filmando uma cena com câmera em ambiente natural

Prompt para Veo 3: Como Descrever uma Cena que a IA Consegue Filmar

Picture of Equipe Pubbly
Equipe Pubbly

Especialistas em conteúdos para redes sociais para ajudar você a alcançar mais resultados

Tempo de Leitura

Tópicos

Um prompt para Veo 3 é a descrição de uma cena que precisa acontecer no tempo. Tem som, tem movimento e tem uma câmera parada em algum lugar do ambiente.

Quem vem de gerador de imagem escreve como se estivesse pedindo uma foto. O modelo devolve oito segundos de algo parecido com o pedido, sem ritmo, sem áudio e com a câmera flutuando sozinha pela sala.

A diferença entre um clipe publicável e um clipe estranho quase nunca está no modelo. Está no que você escreveu e, principalmente, no que deixou de escrever.

✦ Do prompt ao post

Escreveu a cena. Agora falta publicar. publicar

Gere o vídeo, a capa e a legenda no mesmo lugar com o Pubbly.

Testar o Pubbly grátis →
Pubbly - criação de vídeo com IA

Por que um prompt para Veo 3 pede mais que um prompt de imagem

Porque o Veo 3 gera áudio junto com a imagem, e cada segundo do clipe precisa de uma instrução: o que acontece, quem fala, o que se ouve ao fundo e para onde a câmera aponta.

Num gerador de imagem, o resultado é um instante congelado. Você descreve o sujeito, a luz e o estilo, e pronto. As regras de um bom comando ali estão bem resolvidas no guia de prompts para criar imagens com IA.

No vídeo, o mesmo texto deixa buracos. O modelo precisa inventar o que preencher: inventa um movimento de câmera, inventa um silêncio, inventa um corte no meio. Essas invenções são o que faz o clipe parecer sintético.

Escrever para vídeo é fechar essas lacunas antes que o modelo as feche por você. Não existe prompt curto e bom para movimento, existe prompt curto que dá sorte.

As seis camadas de um prompt para Veo 3

Sujeito, ação, ambiente, câmera, luz e áudio. Escreva as seis na mesma ordem, sempre, e o resultado fica previsível o suficiente para você repetir.

Ordem importa porque o modelo lê o começo do comando com mais peso. Coloque quem é o protagonista antes de qualquer adjetivo de estilo.

  • Sujeito: quem ou o que aparece, com idade, roupa e traço marcante. “Uma barista de uns 30 anos, avental verde, cabelo preso.”
  • Ação: um verbo só, com começo e fim dentro de oito segundos. “Serve o café e olha para a câmera.”
  • Ambiente: onde, com dois ou três objetos concretos. “Cafeteria pequena, balcão de madeira, chuva na janela.”
  • Câmera: plano e movimento. “Plano médio, câmera na mão, leve aproximação.”
  • Luz: fonte e clima. “Luz de fim de tarde entrando pela janela, sombras longas.”
  • Áudio: diálogo, ruído de fundo e trilha. “Som de máquina de espresso, chuva abafada, sem música.”

Cada camada de um prompt para Veo 3 tem uma função de correção. Quando o clipe sai errado, você sabe qual linha reescrever em vez de refazer o comando inteiro.

📊 Tamanho de referência: um prompt para Veo 3 que funciona costuma ficar entre 60 e 120 palavras. Abaixo disso sobra espaço para o modelo improvisar; acima disso, instruções começam a competir entre si.

Como escrever o áudio, a camada que quase todo mundo esquece

Descreva o som em três partes separadas: a fala entre aspas, o ruído do ambiente e a trilha. Se você não escrever nada, o modelo escolhe por conta própria e costuma escolher música genérica.

A fala vai entre aspas, curta, do jeito que a pessoa diria. Oito segundos comportam mais ou menos vinte palavras faladas em ritmo natural.

Escreva também o idioma e o sotaque, porque o padrão do modelo puxa para o inglês. “Ela diz em português do Brasil, tom calmo: ‘esse aqui sai mais doce’.”

O ruído de fundo é o que dá lugar à cena. Sem ele, o clipe soa gravado dentro de um estúdio vazio, e o cérebro de quem assiste percebe antes dos olhos.

Quando a cena é uma pessoa falando direto para a câmera, vale comparar o esforço. Um roteiro de fala recorrente costuma render mais em um criar avatar com IA, onde o rosto e a voz continuam os mesmos em todos os vídeos, do que em clipes soltos gerados um a um.

⚠️ Erro que arruína o clipe: escrever a fala sem aspas. O modelo trata a frase como descrição de cena e pode desenhá-la como texto na tela, em legenda queimada e cheia de erro de grafia. Sempre entre aspas, sempre com o verbo “diz” antes.

✦ Uma cena, vários formatos

O mesmo roteiro vira Reels, carrossel e anúncio. vários formatos

Reaproveite a mesma ideia em todos os formatos com o Pubbly.

Criar minha conta →
Pubbly - gerador de vídeo e carrossel com IA

Movimento de câmera: o vocabulário que o modelo entende

Use termos de cinema, não adjetivos. “Travelling lateral lento” produz resultado estável; “câmera bonita e dinâmica” produz movimento aleatório.

O modelo foi treinado com material audiovisual descrito por quem trabalha com câmera. Ele reconhece o jargão com precisão bem maior que a de qualquer descrição poética.

  • Planos: close, plano médio, plano americano, plano geral.
  • Movimentos: travelling, panorâmica, tilt, dolly in, dolly out, órbita.
  • Estabilidade: câmera na mão, tripé fixo, steadicam.
  • Lente: grande angular, teleobjetiva, pouca profundidade de campo.
  • Velocidade: lento, contínuo, câmera lenta a 120 quadros.

Escolha um movimento por clipe. Dois movimentos no mesmo comando costumam virar um corte, e cortes automáticos quebram a continuidade quando você emenda as cenas depois.

Se o acesso ao modelo e ao Flow ainda não estiver claro para você, o caminho completo está no guia de Veo 3 como usar. A documentação oficial de prompts do Google DeepMind também traz a lista de termos aceitos.

Prompt vago e prompt específico lado a lado

O prompt vago descreve uma sensação; o específico descreve o que a câmera registraria. Só o segundo pode ser repetido com o mesmo resultado.

CamadaPrompt vagoPrompt específico
SujeitoUma mulherBarista de uns 30 anos, avental verde, cabelo preso
AçãoFazendo café de forma legalServe o café no balcão e olha para a câmera
CâmeraBem cinematográficoPlano médio, câmera na mão, leve dolly in
LuzIluminação bonitaSol de fim de tarde pela janela, sombras longas
ÁudioSom agradávelMáquina de espresso, chuva abafada, sem trilha
ResultadoClipe diferente a cada tentativaVariações pequenas em torno da mesma cena

Adjetivo de gosto pessoal não é instrução. “Épico”, “moderno” e “profissional” significam coisas diferentes em cada pedaço do material de treino, então o modelo escolhe uma delas sem avisar.

Como corrigir o prompt para Veo 3 quando o clipe sai errado

Reescreva uma camada por vez e gere de novo. Trocar o comando inteiro impede que você descubra qual instrução causou o problema.

Cada defeito comum tem uma linha responsável. Vale guardar esse diagnóstico ao lado do seu comando padrão.

  • Rosto que muda no meio do clipe: a descrição do sujeito está genérica. Acrescente dois traços fixos, como cor da roupa e formato do cabelo.
  • Câmera que gira sem motivo: falta a camada de câmera. Escreva o plano e um movimento único.
  • Corte inesperado no meio: há duas ações no comando. Fique com uma só.
  • Boca fora de sincronia: a fala está longa demais para a duração. Corte para até vinte palavras.
  • Música que você não pediu: a camada de áudio está vazia. Escreva “sem trilha” de forma explícita.

Esse método de isolar variáveis vale para qualquer gerador de vídeo, não só para o do Google. A lógica é a mesma descrita no guia de Kling AI como usar e no panorama geral de criar vídeo com IA.

Mantenha em um arquivo de texto cada prompt para Veo 3 que funcionou. A partir dele, troque só o sujeito ou só o ambiente para produzir a próxima cena da série sem começar do zero.

Quando a série cresce e o gargalo deixa de ser o clipe e passa a ser o volume de posts, o caminho é montar tudo dentro da mesma plataforma para criar posts para Instagram com IA em vez de juntar arquivos soltos de cinco ferramentas.

O que fazer com o clipe depois que ele sai bom

Um clipe de oito segundos raramente é o post. Ele é uma cena que precisa de abertura, texto na tela, capa e legenda para virar publicação.

A estrutura que segura o espectador nos três primeiros segundos vem do roteiro, não do modelo. Vale ler o passo a passo de criar Reels com IA antes de emendar as cenas.

O frame de capa merece atenção separada, porque é ele que decide o clique na aba de Reels e no feed. Gerar uma miniatura própria em vez de aceitar o frame aleatório costuma render mais visualização, e um criar thumbnail com IA resolve isso em poucos minutos.

O Pubbly é a plataforma de criação de conteúdo com IA que gera vídeos, carrosséis, imagens e legendas a partir do DNA da sua marca, prontos para publicar em minutos.

Vale acompanhar as notas de lançamento do modelo, já que o comportamento muda entre versões. O anúncio oficial do Flow no blog do Google explica o que cada atualização passou a aceitar.

✦ Fim das assinaturas infinitas

Uma conta no lugar de cinco ferramentas. uma conta

Vídeo, imagem, carrossel e legenda no mesmo lugar com o Pubbly.

Ver os planos →
Pubbly - plataforma de criação de conteúdo com IA

Perguntas frequentes sobre prompt para Veo 3

Preciso escrever o prompt para Veo 3 em inglês?

Não. O modelo entende português e gera fala em português do Brasil quando você pede de forma explícita. Termos técnicos de câmera funcionam bem nos dois idiomas, então escreva a cena em português e mantenha o jargão que você conhece.

Qual o tamanho ideal de um prompt para Veo 3?

Entre 60 e 120 palavras cobre as seis camadas sem sobrecarregar. Comandos muito curtos deixam o modelo improvisar movimento e áudio; comandos muito longos criam instruções que competem entre si e uma delas acaba ignorada.

Existe prompt para Veo 3 pronto que eu possa copiar?

Listas de comandos prontos servem para estudar a estrutura, não para usar direto. Copie o esqueleto de seis camadas, troque sujeito, ambiente e áudio pelo seu contexto, e guarde a versão que funcionou como modelo das próximas.

Como manter o mesmo personagem em vários clipes?

Repita a descrição do sujeito palavra por palavra em todos os comandos, inclusive roupa, idade e cabelo. Mesmo assim há variação entre gerações, e por isso séries com um rosto fixo costumam sair mais consistentes em ferramentas de avatar do que em clipes independentes.

O prompt muda quando eu parto de uma imagem em vez de texto?

Muda bastante. Com uma imagem de referência, o sujeito, o ambiente e a luz já estão definidos, então o comando deve tratar só de ação, câmera e áudio. Descrever de novo o que já aparece na imagem gera conflito e distorce o resultado.

Escrever para vídeo parece intuição, mas na prática funciona como checklist. Quem monta o comando por camadas erra na mesma proporção, com a vantagem de descobrir onde errou.

Compartilhe este artigo:
Pubbly ia que cria video
Transforme 30 segundos em 30 dias de conteúdo pronto para postar
👩 Crie seu Clone Digital – Crie seu clone digital com sua voz clonada e receba vídeos prontos todos os dias.
✨ Posts & Carrosséis Prontos - Receba prontos carrosséis impossíveis de serem ignorados.
🚀 Seu Novo Agente de Marketing - Que planeja, cria e entrega seus conteúdos virais prontos todos os dias.

Ei! Antes de você ir...

Crie carrosséis e vídeos virais para o mês inteiro Em menos de 5 minutos

O Pubbly aprende o DNA do seu negócio e gera carrosséis e vídeos virais automaticamente com a sua identidade visual.