Como manter a consistência de personagem no Gemini Omni 1.1 Flash usando vídeo de referência

consistência de personagem no Gemini Omni usando vídeo de referência no Google Flow
Resposta rápida

A consistência de personagem no Gemini Omni 1.1 Flash ganhou um caminho direto: o modelo aceita referência de vídeo de até 3 segundos (no máximo 3 clipes, de até 3 segundos cada) pra preservar contexto visual e semelhança entre gerações. No Google Flow a referência entra pelo Video Ingredients, e o prompt precisa citar explicitamente os ingredients enviados. Áudio da referência é ignorado, e referenciar múltiplos vídeos no mesmo prompt não é suportado. Pra testar gastando pouco, dá pra validar no modo rascunho 360p (US$ 0,03 por segundo) e só depois fechar em 1080p (US$ 0,15 por segundo)

Fala aí, beleza? Tu gera o primeiro clipe, o personagem tá lá, perfeito, do jeitinho que tu imaginou

aí gera o segundo e ele volta com outro rosto, outro cabelo, outra idade… clássico 😅

O Google anunciou em 27/08/2026 o Gemini Omni 1.1 Flash, novo modelo multimodal de geração e edição de vídeo, com rollout noticiado em 28/08/2026 e novos controles criativos pra desenvolvedores. O ponto que interessa pra quem sofre com esse problema é o input multimodal: agora dá pra referenciar vídeo ao criar uma cena, até 3 clipes de 3 segundos cada, justamente pra manter contexto visual e semelhança entre uma geração e outra

Bora entender o que muda e como usar isso na prática?

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

O que muda no Omni 1.1 Flash para consistência entre clipes

São três controles diferentes atacando o mesmo problema, e eles não fazem a mesma coisa. Vale separar bem antes de sair usando

Referência de vídeo (até 3 clipes de 3 segundos):

Tu manda um clipe curto do personagem junto com o prompt, e o modelo usa aquilo como base visual. A documentação da Gemini API define o teto: no máximo 3 clipes de referência, de até 3 segundos cada

E tem um detalhe importante que a própria doc deixa claro: as referências de vídeo funcionam melhor pra semelhança (likeness). Ou seja, é ferramenta de "quem é essa pessoa", não de "o que ela faz"

Extensão de cena com mais contexto:

Em modelos anteriores, a extensão de cena olhava só o último segundo do vídeo pra continuar. No Omni 1.1 ela passa a analisar até 10 segundos do vídeo anterior como contexto

Parece pouco na descrição, mas é MUITA diferença: um segundo final de vídeo é praticamente um frame congelado, dez segundos já carregam a aparência do personagem, o enquadramento e o movimento da cena

Controle de primeiro e último frame:

Aqui tu define o frame inicial e o frame final do plano, e o modelo gera o vídeo entre esses dois keyframes

Se você já mexeu com animação por keyframe, é o mesmo raciocínio: tu ancora os dois extremos e deixa o meio ser preenchido

O que você precisa antes de começar

Primeiro, onde a coisa vive hoje. O Omni 1.1 Flash está na Gemini API pelo Google AI Studio e no Gemini Enterprise Agent Platform, e no Flow globalmente pra assinantes Google AI Plus, Pro e Ultra. A extensão de cena também aparece no app Gemini pra esses assinantes

Na plataforma do Google Cloud o identificador é gemini-omni-1.1-flash, e ele está marcado como Preview. Preview quer dizer o de sempre: comportamento pode mudar, então não amarre um pipeline de produção nisso sem plano B

Se a tua dúvida ainda é por onde entrar, aquele papo de começar pela Gemini API ou pelo AI Studio vale a leitura, o raciocínio é o mesmo aqui

Segundo, o material de origem. E é aqui que a maioria se ferra:

  • clipes curtos do personagem, dentro do limite de 3 segundos
  • fundo simples ou segmentado (as boas práticas oficiais do Flow dizem que referências de sujeito ou produto rendem melhor assim)
  • consistência visual entre as referências, caso tu use mais de uma, pra ajudar o modelo a combinar tudo

Gravar 3 segundos do personagem num fundo limpo dá mais resultado que mandar um clipe lindo de cena cheia. Se liga nisso

Passo a passo: usando vídeo de referência no Google Flow

Esse fluxo abaixo é o caminho documentado no Flow, sem invenção

  1. Abra a caixa de prompt do seu projeto e clique no nome do modelo. No Flow ele aparece na caixa de prompt como Omni Flash, é por ali que os controles do modelo abrem, não num menu separado de configurações
  1. Entre em Video Ingredients. Esse é o lugar das referências de vídeo. O erro comum deste passo é procurar a opção dentro do app Gemini ou em outro produto: caminho de um produto não vale pro outro, e aqui a instrução é do Flow
  1. Adicione a referência. Tem três jeitos: arrastar o arquivo do dispositivo, digitar @ na caixa de prompt pra buscar pelo nome um asset já enviado ao projeto, ou clicar em Add abaixo do prompt de texto
  1. Respeite o teto de 3 clipes de até 3 segundos cada. O erro comum aqui é tentar mandar aquele clipe de 8 segundos "porque mostra melhor o personagem". Corte antes, escolhendo o trecho em que o rosto aparece mais limpo
  1. Escreva o prompt citando explicitamente os frames ou ingredients fornecidos. Essa é a boa prática oficial, e é o passo que mais gente pula. Prompt genérico não amarra nada, o modelo não adivinha que aquele vídeo ali é o personagem principal

Um exemplo do formato da ideia (adapte ao seu projeto):

A mulher do vídeo de referência caminha por um corredor de escritório vazio,
câmera acompanhando de lado, mesma roupa e mesmo penteado da referência,
luz fria de fim de tarde

Repare no que o prompt faz: ele aponta pra referência, descreve o que muda (ação, cenário, luz) e fixa o que NÃO pode mudar (roupa, penteado)

O personagem ainda muda de cara: causas e correções

Se você seguiu o fluxo e mesmo assim o rosto dança entre os clipes, provavelmente é um destes casos

Sintoma: resultado esquisito ou inesperado depois que você mandou vários vídeos

Causa: referenciar ou raciocinar entre múltiplos vídeos não é suportado, e a documentação avisa que isso pode gerar desempenho degradado ou saídas inesperadas

Como prevenir: trate cada geração como um vídeo de referência principal. Não monte prompt pedindo pro modelo comparar, cruzar ou "misturar" vídeos diferentes

Sintoma: a voz ou o áudio do clipe original sumiu

Causa: qualquer áudio presente no vídeo de referência é ignorado pelo modelo

Como prevenir: nem tente usar a referência como fonte de voz. Ela é material visual, ponto. Planeje o áudio como uma etapa separada do seu fluxo

Sintoma: você pediu a ação do clipe de referência e veio outra coisa

Causa: o uso indicado da referência de vídeo é semelhança, não coreografia de movimento nem cenário

Como prevenir: a referência entrega o "quem", o prompt de texto entrega o "o quê". Descreva a ação e o ambiente por escrito, com detalhe, em vez de esperar que o modelo copie o que acontece no clipe

Sintoma: com duas ou três referências, o personagem virou um híbrido estranho

Causa: referências visualmente inconsistentes entre si

Como prevenir: a orientação oficial é que consistência visual entre as referências ajuda o modelo a combiná-las. Então grave os clipes na mesma sessão, com a mesma luz, mesma roupa e mesmo enquadramento sempre que der

Sintoma: o rosto até bate, mas o resto do personagem varia

Causa: sujeito num fundo poluído, disputando atenção com o resto do quadro

Como prevenir: referências de sujeito ou produto rendem melhor em fundo simples ou segmentado. Parede lisa já resolve boa parte 🙂

Rascunho em 360p ou entrega em 1080p: quanto custa cada teste

Consistência se resolve testando, e testar em resolução final é queimar dinheiro à toa. O Omni 1.1 Flash adiciona um modo de rascunho em 360p, mais rápido e mais barato, além de saídas em 1080p e upscaling para 4K

Os valores da API por segundo de vídeo gerado, por resolução:

Resolução Preço por segundo gerado Quando usar
360p (rascunho) US$ 0,03 Validar se o personagem se mantém entre os clipes
720p US$ 0,10 Aprovação interna, revisão de cena
1080p US$ 0,15 Entrega final
4K US$ 0,30 Upscaling da entrega, não geração nativa

O modo rascunho em 360p é reportado como até 60% mais rápido e com um terço do custo do 720p. Ou seja: é ali que tu descobre se a referência pegou, e só depois sobe pra entrega

E atenção no 4K: ele é upscaling, não geração nativa em 4K. Isso muda a expectativa do que tu vai receber no arquivo final

Quando vale usar vídeo de referência (e quando outro controle resolve melhor)

Cada um dos três controles resolve um problema diferente. Escolher errado é metade da frustração

Manter o mesmo personagem ou produto entre planos diferentes de uma série curta: aqui é referência de vídeo mesmo. Tu tem um sujeito que precisa ser reconhecível em cenas que não têm nada a ver uma com a outra, e o que se transporta é a semelhança

Continuar uma cena que você já gerou: aqui não é referência, é extensão de cena. Como ela passa a analisar até 10 segundos do vídeo anterior como contexto (contra apenas o último segundo em modelos anteriores), o encadeamento tende a segurar melhor a continuidade do que reintroduzir o personagem do zero

Amarrar o começo e o fim de um plano específico: aqui é o controle de primeiro e último frame, com o modelo gerando o vídeo entre os dois keyframes. É o controle mais previsível dos três, porque tu já entrega os extremos prontos

Uma coisa que eu não vi confirmada e por isso não vou afirmar: se dá pra combinar vídeo de referência e controle de primeiro/último frame na mesma geração. Se for testar, testa em 360p antes de contar com isso 😉

Conclusão

O fluxo enxuto pra segurar o personagem é bem direto

referência de até 3 clipes de 3 segundos cada, com fundo simples ou segmentado

prompt citando explicitamente o ingredient que você mandou

validação no rascunho 360p, que é mais rápido e custa um terço do 720p

e só então a entrega em 1080p

Do lado do que a referência NÃO faz: áudio é ignorado, múltiplos vídeos no mesmo prompt não são suportados, e o forte dela é semelhança, não ação

Próximo passo é botar a mão: ou pelo Flow, no caminho do Video Ingredients, ou pela Gemini API com o model ID gemini-omni-1.1-flash, lembrando que ele está em Preview. Até 28/08/2026 não há nenhuma reversão ou pausa registrada do lançamento, então o recurso segue no ar

faça o teste e me conta como ficou… até o próximo post! =)

Perguntas frequentes

Quanto custa gerar vídeo com o Gemini Omni 1.1 Flash usando referência de personagem?

O preço é por segundo de vídeo gerado e varia pela resolução: US$ 0,03 no modo rascunho 360p, US$ 0,10 em 720p, US$ 0,15 em 1080p e US$ 0,30 em 4K. Usar vídeo de referência não muda essa tabela, o custo segue amarrado à resolução escolhida na geração.

Dá pra usar vídeo de referência do Omni 1.1 Flash direto pela API, sem passar pelo Flow?

O modelo está disponível na Gemini API pelo Google AI Studio e no Gemini Enterprise Agent Platform, com o identificador gemini-omni-1.1-flash em Preview, e a própria documentação da Gemini API define o limite das referências: no máximo 3 clipes de até 3 segundos cada. O passo a passo clicável que mostro no post é o do Flow, pelo caminho do Video Ingredients.

O Gemini Omni 1.1 Flash já está liberado pra qualquer pessoa usar?

No Flow, ele está disponível globalmente pra assinantes Google AI Plus, Pro e Ultra, e a extensão de cena também aparece no app Gemini pra esses planos. Fora disso, o acesso é via Gemini API no Google AI Studio e no Gemini Enterprise Agent Platform, ainda em Preview.

Vale a pena gerar direto em 1080p ou é melhor testar antes no modo rascunho 360p?

O modo rascunho em 360p é até 60% mais rápido e custa um terço do valor do 720p, então compensa pra testar se a referência de personagem funcionou antes de gastar em resolução maior. Depois que o resultado te agradar, aí sim vale renderizar em 1080p, que custa US$ 0,15 por segundo.

Posso mandar um vídeo de referência maior que 3 segundos pro Omni 1.1 Flash?

Não, o limite documentado é de até 3 segundos por clipe de referência, com no máximo 3 clipes por geração. Cortar o vídeo pra caber nesse teto é melhor do que tentar contornar o limite, já que referenciar vários vídeos sem seguir essa regra pode gerar resultado degradado ou inesperado.

O upscaling 4K do Omni 1.1 Flash gera vídeo nativo nessa resolução?

Não, o 4K disponível é upscaling em cima da geração, não geração nativa em 4K. Ele custa US$ 0,30 por segundo, o valor mais alto da tabela, ao lado das opções de saída direta em 1080p e do modo rascunho em 360p.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares