Como manter a consistência de personagem no Gemini Omni 1.1 Flash usando vídeo de referência

A consistência de personagem no Gemini Omni 1.1 Flash ganhou um caminho direto: o modelo aceita referência de vídeo de até 3 segundos (no máximo 3 clipes, de até 3 segundos cada) pra preservar contexto visual e semelhança entre gerações. No Google Flow a referência entra pelo Video Ingredients, e o prompt precisa citar explicitamente os ingredients enviados. Áudio da referência é ignorado, e referenciar múltiplos vídeos no mesmo prompt não é suportado. Pra testar gastando pouco, dá pra validar no modo rascunho 360p (US$ 0,03 por segundo) e só depois fechar em 1080p (US$ 0,15 por segundo)
Fala aí, beleza? Tu gera o primeiro clipe, o personagem tá lá, perfeito, do jeitinho que tu imaginou
aí gera o segundo e ele volta com outro rosto, outro cabelo, outra idade… clássico 😅
O Google anunciou em 27/08/2026 o Gemini Omni 1.1 Flash, novo modelo multimodal de geração e edição de vídeo, com rollout noticiado em 28/08/2026 e novos controles criativos pra desenvolvedores. O ponto que interessa pra quem sofre com esse problema é o input multimodal: agora dá pra referenciar vídeo ao criar uma cena, até 3 clipes de 3 segundos cada, justamente pra manter contexto visual e semelhança entre uma geração e outra
Bora entender o que muda e como usar isso na prática?
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
O que muda no Omni 1.1 Flash para consistência entre clipes
São três controles diferentes atacando o mesmo problema, e eles não fazem a mesma coisa. Vale separar bem antes de sair usando
Referência de vídeo (até 3 clipes de 3 segundos):
Tu manda um clipe curto do personagem junto com o prompt, e o modelo usa aquilo como base visual. A documentação da Gemini API define o teto: no máximo 3 clipes de referência, de até 3 segundos cada
E tem um detalhe importante que a própria doc deixa claro: as referências de vídeo funcionam melhor pra semelhança (likeness). Ou seja, é ferramenta de "quem é essa pessoa", não de "o que ela faz"
Extensão de cena com mais contexto:
Em modelos anteriores, a extensão de cena olhava só o último segundo do vídeo pra continuar. No Omni 1.1 ela passa a analisar até 10 segundos do vídeo anterior como contexto
Parece pouco na descrição, mas é MUITA diferença: um segundo final de vídeo é praticamente um frame congelado, dez segundos já carregam a aparência do personagem, o enquadramento e o movimento da cena
Controle de primeiro e último frame:
Aqui tu define o frame inicial e o frame final do plano, e o modelo gera o vídeo entre esses dois keyframes
Se você já mexeu com animação por keyframe, é o mesmo raciocínio: tu ancora os dois extremos e deixa o meio ser preenchido
O que você precisa antes de começar
Primeiro, onde a coisa vive hoje. O Omni 1.1 Flash está na Gemini API pelo Google AI Studio e no Gemini Enterprise Agent Platform, e no Flow globalmente pra assinantes Google AI Plus, Pro e Ultra. A extensão de cena também aparece no app Gemini pra esses assinantes
Na plataforma do Google Cloud o identificador é gemini-omni-1.1-flash, e ele está marcado como Preview. Preview quer dizer o de sempre: comportamento pode mudar, então não amarre um pipeline de produção nisso sem plano B
Se a tua dúvida ainda é por onde entrar, aquele papo de começar pela Gemini API ou pelo AI Studio vale a leitura, o raciocínio é o mesmo aqui
Segundo, o material de origem. E é aqui que a maioria se ferra:
- clipes curtos do personagem, dentro do limite de 3 segundos
- fundo simples ou segmentado (as boas práticas oficiais do Flow dizem que referências de sujeito ou produto rendem melhor assim)
- consistência visual entre as referências, caso tu use mais de uma, pra ajudar o modelo a combinar tudo
Gravar 3 segundos do personagem num fundo limpo dá mais resultado que mandar um clipe lindo de cena cheia. Se liga nisso
Passo a passo: usando vídeo de referência no Google Flow
Esse fluxo abaixo é o caminho documentado no Flow, sem invenção
- Abra a caixa de prompt do seu projeto e clique no nome do modelo. No Flow ele aparece na caixa de prompt como Omni Flash, é por ali que os controles do modelo abrem, não num menu separado de configurações
- Entre em Video Ingredients. Esse é o lugar das referências de vídeo. O erro comum deste passo é procurar a opção dentro do app Gemini ou em outro produto: caminho de um produto não vale pro outro, e aqui a instrução é do Flow
- Adicione a referência. Tem três jeitos: arrastar o arquivo do dispositivo, digitar
@na caixa de prompt pra buscar pelo nome um asset já enviado ao projeto, ou clicar em Add abaixo do prompt de texto
- Respeite o teto de 3 clipes de até 3 segundos cada. O erro comum aqui é tentar mandar aquele clipe de 8 segundos "porque mostra melhor o personagem". Corte antes, escolhendo o trecho em que o rosto aparece mais limpo
- Escreva o prompt citando explicitamente os frames ou ingredients fornecidos. Essa é a boa prática oficial, e é o passo que mais gente pula. Prompt genérico não amarra nada, o modelo não adivinha que aquele vídeo ali é o personagem principal
Um exemplo do formato da ideia (adapte ao seu projeto):
A mulher do vídeo de referência caminha por um corredor de escritório vazio,
câmera acompanhando de lado, mesma roupa e mesmo penteado da referência,
luz fria de fim de tarde
Repare no que o prompt faz: ele aponta pra referência, descreve o que muda (ação, cenário, luz) e fixa o que NÃO pode mudar (roupa, penteado)
O personagem ainda muda de cara: causas e correções
Se você seguiu o fluxo e mesmo assim o rosto dança entre os clipes, provavelmente é um destes casos
Sintoma: resultado esquisito ou inesperado depois que você mandou vários vídeos
Causa: referenciar ou raciocinar entre múltiplos vídeos não é suportado, e a documentação avisa que isso pode gerar desempenho degradado ou saídas inesperadas
Como prevenir: trate cada geração como um vídeo de referência principal. Não monte prompt pedindo pro modelo comparar, cruzar ou "misturar" vídeos diferentes
Sintoma: a voz ou o áudio do clipe original sumiu
Causa: qualquer áudio presente no vídeo de referência é ignorado pelo modelo
Como prevenir: nem tente usar a referência como fonte de voz. Ela é material visual, ponto. Planeje o áudio como uma etapa separada do seu fluxo
Sintoma: você pediu a ação do clipe de referência e veio outra coisa
Causa: o uso indicado da referência de vídeo é semelhança, não coreografia de movimento nem cenário
Como prevenir: a referência entrega o "quem", o prompt de texto entrega o "o quê". Descreva a ação e o ambiente por escrito, com detalhe, em vez de esperar que o modelo copie o que acontece no clipe
Sintoma: com duas ou três referências, o personagem virou um híbrido estranho
Causa: referências visualmente inconsistentes entre si
Como prevenir: a orientação oficial é que consistência visual entre as referências ajuda o modelo a combiná-las. Então grave os clipes na mesma sessão, com a mesma luz, mesma roupa e mesmo enquadramento sempre que der
Sintoma: o rosto até bate, mas o resto do personagem varia
Causa: sujeito num fundo poluído, disputando atenção com o resto do quadro
Como prevenir: referências de sujeito ou produto rendem melhor em fundo simples ou segmentado. Parede lisa já resolve boa parte 🙂
Rascunho em 360p ou entrega em 1080p: quanto custa cada teste
Consistência se resolve testando, e testar em resolução final é queimar dinheiro à toa. O Omni 1.1 Flash adiciona um modo de rascunho em 360p, mais rápido e mais barato, além de saídas em 1080p e upscaling para 4K
Os valores da API por segundo de vídeo gerado, por resolução:
| Resolução | Preço por segundo gerado | Quando usar |
|---|---|---|
| 360p (rascunho) | US$ 0,03 | Validar se o personagem se mantém entre os clipes |
| 720p | US$ 0,10 | Aprovação interna, revisão de cena |
| 1080p | US$ 0,15 | Entrega final |
| 4K | US$ 0,30 | Upscaling da entrega, não geração nativa |
O modo rascunho em 360p é reportado como até 60% mais rápido e com um terço do custo do 720p. Ou seja: é ali que tu descobre se a referência pegou, e só depois sobe pra entrega
E atenção no 4K: ele é upscaling, não geração nativa em 4K. Isso muda a expectativa do que tu vai receber no arquivo final
Quando vale usar vídeo de referência (e quando outro controle resolve melhor)
Cada um dos três controles resolve um problema diferente. Escolher errado é metade da frustração
Manter o mesmo personagem ou produto entre planos diferentes de uma série curta: aqui é referência de vídeo mesmo. Tu tem um sujeito que precisa ser reconhecível em cenas que não têm nada a ver uma com a outra, e o que se transporta é a semelhança
Continuar uma cena que você já gerou: aqui não é referência, é extensão de cena. Como ela passa a analisar até 10 segundos do vídeo anterior como contexto (contra apenas o último segundo em modelos anteriores), o encadeamento tende a segurar melhor a continuidade do que reintroduzir o personagem do zero
Amarrar o começo e o fim de um plano específico: aqui é o controle de primeiro e último frame, com o modelo gerando o vídeo entre os dois keyframes. É o controle mais previsível dos três, porque tu já entrega os extremos prontos
Uma coisa que eu não vi confirmada e por isso não vou afirmar: se dá pra combinar vídeo de referência e controle de primeiro/último frame na mesma geração. Se for testar, testa em 360p antes de contar com isso 😉
Conclusão
O fluxo enxuto pra segurar o personagem é bem direto
referência de até 3 clipes de 3 segundos cada, com fundo simples ou segmentado
prompt citando explicitamente o ingredient que você mandou
validação no rascunho 360p, que é mais rápido e custa um terço do 720p
e só então a entrega em 1080p
Do lado do que a referência NÃO faz: áudio é ignorado, múltiplos vídeos no mesmo prompt não são suportados, e o forte dela é semelhança, não ação
Próximo passo é botar a mão: ou pelo Flow, no caminho do Video Ingredients, ou pela Gemini API com o model ID gemini-omni-1.1-flash, lembrando que ele está em Preview. Até 28/08/2026 não há nenhuma reversão ou pausa registrada do lançamento, então o recurso segue no ar
faça o teste e me conta como ficou… até o próximo post! =)
Perguntas frequentes
Quanto custa gerar vídeo com o Gemini Omni 1.1 Flash usando referência de personagem?
O preço é por segundo de vídeo gerado e varia pela resolução: US$ 0,03 no modo rascunho 360p, US$ 0,10 em 720p, US$ 0,15 em 1080p e US$ 0,30 em 4K. Usar vídeo de referência não muda essa tabela, o custo segue amarrado à resolução escolhida na geração.
Dá pra usar vídeo de referência do Omni 1.1 Flash direto pela API, sem passar pelo Flow?
O modelo está disponível na Gemini API pelo Google AI Studio e no Gemini Enterprise Agent Platform, com o identificador gemini-omni-1.1-flash em Preview, e a própria documentação da Gemini API define o limite das referências: no máximo 3 clipes de até 3 segundos cada. O passo a passo clicável que mostro no post é o do Flow, pelo caminho do Video Ingredients.
O Gemini Omni 1.1 Flash já está liberado pra qualquer pessoa usar?
No Flow, ele está disponível globalmente pra assinantes Google AI Plus, Pro e Ultra, e a extensão de cena também aparece no app Gemini pra esses planos. Fora disso, o acesso é via Gemini API no Google AI Studio e no Gemini Enterprise Agent Platform, ainda em Preview.
Vale a pena gerar direto em 1080p ou é melhor testar antes no modo rascunho 360p?
O modo rascunho em 360p é até 60% mais rápido e custa um terço do valor do 720p, então compensa pra testar se a referência de personagem funcionou antes de gastar em resolução maior. Depois que o resultado te agradar, aí sim vale renderizar em 1080p, que custa US$ 0,15 por segundo.
Posso mandar um vídeo de referência maior que 3 segundos pro Omni 1.1 Flash?
Não, o limite documentado é de até 3 segundos por clipe de referência, com no máximo 3 clipes por geração. Cortar o vídeo pra caber nesse teto é melhor do que tentar contornar o limite, já que referenciar vários vídeos sem seguir essa regra pode gerar resultado degradado ou inesperado.
O upscaling 4K do Omni 1.1 Flash gera vídeo nativo nessa resolução?
Não, o 4K disponível é upscaling em cima da geração, não geração nativa em 4K. Ele custa US$ 0,30 por segundo, o valor mais alto da tabela, ao lado das opções de saída direta em 1080p e do modo rascunho em 360p.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Gemini Pro vale a pena para estudante? O que muda de verdade na rotina de estudo
Gemini Pro estudante: veja o preço atual do Google AI Pro, o que muda na rotina de estudo e se vale migrar do plano gratuito para universitários em 2026.
Gemini e NotebookLM: qual a relação entre as duas ferramentas de IA do Google?
Gemini e NotebookLM viraram uma dupla: em julho/2026 o Google renomeou o NotebookLM para Gemini Notebook. Veja a diferença e quando usar cada um.
Como excluir sua conta do Gemini e o que acontece com seus dados
Como excluir conta Gemini: apague só o histórico ou encerre a Conta Google inteira. Saiba exatamente o que acontece com seus dados antes de decidir.
