Como gerar a transição entre dois keyframes no Gemini Omni 1.1 Flash

transição entre frame inicial e final no Gemini Omni 1.1 Flash usando keyframes
Resposta rápida

O controle de primeiro e último frame do Gemini Omni 1.1 Flash deixa você fixar keyframes de início e fim, e o modelo gera a filmagem contínua entre os dois. Na Gemini API isso é a tarefa image_to_video, com duas imagens na entrada (primeira = frame inicial, segunda = frame final), no máximo 2, mais um prompt descrevendo a transição, usando o model gemini-omni-1.1-flash. No Google Flow dá pra fazer o mesmo sem código, soltando os dois frames e gerando com presets ou prompt. Cada geração entrega de 3 a 10 segundos, com extensão em blocos de 10 até 40 segundos cumulativos. Trabalhar com keyframes no Gemini Omni 1.1 Flash é planejar o plano, não torcer pelo resultado

Não tem coisa mais chata em vídeo gerado por IA do que o plano terminar no lugar errado

Você capricha no prompt, a câmera até se move bonito, aí o último frame é qualquer coisa menos o que você tinha na cabeça

O Gemini Omni 1.1 Flash é o novo modelo multimodal do Google pra geração e edição de vídeo, e ele chegou com um pacote de controles criativos voltado pra quem desenvolve: extensão de cena, rascunho em 360p, upscaling até 4K, referências de vídeo e o que interessa aqui, o controle de primeiro e último frame

A ideia é simples de entender e pesada no resultado: tu entrega a imagem de onde o plano começa, a imagem de onde ele termina, e o modelo gera a filmagem contínua entre as duas

Ou seja, o destino do plano deixa de ser sorte 🙂

Bora ver como isso funciona na prática?

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

O que você precisa antes de começar

Antes de sair gerando, vale saber por onde tu vai entrar, porque o nome do modelo MUDA conforme o ambiente

Onde Identificador do modelo Situação
Gemini API (Google AI Studio) gemini-omni-1.1-flash disponível pra desenvolvedores
Gemini Enterprise Agent Platform gemini-omni-1.1-flash-preview Preview
Google Flow (sem código) não se aplica rollout global para assinantes Google AI Plus, Pro e Ultra

O acesso de desenvolvedor sai pela Gemini API no Google AI Studio e pela Gemini Enterprise Agent Platform

Se tu não quer escrever uma linha de código, o caminho é o Google Flow, que está sendo liberado globalmente pra quem assina Google AI Plus, Pro ou Ultra

E os keyframes? São só duas imagens: a do começo do plano e a do fim

A ordem importa muito, e eu volto nisso no passo a passo

Quando bater dúvida, a referência é a documentação oficial do Gemini API

Passo a passo: gerar a transição entre dois keyframes na Gemini API

A interpolação entre keyframes não é um modo secreto nem prompt mágico, é uma tarefa específica com uma entrada bem definida

Se liga na sequência

  1. Defina a tarefa como image_to_video

É essa a tarefa que faz a interpolação entre keyframes

O erro comum deste passo é tratar isso como geração de vídeo a partir de texto puro: sem as imagens, não existe frame inicial nem final pra interpolar, e o modelo volta a inventar o destino do plano

  1. Monte a lista de entrada com DUAS imagens, na ordem certa

A primeira imagem é o frame inicial

A segunda é o frame final

O erro comum deste passo é inverter as duas e depois achar que o modelo "entendeu errado" o prompt: ele entendeu certo, tu que pediu o caminho de trás pra frente

  1. Não passe mais de 2 imagens

A interpolação aceita no máximo 2 imagens

O erro comum deste passo é tentar mandar três ou quatro frames pra montar um plano inteiro de uma vez, tipo storyboard

Não é assim que ele funciona, beleza? Pra plano mais longo, o caminho é encadear (te conto lá embaixo)

  1. Escreva o prompt de texto descrevendo a transição

Aqui é onde tu diz o COMO: o que acontece entre o frame A e o frame B

É movimento de câmera? É a órbita em volta do objeto? É zoom entrando?

As imagens dizem onde começa e onde termina, o texto diz o caminho

O erro comum deste passo é escrever de novo a descrição da cena que já está nas imagens, e esquecer de descrever o movimento

  1. Aponte o model como gemini-omni-1.1-flash no SDK GoogleGenAI

Esse é o identificador usado nos exemplos da Gemini API

Se tu estiver na Gemini Enterprise Agent Platform, lembra que lá o identificador é gemini-omni-1.1-flash-preview e o modelo está em Preview

O erro comum deste passo é copiar o identificador de um ambiente e colar no outro

Juntando as peças, a chamada tem esta cara:

model: 'gemini-omni-1.1-flash'   // SDK GoogleGenAI
task:  'image_to_video'          // interpolação entre keyframes
imagens: [frame_inicial, frame_final]   // máximo 2
prompt: 'descreva aqui a transição entre os dois frames'

O nome exato de cada campo tu confere na documentação oficial na hora de escrever o código de verdade

  1. Gere e confira a duração da saída

Cada geração individual produz de 3 a 10 segundos de vídeo

O erro comum deste passo é planejar uma transição de 20 segundos e ficar puto quando o clipe volta curto

Não é falha, é o tamanho da saída

Como fazer a mesma transição no Google Flow, sem escrever código

Se a tua praia não é SDK, o Flow resolve o mesmo problema pela interface

Lá tu coloca o primeiro frame, coloca o último frame e gera a transição entre eles usando os presets ou a caixa de prompt

Mesma lógica: dois pontos definidos, o modelo preenche o meio

Esse acesso está saindo globalmente pra assinantes Google AI Plus, Pro e Ultra

Tome cuidado com uma confusão comum: o que é da API não é a mesma tela do Flow

A lista de duas imagens, a tarefa image_to_video e o identificador do modelo são conversa de API

No Flow tu está lidando com frames soltos na interface e presets

Misturar os dois é o jeito mais rápido de ficar procurando um botão que não existe 😛

Para que serve o controle de primeiro e último frame na prática

O Google posiciona esse controle pra quatro coisas: órbitas de câmera, zooms, transições e clipes em loop

E faz sentido, olha só o padrão entre elas

  • Órbita de câmera: o valor está em saber onde a câmera para. Com o frame final fixo, a volta em torno do objeto tem destino, e não fica aquele giro aleatório que termina em qualquer ângulo
  • Zoom: o enquadramento de chegada é justamente o que define se o zoom funcionou. Definindo o frame final, tu está dizendo o tamanho e a posição exata do assunto no fim do movimento
  • Transição: é o caso mais direto. Cena A na primeira imagem, cena B na segunda, e o modelo costura o caminho entre as duas em vez de tu depender de corte seco na edição
  • Loop: aqui tem um truque bonito de entender. Se o frame final é igual ao inicial, o clipe fecha nele mesmo, e é isso que dá o loop contínuo

Repara no que muda de verdade: em vez de descrever o resultado e esperar, tu especifica o resultado e o modelo trabalha pra chegar nele

Quem já montou pipeline de criativo dentro de outra ferramenta, tipo o HyperFrames no OpenDesign, reconhece o pulo: quanto mais o output está preso a uma referência que tu controla, menos retrabalho depois

Problemas comuns na interpolação entre keyframes (e como resolver)

A maioria dos perrengues aqui não é bug, é limite do modelo batendo na expectativa errada

A transição ficou curta demais pro movimento que eu planejei

Causa: cada geração entrega de 3 a 10 segundos, e ponto

Solução: planejar o movimento pra caber nesse intervalo, ou estender o vídeo depois em incrementos de 10 segundos, até o total cumulativo de 40 segundos

Prevenção: antes de gerar, pergunta "esse movimento cabe em até 10 segundos?". Se a resposta for não, quebra em mais de um trecho

Veio em 720p e eu esperava 1080p ou 4K nativo

Causa: a resolução padrão da API é 720p. 1080p e 4K são entregues como upscaling, não como geração nativa

Solução: gerar em 720p e aplicar o upscaling, que vai até 4K

Prevenção: já assumir esse fluxo no teu planejamento de entrega, em vez de esperar pixel nativo em 4K saindo do gerador

Estou gastando uma fortuna testando ideia de transição

Causa: iterar direto na saída padrão em 720p

Solução: usar o modo de rascunho em 360p, que renderiza até 60% mais rápido e custa um terço da saída padrão em 720p

Prevenção: valida a IDEIA no rascunho (a órbita fecha? o zoom chega no enquadramento certo?) e só sobe pra 720p quando o movimento estiver aprovado

Deu erro quando mandei mais imagens

Causa: a interpolação aceita no máximo 2 imagens

Solução: manter só o par inicial e final

Prevenção: se tu precisa de mais pontos de controle, encadeia gerações em vez de empilhar frames numa chamada só

Além dos dois keyframes: estender a cena para planos mais longos

Dois keyframes te dão um trecho

Pra plano mais longo, tu encadeia com a extensão de cena, em incrementos de 10 segundos, até 40 segundos cumulativos

E tem um detalhe que muda a qualidade do encaixe: na extensão de cena, o modelo analisa até 10 segundos do contexto anterior, contra apenas o último segundo em modelos anteriores

Pensa no que isso significa na prática

Antes, o modelo continuava a cena olhando basicamente pro último quadro, então era fácil o movimento e a iluminação darem uma "escorregada" na emenda

Com até 10 segundos de contexto, ele tem MUITO mais informação sobre pra onde a coisa estava indo

Dá também pra adicionar até 3 segundos de referências de vídeo pra guiar movimento e consistência

É o mesmo espírito dos keyframes: em vez de descrever com palavras o jeito que a câmera se mexe, tu mostra

E se tu não é dev, a extensão de cena também está no app Gemini pra assinantes Plus, Pro e Ultra

Conclusão

O controle de primeiro e último frame no Gemini Omni 1.1 Flash é menos um recurso novo e mais uma mudança de postura

Tu para de descrever um resultado e torcer, e passa a fixar os dois pontos do plano pra deixar o modelo resolver só o caminho

Órbita, zoom, transição e loop ganham destino, e a extensão de cena cuida do resto quando o plano precisa de fôlego

O próximo passo é bem prático: separa um par de imagens simples (algo com movimento óbvio entre elas), roda em 360p pra validar a ideia rápido e barato, e só depois gera em 720p e aplica o upscaling

Aí tu vê na tela o quanto isso economiza tentativa

até o próximo post! =)

Perguntas frequentes

Quantas imagens o Gemini Omni 1.1 Flash aceita para gerar a transição entre keyframes?

No máximo 2 imagens. A primeira entra como frame inicial e a segunda como frame final, e é em cima dessas duas que o modelo gera a filmagem contínua na tarefa image_to_video.

Quanto tempo dura o vídeo gerado ao interpolar dois keyframes?

Cada geração individual produz de 3 a 10 segundos de vídeo. Se o plano precisa de mais do que isso, o caminho é estender depois, não pedir uma transição longa de uma vez só.

Dá para deixar a transição entre keyframes mais longa depois de gerada?

Sim, o vídeo pode ser estendido em incrementos de 10 segundos até um total cumulativo de 40 segundos. É esse encadeamento que resolve o plano mais longo, em vez de tentar pedir a transição inteira numa geração só.

O identificador do modelo muda entre o Google AI Studio e o Gemini Enterprise Agent Platform?

Muda sim. Nos exemplos da Gemini API via Google AI Studio o modelo é gemini-omni-1.1-flash, enquanto no Gemini Enterprise Agent Platform o identificador é gemini-omni-1.1-flash-preview, ainda em Preview.

É possível usar o controle de primeiro e último frame sem escrever código?

Dá, pelo Google Flow. Basta soltar o frame inicial e o frame final e gerar a transição com os presets ou pela caixa de prompt, e esse acesso está em rollout global para assinantes Google AI Plus, Pro e Ultra.

Qual a resolução da transição gerada entre os keyframes?

O padrão da API é 720p, e 1080p e 4K saem como upscaling, não como geração nativa. Também existe o modo de rascunho em 360p, até 60% mais rápido e por um terço do custo do 720p, útil pra testar a transição antes da versão final.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares