Como montar um storyboard com o Gemini Omni 1.1 Flash e iterar rápido?

fluxo de storyboard com Gemini Omni 1.1 Flash mostrando frames em sequência
Resposta rápida

O Gemini Omni 1.1 Flash é o modelo multimodal de geração e edição de vídeo anunciado pelo Google, com identificador gemini-omni-1.1-flash na Gemini API. Pra storyboard, a lógica é simples: rascunha em 360p (US$ 0,03 por segundo, até 60% mais rápido que o 720p), itera por conversa na Interactions API sem reenviar o vídeo anterior, trava enquadramento com primeiro e último frame, estende a cena de 10 em 10 segundos até o teto acumulado de 40 e só no fim sobe pra resolução de entrega, lembrando que 1080p e 4K saem por upscaling

Fala aí, beleza? Fechar a narrativa de um storyboard nunca foi problema de talento, é problema de quantidade: a equipe precisa ver dez versões do mesmo plano pra saber qual funciona, e quando cada render custa caro e demora, todo mundo fecha na segunda versão e chama de decisão criativa 😀

O Google anunciou o Gemini Omni 1.1 Flash, seu modelo multimodal mais recente pra geração e edição de vídeo, com novos controles criativos voltados a desenvolvedores

Na Gemini API ele atende pelo identificador gemini-omni-1.1-flash

E a lógica do fluxo que eu vou montar aqui é essa: rascunhar barato, iterar por conversa, ramificar em direções diferentes e só então subir a resolução

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

O que você precisa antes de começar

Primeiro, acesso ao modelo

Desenvolvedores chegam nele pela Gemini API no Google AI Studio e pela API da Gemini Enterprise Agent Platform, onde ele consta listado como Gemini Omni 1.1 Flash Preview

O identificador é este aqui:

gemini-omni-1.1-flash

A documentação oficial de geração e edição de vídeo com o Omni Flash fica em ai.google.dev/gemini-api/docs/omni

Deixa essa página aberta numa aba do lado, porque é dela que sai a sintaxe exata das chamadas

E do lado da equipe, o que entra?

Material, não ferramenta

  • o prompt do plano, escrito como descrição de cena e não como pedido genérico
  • imagens de referência pra definir o primeiro e o último frame
  • se existir, até 3 segundos de vídeo externo de referência pra carregar movimento, contexto visual e consistência de personagem

Se você já roda IA na produção da empresa, a leitura de encaixe é a mesma que vale pro Gemini em fluxos corporativos: a ferramenta entra onde tem processo, não onde tem vontade

E quem não é dev?

Boa pergunta, porque nem todo mundo do time de criação vai abrir uma API

Pra usuário final, a atualização chega globalmente no Flow pra assinantes Google AI Plus, Pro e Ultra

A extensão de cena também está disponível pra esses mesmos assinantes no app Gemini

Qual resolução usar em cada fase do storyboard?

Essa é a decisão que define o orçamento inteiro da pré-produção, então vale olhar com calma

O preço por segundo de vídeo muda conforme a resolução:

Resolução Preço por segundo Fase indicada
360p US$ 0,03 rascunho, iteração e ramificação criativa
720p (padrão) US$ 0,10 versão semifinal, quando a narrativa já fechou
1080p US$ 0,15 entrega, via upscaling
4K US$ 0,30 entrega final, via upscaling

Duas coisas importantes aqui

O modo de rascunho em 360p gera até 60% mais rápido e por cerca de um terço do custo em relação ao 720p, ou seja, ele não é só mais barato, ele é mais rápido no ciclo de decisão

E as saídas em 1080p e 4K são entregues por upscaling, não por geração nativa nessas resoluções

A leitura prática é meio óbvia depois de escrita: o que estoura orçamento de pré-produção não é a entrega, é iterar caro

Pelo mesmo dinheiro de três renders em 720p tu roda dez rascunhos em 360p, e são os dez rascunhos que fecham a narrativa

Passo a passo: montar e iterar o storyboard

Bora ver na prática?

  1. Escreva o prompt do plano e gere em 360p. Descreva a cena inteira: enquadramento, movimento de câmera, luz, ação. O rascunho existe pra você errar barato, então erre bastante aqui. O erro comum deste passo é começar em 720p "só pra ver melhor": você vai ver melhor um plano que ainda vai ser jogado fora
  1. Defina o primeiro e o último frame do plano. O modelo permite travar as duas imagens e gerar por interpolação o vídeo de transição entre elas. É o jeito de amarrar enquadramento em vez de rezar pro modelo acertar sozinho. O erro comum é escolher dois frames incompatíveis e esperar mágica no meio: se a distância entre as duas imagens é grande demais, a transição vira outra coisa
  1. Anexe até 3 segundos de vídeo de referência quando precisar. Esse recurso carrega movimento, contexto visual e consistência de personagem pra cena gerada. Use quando o plano depende de um jeito específico de mexer, ou do mesmo personagem aparecendo igual. O erro comum é tratar a referência como enfeite: se o clipe não tem a informação que você quer transferir, ele não transfere nada
  1. Itere por conversa na Interactions API. A edição conversacional do Omni Flash funciona assim: você descreve a mudança em linguagem natural, o modelo aplica ela e preserva o que não foi mencionado. O previous_interaction_id mantém o histórico e o estado do vídeo gerado sem que você precise reenviar o vídeo anterior. O erro comum, e esse é o mais caro de todos, é reescrever o prompt inteiro a cada rodada: se você reescreve tudo, você não está editando, você está gerando um plano novo e perdendo o que já estava bom
  1. Estenda a cena em blocos de 10 segundos. As extensões vão de 10 em 10 segundos, até um total acumulado de 40 segundos. E a extensão analisa até 10 segundos do vídeo existente como contexto, contra apenas o último segundo em modelos anteriores, o que muda bastante a continuidade do que vem depois. O erro comum é planejar no papel uma cena de um minuto e só descobrir o teto de 40 segundos na hora de montar
  1. Feche a versão aprovada e regere na resolução de entrega. Só depois que a narrativa fechou é que faz sentido pagar 720p, 1080p ou 4K. O erro comum é tratar 4K como geração nativa: ele vem por upscaling, então o que define a qualidade do resultado é o plano que você aprovou lá atrás, não o número no final

Como ramificar o storyboard em direções criativas diferentes

Agora a parte que interessa pra equipe que testa muita versão antes de fechar

Pensa no histórico da Interactions API como um tronco

Você chega num estado que já está bom, aquele plano em 360p que a diretoria aprovou de cabeça, e a partir DELE você abre ramos: um com luz diferente, um com ritmo diferente, um com outro final

Cada ramo custa três centavos de dólar por segundo, então comparar quatro direções lado a lado deixa de ser discussão de reunião e vira coisa que você mostra na tela

Continuidade entre planos vizinhos:

Usa o controle de primeiro e último frame como contrato

O último frame do plano A vira o primeiro frame do plano B

Simples assim, e resolve boa parte da sensação de "isso não parece a mesma cena"

Mesmo personagem em ramos diferentes:

Aqui entram os 3 segundos de vídeo de referência

Você mantém a mesma referência em todos os ramos e testa variação de luz e de ritmo sem que o personagem mude de cara no meio do caminho

Até onde a cena sustenta?

Essa é uma pergunta de montagem, não de modelo

Estende de 10 em 10 segundos e observa onde a cena começa a perder força

Como o modelo lê até 10 segundos anteriores como contexto, o bloco seguinte tende a conversar melhor com o que veio antes, e o teto acumulado de 40 segundos vira um limite útil: se a cena não sustenta 40 segundos, provavelmente o corte estava faltando mesmo

Quem já trabalha com latência em fluxos agentivos reconhece o padrão na hora: rodada barata e rápida muda o comportamento do time, não só a conta no fim do mês

Vídeo: geração multimodal do Google com o Gemini Flash Image

Um aviso antes de dar play: este vídeo do canal é sobre o Gemini Flash Image, que é outro modelo, de imagem, e não o Gemini Omni 1.1 Flash de vídeo que a gente viu aqui

Ele serve pra pegar a base da geração multimodal do Google, não como tutorial do Omni 🙂

Conclusão

O ganho do Gemini Omni 1.1 Flash em storyboard não é render bonito

É o custo de errar cair a ponto de a equipe testar dez versões em vez de duas, e é isso que muda a narrativa final, não o número de pixels

Próximo passo bem concreto: abre a documentação oficial em ai.google.dev/gemini-api/docs/omni, roda um plano em 360p com gemini-omni-1.1-flash e mede quantas iterações cabem no seu orçamento antes de subir a resolução

E guarda um lembrete de estado: na Gemini Enterprise Agent Platform o modelo consta como Preview, então trata como coisa que ainda pode mudar de comportamento

até o próximo post! =)

Perguntas frequentes

Qual o identificador do Gemini Omni 1.1 Flash pra usar na Gemini API?

É gemini-omni-1.1-flash. A documentação completa de geração e edição de vídeo com esse modelo fica em ai.google.dev/gemini-api/docs/omni, e é de lá que sai a sintaxe exata das chamadas.

Quanto custa gerar um vídeo em cada resolução no Omni 1.1 Flash?

O preço por segundo de vídeo é US$ 0,03 em 360p, US$ 0,10 em 720p (padrão), US$ 0,15 em 1080p e US$ 0,30 em 4K. Por isso o rascunho em 360p compensa tanto pra iterar antes de fechar a versão final.

1080p e 4K no Gemini Omni 1.1 Flash são geração nativa ou upscaling?

São entregues por upscaling, não por geração nativa nessas resoluções. Ou seja, quem define a qualidade real do resultado é o plano aprovado lá no rascunho, não a resolução escolhida no final.

Como funciona o previous_interaction_id na edição por conversa do Omni Flash?

Ele mantém o histórico e o estado do vídeo gerado na Interactions API, sem precisar reenviar o vídeo anterior a cada rodada. Assim você descreve só a mudança em linguagem natural e o modelo preserva tudo que não foi mencionado.

Até quantos segundos dá pra estender uma cena no Gemini Omni 1.1 Flash?

As extensões acontecem em blocos de 10 segundos, até um total acumulado de 40 segundos. E cada extensão analisa até 10 segundos do vídeo existente como contexto, contra apenas 1 segundo nos modelos anteriores.

Quem não é desenvolvedor consegue usar o Gemini Omni 1.1 Flash?

Sim, pra usuário final a atualização chega globalmente no Flow, pros assinantes Google AI Plus, Pro e Ultra. A extensão de cena também está disponível pra esses mesmos assinantes dentro do app Gemini.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares