Por que sua imagem se perde depois de dez pedidos? A consistência multi-turno do ChatGPT Images 2.5

consistência multi-turno do ChatGPT Images 2.5 preservando a mesma imagem em edições sucessivas
Resposta rápida

A OpenAI lançou o ChatGPT Images 2.5 em 8 de setembro de 2026, sucedendo o Images 2.0, e a promessa central é justamente a consistência multi-turno: cada edição se apoia no trabalho já feito, sem degradar a imagem ao longo de conversas mais longas. Some a isso a edição de precisão, que muda só o que foi pedido e preserva sujeito, composição e fundo, e até 50% menos latência que o Images 2.0. Só que o resultado ainda depende do seu processo: um pedido por turno, revisão antes do próximo e ferramenta de seleção usada com cuidado 🙂

Fala aí, beleza? Você pede a décima correção na imagem e percebe que aquilo ali já não é mais a mesma imagem

O rosto mudou sutilmente, o fundo escorregou pro lado, aquele detalhe que você tinha amado no turno 3 simplesmente sumiu

E o pior: cada novo pedido pra "voltar como estava" piora mais um pouquinho

A OpenAI lançou o ChatGPT Images 2.5 em 8 de setembro de 2026, sucedendo o ChatGPT Images 2.0, e um dos pontos que ela coloca na frente é exatamente esse: as mudanças anteriores tendem a permanecer consistentes ao longo de conversas mais longas no ChatGPT

Aqui o recorte é processo, não catálogo de recurso

Vamos falar de como estruturar a conversa pra ir refinando a imagem sem perder o resultado anterior, que é onde a maioria das pessoas se ferra…

O que a OpenAI lançou no ChatGPT Images 2.5

O ChatGPT Images 2.5 é o novo modelo de imagem da OpenAI, anunciado em 8 de setembro de 2026 como sucessor do Images 2.0

O foco declarado é bem direto: detalhes mais nítidos, edição mais precisa e geração mais rápida

Na velocidade tem número: até 50% menos latência que o Images 2.0

Na disponibilidade também: está liberado pra todos os usuários de ChatGPT, ChatGPT Work e Codex, em desktop, mobile e web

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 15min

Agora vem a parte que eu acho importante separar, porque quase ninguém separa

Tem coisa que é fato verificável (data de lançamento, disponibilidade, preço por token na API, identificador dos modelos) e tem coisa que é melhoria declarada pelo fornecedor

A consistência multi-turno cai no segundo grupo

A OpenAI afirma que o Images 2.5 segue instruções de edição de forma mais confiável ao longo de múltiplos turnos, e que cada nova edição se apoia no trabalho já feito sem degradar a imagem com o tempo

Só que ela não publicou número de turnos

Então não existe um "aguenta X edições seguidas" oficial, e qualquer texto que te der esse número tá chutando

Sintoma, causa e como parar a degradação a cada nova edição

Bora tratar isso como diagnóstico, que é mais útil do que ficar admirando release

O sintoma: a imagem derrete devagar

Você conhece o quadro clínico:

  • o rosto do sujeito muda de traço em traço, até virar outra pessoa parecida
  • o fundo se altera sem você ter pedido nada sobre o fundo
  • a textura vira ruído, aquele aspecto plastificado que denuncia "passou por dez gerações"

O detalhe cruel é que cada turno isolado parece ok

A degradação só aparece quando você compara o turno 10 com o turno 1

A causa: não é só marketing, é problema reconhecido

Esse ponto vale muito, porque é fácil achar que é conversa de fornecedor pra vender modelo novo

Não é

A literatura técnica já descreve o problema: modelos treinados pra interações "one-shot" sofrem degradação de aderência à instrução e de consistência visual em edições sequenciais, e o acúmulo de artefatos se agrava conforme os turnos aumentam

Ou seja, o modelo não foi feito pensando numa conversa longa de refino, ele foi feito pensando em "gera isso aqui"

Cada edição pega a saída anterior (que já tem imperfeição) e empilha mais uma camada em cima

É efeito xerox de xerox de xerox

Entendeu o porquê? Agora o como fica muito mais fácil de aceitar 😀

A solução do lado do produto

O Images 2.5 traz edição de precisão: altera apenas o que foi pedido, preservando sujeito, composição e fundo

E preserva melhor os sujeitos que vêm de fotos de referência quando você transporta eles pra novos cenários, estilos e composições, com traços distintivos tendo mais chance de se manter e iluminação e texturas mais naturais

Traduzindo: a promessa é que o modelo não mexa no que você não mandou mexer

A parte que continua sendo sua é COMO você pede

Como prevenir na prática, turno a turno

Aqui vai só o que é operacional e documentado no ChatGPT, sem invencionice:

  1. Escolha a forma de editar antes de digitar qualquer coisa. No ChatGPT existem duas: usar a ferramenta de seleção ou descrever a edição direto na conversa. O erro comum deste passo é misturar as duas no mesmo turno, o que deixa ambíguo o que você quer alterar
  1. Se for seleção, use a opção Select pra destacar a área que vai ser editada. O erro comum deste passo é confiar cego no destaque: a própria OpenAI documenta que os destaques nem sempre são precisos e que as edições podem se estender além da área selecionada
  1. Se for por texto, descreva a alteração no painel de conversa indicando a área no próprio prompt. O erro comum aqui é pedir três coisas de uma vez ("clareia o fundo, muda a camisa e tira a sombra"), porque aí você não tem como saber qual pedido estragou o quê
  1. Revise ANTES do próximo pedido. Depois de usar a ferramenta de seleção o editor te dá Undo e Redo pra revisar as seleções e Cancel pra recomeçar. Use
  1. Precisa mudar formato? Tem Aspect ratio pra regerar a imagem. O erro comum é deixar isso pro final, depois de dez ajustes finos, e ver o refino todo ir pro ralo na regeração

A limitação do item 2 é justamente o motivo de existir esse jeito chato de trabalhar

Se a edição pode vazar pra fora da área selecionada, empilhar dez pedidos cegos é a receita perfeita pra degradação

Um turno, uma mudança, uma conferida

E quando a coisa começar a acumular artefato mesmo assim, reset: nova conversa, melhor saída anterior como ponto de partida

O que muda para quem edita imagem todo dia (e para quem usa a API)

No ChatGPT, o ganho prático é que o refino fica menos destrutivo e a espera cai

Até 50% menos latência que o Images 2.0 parece detalhe técnico, mas muda o custo de tentar de novo

Quando cada tentativa demora, você tende a empilhar pedidos pra economizar rodada, e é exatamente esse hábito que quebra a consistência multi-turno

Geração mais rápida barateia a disciplina de um pedido por turno

Na API a história é outra

O Images 2.5 chega como dois modelos distintos, com identificadores próprios:

  • gpt-image-2.5-flare, com snapshot padrão gpt-image-2.5-flare-2026-09-08
  • **gpt-image-2.5-sunburst**, com snapshot padrão gpt-image-2.5-sunburst-2026-09-08

O Flare é o padrão, com as mesmas melhorias de qualidade, edição e velocidade

O Sunburst oferece um nível extra de precisão pra trabalho criativo detalhado, com tempo de geração maior

Clássico trade-off: precisão contra tempo

O preço por token é o mesmo pros dois:

Item Preço por milhão de tokens
Texto de entrada US$ 5
Texto de entrada em cache US$ 1,25
Imagem de entrada US$ 8
Imagem de entrada em cache US$ 2
Imagem de saída US$ 30

Tome cuidado com uma conta que anda circulando por aí

Essas são as taxas por token, e o consumo de tokens por imagem em cada nível de qualidade não foi publicado pela OpenAI

Então não dá pra afirmar que a imagem sai pelo mesmo custo de antes, nem que dobrou

Sem o dado, é achismo, e achismo em post técnico é zoado

Onde a consistência multi-turno faz diferença de verdade

Tem trabalho em que refino sequencial não é exceção, é a regra do dia

Foto de produto ajustada em rodadas. Você começa com a foto, ajusta a luz, ajusta o fundo, ajusta o ângulo do rótulo. São cinco, seis turnos no mínimo, e a preservação do sujeito é tudo. Se a embalagem muda de forma no meio do caminho, o trabalho foi pro lixo. Depois, quando a arte final vai pro site, o problema muda de casa e vira CSS, tipo alinhar texto depois da imagem, mas aí já é outro capítulo 🙂

Flyer que muda texto e cor sem refazer o layout. É o caso onde a edição de precisão brilha na promessa: mudar só o solicitado, mantendo composição e fundo. Ninguém quer reposicionar tudo de novo porque pediu pra trocar a cor de um botão

Personagem que precisa aparecer em novos cenários e estilos. Aqui entra a preservação de sujeitos vindos de fotos de referência, com traços distintivos tendo mais chance de se manter quando você transporta a pessoa pra outra composição

E tem dois recursos novos que ajudam de um jeito indireto, mas real: eles fazem você começar melhor, e quem começa melhor precisa de menos turnos depois

O Sketch deixa você desenhar dentro do ChatGPT pra usar o rascunho como referência da imagem final

A OpenAI cita exemplos como layout de um cômodo ou contorno de uma roupa

Pensa no ganho: em vez de gastar quatro turnos explicando por escrito onde vai o sofá, você rabisca onde vai o sofá

Os Templates vão na mesma linha, oferecendo pontos de partida prontos pra formatos como flyers e fotos de produto

É menos caminho a percorrer com pedido de correção, e menos correção significa menos chance de degradação

Esse raciocínio de "organiza a entrada pra não sofrer na saída" é o mesmo de organizar dezenas de notebooks no NotebookLM: a bagunça nunca aparece no dia 1, ela aparece no terceiro mês

ChatGPT Images 2.5 e Gemini 3 Pro Image: como cada um trata edição multi-turno

O concorrente direto do Google também coloca edição multi-turno e consistência de personagem como diferencial, então vale colocar lado a lado

Com uma ressalva grande, que eu explico logo abaixo da tabela

Aspecto ChatGPT Images 2.5 Gemini 3 Pro Image (Nano Banana Pro)
Edição multi-turno Consistência declarada pelo fornecedor ao longo de conversas mais longas, sem número público de turnos Suporte declarado a edição multi-turno complexa
Consistência de personagem Preservação melhor de sujeitos de fotos de referência, sem número publicado Consistência e semelhança de até 5 personagens
Entradas de referência Não localizado em fonte oficial Até 14 entradas de referência
Fidelidade de objetos Não publicado Até 14 objetos em um único fluxo de trabalho
Edição de precisão Muda só o solicitado, preservando sujeito, composição e fundo Não coberto pelos dados usados aqui
Velocidade Até 50% menos latência que o Images 2.0 Não coberto pelos dados usados aqui
Modelos na API Dois: gpt-image-2.5-flare e gpt-image-2.5-sunburst Não coberto pelos dados usados aqui

A ressalva: repare que a tabela é torta de propósito

O Google publica números de capacidade (5 personagens, 14 objetos, 14 entradas de referência) e a OpenAI descreve comportamento ("mais confiável", "sem degradar com o tempo")

São duas formas diferentes de comunicar a mesma ambição

Então isso aí é comparação de POSICIONAMENTO, não de benchmark

Quem quiser saber qual segura melhor dez turnos de refino no seu tipo de imagem vai ter que rodar os dois no próprio material, sem atalho

Instrução bem estruturada vale pra qualquer IA

O fio condutor deste post (dar contexto claro e não deixar a IA adivinhar) não é exclusivo de geração de imagem

Pra começar do zero nesse assunto de estruturar instruções pra IA não perder o fio da meada, este vídeo do canal mostra como um arquivo de instruções muda a conversa com o Claude Code:

Conclusão

A consistência multi-turno do ChatGPT Images 2.5 é uma melhoria bem-vinda e vem com promessa clara da OpenAI: cada edição se apoia no trabalho já feito, sem degradar a imagem ao longo de conversas mais longas

Só que a parte que depende de você continua valendo mais do que confiança cega no modelo

Um turno por mudança

Revisão antes do próximo pedido, usando Undo, Redo e Cancel quando a seleção sair torta

E reset da conversa quando os artefatos começarem a se acumular, retomando da melhor saída que você tinha

Próximo passo é simples: abre uma imagem no ChatGPT e faz o refino em turnos separados, comparando com o seu hábito antigo de empilhar cinco pedidos num prompt só

A diferença aparece rápido

E se o seu trabalho vive na API e exige precisão maior, vale colocar gpt-image-2.5-flare e gpt-image-2.5-sunburst frente a frente no mesmo briefing, lembrando que o Sunburst cobra isso em tempo de geração

Até o próximo post! 🙂

Perguntas frequentes

Quantas edições seguidas o ChatGPT Images 2.5 aguenta antes de perder a consistência?

A OpenAI não divulgou um número de turnos. Ela afirma que as mudanças anteriores tendem a permanecer consistentes ao longo de conversas mais longas, mas isso é uma melhoria declarada pelo fornecedor, sem métrica pública. Desconfie de qualquer texto que te der um número exato de edições suportadas.

Qual a diferença entre gpt-image-2.5-flare e gpt-image-2.5-sunburst na API?

Flare é o modelo padrão da API, com snapshot gpt-image-2.5-flare-2026-09-08, trazendo as mesmas melhorias de qualidade, edição e velocidade do Images 2.5. Sunburst (snapshot gpt-image-2.5-sunburst-2026-09-08) entrega um nível extra de precisão pra trabalho criativo detalhado, com tempo de geração maior. A escolha é velocidade contra precisão fina.

Quanto custa gerar imagem pela API do GPT-Image-2.5?

A tabela é a mesma pra Flare e pra Sunburst: US$ 5 por milhão de tokens de texto de entrada, US$ 1,25 por milhão em cache, US$ 8 por milhão de imagem de entrada, US$ 2 por milhão de imagem de entrada em cache e US$ 30 por milhão de imagem de saída. Não existe desconto de um modelo sobre o outro nesse ponto.

O Gemini 3 Pro Image (Nano Banana Pro) resolve a consistência multi-turno melhor que o ChatGPT Images 2.5?

O Nano Banana Pro também mira nesse problema: suporta edição multi-turno complexa e consistência de personagem usando até 14 entradas de referência. Ele mantém consistência de até 5 personagens e fidelidade de até 14 objetos num mesmo fluxo de trabalho. Não existe benchmark comparativo direto entre os dois aqui, então o certo é testar nos seus próprios casos de uso antes de bater o martelo.

Para que serve o Sketch do ChatGPT Images 2.5?

O Sketch deixa você desenhar dentro do ChatGPT e usar esse rascunho como referência pra geração final. A OpenAI cita como exemplo o layout de um cômodo ou o contorno de uma roupa. É um jeito de guiar a composição antes mesmo de escrever o prompt.

O ChatGPT Images 2.5 já está disponível em quais produtos?

Está liberado pra todos os usuários de ChatGPT, ChatGPT Work e Codex, tanto em desktop quanto mobile e web. Não é um recurso restrito a plano específico dentro dessa lista. Na API, o acesso é separado, via os modelos gpt-image-2.5-flare e gpt-image-2.5-sunburst.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares