GPT-6 Sol na empresa: vale começar por suporte, finanças ou RH?

comparação de suporte, finanças e RH para implementar o GPT-6 Sol na empresa
Resposta rápida

O GPT-6 Sol chegou em 22 de setembro de 2026 prometendo workflows agênticos ponta a ponta, e a tentação é ligar tudo de uma vez em vendas, marketing, operações, suporte, finanças e RH. Só que os números do AutomationBench, benchmark da Zapier, mostram que os domínios não são igualmente fáceis: suporte e operações são os mais fortes do topo de linha da OpenAI, finanças tem custo de erro alto e RH é o domínio mais fraco de todos os modelos testados. Comece pelo suporte, com escopo estreito, critério de sucesso escrito e revisão humana em paralelo

Ligar IA em todo processo da empresa ao mesmo tempo é a forma mais rápida de não conseguir provar ganho em nenhum deles

A OpenAI anunciou o GPT-6 Sol em 22 de setembro de 2026, junto com o GPT-6 Luna, e o discurso oficial fala em workflows de negócio ponta a ponta cobrindo seis domínios: vendas, marketing, operações, suporte, finanças e RH

Aí bate a pergunta real, aquela que nenhum anúncio responde por você: por onde começar o piloto?

Bora destrinchar isso com critério em vez de achismo 🙂

O que o GPT-6 Sol entrega hoje (e onde ele está disponível):

O posicionamento oficial é de um modelo balanceado para coding complexo e workflows agênticos, treinado com métodos parecidos aos do GPT-6 Astra, o topo de linha da casa

Traduzindo pro seu dia a dia: não é o modelo de demonstração de benchmark, é o que a OpenAI quer que você rode em produção

A disponibilidade hoje funciona assim:

  • Em ChatGPT Work e Codex para usuários Plus, Pro, Business, Enterprise e Edu
  • Na API, com o identificador gpt-6-sol
  • Free e Go ficam com o irmão menor, o gpt-6-luna, no app desktop

Se a sua equipe vai tocar o piloto por dentro do produto e não por código, vale entender antes como o ChatGPT Work funciona na prática, porque o fluxo de aprovação muda bastante em relação a usar o chat solto

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

E o preço?

Na API o GPT-6 Sol sai a US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída

Isso é 50% menos que o GPT-5.6 Sol, que ficava em US$ 4 de entrada e US$ 20 de saída por milhão de tokens

Metade do preço do antecessor da mesma classe é o tipo de coisa que muda a conta de um piloto de processo repetitivo, onde o volume é justamente o ponto

Um detalhe que vai importar lá na frente: reasoning.effort

O parâmetro reasoning.effort aceita seis níveis: none, low, medium (padrão), high, xhigh e max

Guarde isso, porque todo número de benchmark que aparece daqui pra frente vem grudado num nível de esforço

Comparar score sem olhar o esforço usado é comparar banana com laranja…

O que o AutomationBench mostra sobre cada domínio:

Antes da tabela, preciso explicar o que é essa régua, senão o número não significa nada

O AutomationBench é um benchmark da Zapier, com leaderboard oficial em zapier.com/benchmarks rodando sobre um conjunto privado (held-out) por domínio

O conjunto público vive no repositório zapier/AutomationBench e tem 600 tarefas, 100 por domínio

São workflows ponta a ponta com 47 ferramentas nos seis domínios já citados

Como ele pontua uma tarefa?

Essa parte é o que dá credibilidade pro negócio: a avaliação é determinística

Ele compara o estado final do ambiente (registros atualizados, mensagens enviadas) com critérios fixos de sucesso

Sem LLM como juiz, sem "a resposta pareceu boa"

Ou o registro foi atualizado do jeito combinado, ou não foi

E os padrões de workflow não saíram da cabeça de ninguém: vieram de mais de 2 bilhões de tarefas por mês em 3,7 milhões de empresas na Zapier

Ou seja, é o tipo de tarefa chata que a sua empresa também faz

A leitura por domínio:

Um aviso antes da tabela: o número público do GPT-6 Sol é o score geral, não existe recorte por domínio dele

Então a leitura abaixo é a do benchmark na média dos modelos testados, que serve justamente pra dizer quais domínios são mais duros pra qualquer agente hoje

Domínio Dificuldade observada no benchmark Custo de um output ruim O que isso diz sobre o piloto
Suporte Na média dos modelos testados, cerca de 60% dos objetivos cumpridos, a faixa mais alta do benchmark Resposta estranha incomoda o cliente, mas é reversível Melhor candidato a primeiro piloto
Operações Mesma faixa do suporte na média dos modelos, cerca de 60% Varia com o processo Segundo candidato natural
Finanças Agentes cumprem cerca de um terço dos objetivos, aproximadamente metade da taxa de suporte e operações Alto: vira problema de relatório ou de compliance, segundo a Zapier Só com revisão humana obrigatória
RH Segundo a Zapier, o domínio mais fraco de todos os modelos testados Dado sensível de pessoa Fim da fila

Um aviso importante pra você não se perder pesquisando: existe uma variante chamada AutomationBench-AA, operada pela Artificial Analysis, com números próprios (lá o GPT-6 Astra lidera com 69%)

Essa escala NÃO é comparável direto com o leaderboard da Zapier

Já me ferrei comparando tabela de fonte diferente, então fica o toque: escolha uma régua e fique nela

Três critérios para escolher o primeiro processo:

Ranking de benchmark é ponto de partida, não decisão

A decisão sai de três perguntas sobre a SUA operação

1. Volume: esse processo repete o bastante?

Se o processo acontece três vezes por mês, o ganho nunca vai aparecer no gráfico

Automação agêntica paga a conta em repetição, não em complexidade

Pergunta que você responde agora: quantas vezes por semana alguém do time executa esse fluxo do começo ao fim?

Se a resposta for "não sei", esse já é o primeiro problema a resolver

2. Tolerância a erro: o que acontece quando sair errado?

Repare que eu escrevi quando, não se

A própria Zapier coloca isso de forma direta: uma resposta estranha no suporte incomoda, um erro em finanças vira problema de relatório ou de compliance

Pergunta: se o agente errar essa tarefa e ninguém perceber por 24 horas, qual o estrago?

Se a resposta envolve dinheiro saindo, auditoria ou dado pessoal, não é o seu piloto número um

3. Documentação: quanto do processo já está escrito?

Esse é o critério que mais gente ignora e é o mais decisivo

Lembra da avaliação determinística do AutomationBench? Ele consegue pontuar porque existe um critério fixo de sucesso definido ANTES da execução

O seu piloto precisa da mesma coisa

Se o processo só existe na cabeça da Joana do financeiro, você não tem como dizer se o agente acertou

Pergunta: existe um documento que descreve as regras desse processo, incluindo as exceções?

Regra escrita vira critério de sucesso verificável

Regra na cabeça vira discussão

Suporte, finanças ou RH: onde cada um se encaixa:

Agora é só cruzar os três critérios com o que o benchmark mostra

Suporte: o piloto mais óbvio

Volume alto, quase sempre

Erro caro em imagem, mas reversível: dá pra pedir desculpa, reabrir o ticket e corrigir

E tem o detalhe que quase ninguém lembra: suporte normalmente já é o processo mais documentado da empresa, porque a base de conhecimento, os macros e os artigos de ajuda já existem

Somando a isso, suporte e operações são onde os modelos testados mais acertam no benchmark, perto de 60% dos objetivos na média

Bate nos três critérios de uma vez, massa demais

Finanças: volume tem, tolerância não

Finanças costuma ter volume de sobra (conciliação, cobrança, classificação de despesa)

O problema é o segundo critério

Na média dos modelos, os agentes cumprem cerca de um terço dos objetivos de finanças, aproximadamente metade da taxa de suporte e operações

Junte isso ao custo de um output ruim virar problema de relatório ou compliance e você tem a combinação mais perigosa possível: menor acerto justamente onde o erro dói mais

Não é "nunca faça"

É "faça depois, com humano revisando cada saída, e comece por uma tarefa de leitura em vez de uma tarefa de escrita"

RH: fim da fila, e não é por preconceito

Aqui o dado é bem direto: segundo a Zapier, RH é o domínio mais fraco de TODOS os modelos testados no AutomationBench

Soma com os dois problemas clássicos de RH na vida real: processo raramente documentado de ponta a ponta e dado sensível de pessoa no meio do caminho

Três critérios, três respostas ruins

Deixa pro terceiro ciclo

O que os números do benchmark significam para o seu piloto:

Agora a parte honesta, que o material de lançamento sempre embala bonito

O GPT-6 Sol marca 33,2% no AutomationBench 1.0.6 com esforço xhigh, a cerca de US$ 0,27 por tarefa

Pra dar contexto:

  • GPT-5.6 Sol, o antecessor: 28,8%
  • Claude Opus 5 em esforço max: 26,9%, com custo por tarefa cerca de 11 vezes maior
  • Claude Opus 5.5, lançado no mesmo 22/09/2026: 40,0% (execução sem fallback, contando intervenção de salvaguarda como falha)
  • GPT-6 Astra em esforço max: 41,4%, com melhor desempenho em todos os domínios, e antes dele nenhum modelo tinha passado de 40%

Se liga no que esses números dizem juntos

O melhor modelo já registrado pela Zapier acerta pouco mais de 40% das tarefas ponta a ponta

O Sol fica em 33,2%, atrás desses dois

Ou seja: nenhum modelo acerta a maioria dos workflows completos hoje

Isso não significa que a ferramenta é ruim, significa que o desenho do piloto precisa ser outro

Escopo estreito (uma tarefa, não um processo inteiro), revisão humana no circuito e critério de sucesso verificável antes de rodar

A OpenAI também afirma que o modelo comete cerca de metade dos erros do antecessor em respostas factuais

É um ganho real de confiabilidade, mas metade dos erros ainda é uma quantidade de erros, e no piloto você quer saber exatamente quais foram

Se o caminho for via código, montar o fluxo com um agente rodando na Agents API te dá o log de cada passo, que é justamente o que você precisa pra auditar o resultado depois

Uma chamada mínima pra sentir o modelo, já fixando o esforço de raciocínio:

from openai import OpenAI

client = OpenAI()

resposta = client.responses.create(
    model="gpt-6-sol",
    reasoning={"effort": "high"},
    input="Classifique este ticket e sugira a resposta seguindo a base de conhecimento anexa."
)

print(resposta.output_text)

Tome cuidado com um detalhe de conta: o padrão do reasoning.effort é medium

Os 33,2% citados foram em xhigh, que gasta mais token de raciocínio e, portanto, mexe no seu custo por tarefa

Não adianta comparar o seu resultado em medium com um número de benchmark feito em xhigh

Por onde começar na prática:

Recapitulando a ordem sugerida:

  1. Suporte primeiro: volume alto, erro reversível, base de conhecimento já escrita e é um dos domínios mais fortes segundo a leitura da Zapier
  2. Operações em seguida, pela mesma lógica de desempenho
  3. Finanças depois, com humano revisando tudo, porque acerto menor mais custo de erro maior é combinação ruim
  4. RH por último, o domínio mais fraco de todos os modelos testados

Mas presta atenção no que importa de verdade: o critério vale mais que o ranking

Se na SUA empresa o suporte é um caos não documentado e operações tem um fluxo escrito, com volume e com erro reversível, comece por operações

O benchmark descreve a média do mercado, não a sua casa

Próximo passo concreto, pra fazer ainda essa semana:

  • Escolha um processo único e já documentado (um, não três)
  • Escreva o critério de sucesso de forma verificável ANTES de ligar o modelo, no espírito da avaliação determinística: qual registro precisa estar atualizado, qual mensagem precisa ter sido enviada
  • Rode em paralelo com o humano por um período, comparando saída do agente contra saída da pessoa, sem soltar o bicho sozinho

Quando a taxa de acerto no SEU processo estiver estável e você souber exatamente que tipo de erro o modelo comete, aí sim você tira a rodinha

E só então parte pro segundo domínio 😀

Até o próximo post!

Perguntas frequentes

GPT-6 Sol é melhor que o Claude Opus 5 em automação de negócio?

Nesse recorte específico, sim: no AutomationBench 1.0.6 da Zapier o GPT-6 Sol marcou 33,2% em esforço xhigh, contra 26,9% do Claude Opus 5 em esforço max, e a OpenAI aponta custo por tarefa cerca de 11 vezes maior no lado do Opus 5. Só que esse não é o quadro completo: o Claude Opus 5.5, lançado em 22/09/2026, marca 40,0% no mesmo benchmark. Ou seja, vantagem sobre o Opus 5 sim, liderança do leaderboard não.

Qual a diferença entre GPT-6 Sol e GPT-6 Luna?

Os dois foram anunciados juntos em 22 de setembro de 2026, mas a disponibilidade muda por plano. O GPT-6 Sol (identificador gpt-6-sol) está em ChatGPT Work, Codex e na API para Plus, Pro, Business, Enterprise e Edu. Já usuários Free e Go têm acesso apenas ao GPT-6 Luna (gpt-6-luna) no app desktop.

GPT-6 Sol está disponível no plano gratuito do ChatGPT?

Não. No plano Free, assim como no plano Go, o acesso é apenas ao GPT-6 Luna, o modelo menor da dupla, disponível no app desktop. O GPT-6 Sol fica restrito a ChatGPT Work, Codex e API para planos pagos como Plus, Pro, Business, Enterprise e Edu.

Quanto custa usar o GPT-6 Sol na API comparado ao modelo anterior?

O GPT-6 Sol sai a US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída na API. Isso representa 50% menos que o GPT-5.6 Sol, que cobrava US$ 4 de entrada e US$ 20 de saída por milhão de tokens.

GPT-6 Sol é confiável para automatizar processos de RH?

Segundo a Zapier, RH é o domínio mais fraco de todos os modelos testados no AutomationBench. Não existe recorte público por domínio do GPT-6 Sol, então o que dá pra afirmar é que RH é o terreno mais difícil para qualquer agente hoje, e por isso não é o melhor ponto de partida para um primeiro piloto sem supervisão pesada.

O AutomationBench-AA é a mesma coisa que o AutomationBench da Zapier?

Não. O AutomationBench-AA é operado pela Artificial Analysis e usa uma escala própria, onde o GPT-6 Astra aparece com 69%. Esse número não é comparável direto com o leaderboard oficial da Zapier, que mede os 33,2% do GPT-6 Sol e os 41,4% do GPT-6 Astra em esforço max.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares