GPT-6 Sol na empresa: vale começar por suporte, finanças ou RH?

O GPT-6 Sol chegou em 22 de setembro de 2026 prometendo workflows agênticos ponta a ponta, e a tentação é ligar tudo de uma vez em vendas, marketing, operações, suporte, finanças e RH. Só que os números do AutomationBench, benchmark da Zapier, mostram que os domínios não são igualmente fáceis: suporte e operações são os mais fortes do topo de linha da OpenAI, finanças tem custo de erro alto e RH é o domínio mais fraco de todos os modelos testados. Comece pelo suporte, com escopo estreito, critério de sucesso escrito e revisão humana em paralelo
Ligar IA em todo processo da empresa ao mesmo tempo é a forma mais rápida de não conseguir provar ganho em nenhum deles
A OpenAI anunciou o GPT-6 Sol em 22 de setembro de 2026, junto com o GPT-6 Luna, e o discurso oficial fala em workflows de negócio ponta a ponta cobrindo seis domínios: vendas, marketing, operações, suporte, finanças e RH
Aí bate a pergunta real, aquela que nenhum anúncio responde por você: por onde começar o piloto?
Bora destrinchar isso com critério em vez de achismo 🙂
O que o GPT-6 Sol entrega hoje (e onde ele está disponível):
O posicionamento oficial é de um modelo balanceado para coding complexo e workflows agênticos, treinado com métodos parecidos aos do GPT-6 Astra, o topo de linha da casa
Traduzindo pro seu dia a dia: não é o modelo de demonstração de benchmark, é o que a OpenAI quer que você rode em produção
A disponibilidade hoje funciona assim:
- Em ChatGPT Work e Codex para usuários Plus, Pro, Business, Enterprise e Edu
- Na API, com o identificador
gpt-6-sol - Free e Go ficam com o irmão menor, o
gpt-6-luna, no app desktop
Se a sua equipe vai tocar o piloto por dentro do produto e não por código, vale entender antes como o ChatGPT Work funciona na prática, porque o fluxo de aprovação muda bastante em relação a usar o chat solto
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
E o preço?
Na API o GPT-6 Sol sai a US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída
Isso é 50% menos que o GPT-5.6 Sol, que ficava em US$ 4 de entrada e US$ 20 de saída por milhão de tokens
Metade do preço do antecessor da mesma classe é o tipo de coisa que muda a conta de um piloto de processo repetitivo, onde o volume é justamente o ponto
Um detalhe que vai importar lá na frente: reasoning.effort
O parâmetro reasoning.effort aceita seis níveis: none, low, medium (padrão), high, xhigh e max
Guarde isso, porque todo número de benchmark que aparece daqui pra frente vem grudado num nível de esforço
Comparar score sem olhar o esforço usado é comparar banana com laranja…
O que o AutomationBench mostra sobre cada domínio:
Antes da tabela, preciso explicar o que é essa régua, senão o número não significa nada
O AutomationBench é um benchmark da Zapier, com leaderboard oficial em zapier.com/benchmarks rodando sobre um conjunto privado (held-out) por domínio
O conjunto público vive no repositório zapier/AutomationBench e tem 600 tarefas, 100 por domínio
São workflows ponta a ponta com 47 ferramentas nos seis domínios já citados
Como ele pontua uma tarefa?
Essa parte é o que dá credibilidade pro negócio: a avaliação é determinística
Ele compara o estado final do ambiente (registros atualizados, mensagens enviadas) com critérios fixos de sucesso
Sem LLM como juiz, sem "a resposta pareceu boa"
Ou o registro foi atualizado do jeito combinado, ou não foi
E os padrões de workflow não saíram da cabeça de ninguém: vieram de mais de 2 bilhões de tarefas por mês em 3,7 milhões de empresas na Zapier
Ou seja, é o tipo de tarefa chata que a sua empresa também faz
A leitura por domínio:
Um aviso antes da tabela: o número público do GPT-6 Sol é o score geral, não existe recorte por domínio dele
Então a leitura abaixo é a do benchmark na média dos modelos testados, que serve justamente pra dizer quais domínios são mais duros pra qualquer agente hoje
| Domínio | Dificuldade observada no benchmark | Custo de um output ruim | O que isso diz sobre o piloto |
|---|---|---|---|
| Suporte | Na média dos modelos testados, cerca de 60% dos objetivos cumpridos, a faixa mais alta do benchmark | Resposta estranha incomoda o cliente, mas é reversível | Melhor candidato a primeiro piloto |
| Operações | Mesma faixa do suporte na média dos modelos, cerca de 60% | Varia com o processo | Segundo candidato natural |
| Finanças | Agentes cumprem cerca de um terço dos objetivos, aproximadamente metade da taxa de suporte e operações | Alto: vira problema de relatório ou de compliance, segundo a Zapier | Só com revisão humana obrigatória |
| RH | Segundo a Zapier, o domínio mais fraco de todos os modelos testados | Dado sensível de pessoa | Fim da fila |
Um aviso importante pra você não se perder pesquisando: existe uma variante chamada AutomationBench-AA, operada pela Artificial Analysis, com números próprios (lá o GPT-6 Astra lidera com 69%)
Essa escala NÃO é comparável direto com o leaderboard da Zapier
Já me ferrei comparando tabela de fonte diferente, então fica o toque: escolha uma régua e fique nela
Três critérios para escolher o primeiro processo:
Ranking de benchmark é ponto de partida, não decisão
A decisão sai de três perguntas sobre a SUA operação
1. Volume: esse processo repete o bastante?
Se o processo acontece três vezes por mês, o ganho nunca vai aparecer no gráfico
Automação agêntica paga a conta em repetição, não em complexidade
Pergunta que você responde agora: quantas vezes por semana alguém do time executa esse fluxo do começo ao fim?
Se a resposta for "não sei", esse já é o primeiro problema a resolver
2. Tolerância a erro: o que acontece quando sair errado?
Repare que eu escrevi quando, não se
A própria Zapier coloca isso de forma direta: uma resposta estranha no suporte incomoda, um erro em finanças vira problema de relatório ou de compliance
Pergunta: se o agente errar essa tarefa e ninguém perceber por 24 horas, qual o estrago?
Se a resposta envolve dinheiro saindo, auditoria ou dado pessoal, não é o seu piloto número um
3. Documentação: quanto do processo já está escrito?
Esse é o critério que mais gente ignora e é o mais decisivo
Lembra da avaliação determinística do AutomationBench? Ele consegue pontuar porque existe um critério fixo de sucesso definido ANTES da execução
O seu piloto precisa da mesma coisa
Se o processo só existe na cabeça da Joana do financeiro, você não tem como dizer se o agente acertou
Pergunta: existe um documento que descreve as regras desse processo, incluindo as exceções?
Regra escrita vira critério de sucesso verificável
Regra na cabeça vira discussão
Suporte, finanças ou RH: onde cada um se encaixa:
Agora é só cruzar os três critérios com o que o benchmark mostra
Suporte: o piloto mais óbvio
Volume alto, quase sempre
Erro caro em imagem, mas reversível: dá pra pedir desculpa, reabrir o ticket e corrigir
E tem o detalhe que quase ninguém lembra: suporte normalmente já é o processo mais documentado da empresa, porque a base de conhecimento, os macros e os artigos de ajuda já existem
Somando a isso, suporte e operações são onde os modelos testados mais acertam no benchmark, perto de 60% dos objetivos na média
Bate nos três critérios de uma vez, massa demais
Finanças: volume tem, tolerância não
Finanças costuma ter volume de sobra (conciliação, cobrança, classificação de despesa)
O problema é o segundo critério
Na média dos modelos, os agentes cumprem cerca de um terço dos objetivos de finanças, aproximadamente metade da taxa de suporte e operações
Junte isso ao custo de um output ruim virar problema de relatório ou compliance e você tem a combinação mais perigosa possível: menor acerto justamente onde o erro dói mais
Não é "nunca faça"
É "faça depois, com humano revisando cada saída, e comece por uma tarefa de leitura em vez de uma tarefa de escrita"
RH: fim da fila, e não é por preconceito
Aqui o dado é bem direto: segundo a Zapier, RH é o domínio mais fraco de TODOS os modelos testados no AutomationBench
Soma com os dois problemas clássicos de RH na vida real: processo raramente documentado de ponta a ponta e dado sensível de pessoa no meio do caminho
Três critérios, três respostas ruins
Deixa pro terceiro ciclo
O que os números do benchmark significam para o seu piloto:
Agora a parte honesta, que o material de lançamento sempre embala bonito
O GPT-6 Sol marca 33,2% no AutomationBench 1.0.6 com esforço xhigh, a cerca de US$ 0,27 por tarefa
Pra dar contexto:
- GPT-5.6 Sol, o antecessor: 28,8%
- Claude Opus 5 em esforço
max: 26,9%, com custo por tarefa cerca de 11 vezes maior - Claude Opus 5.5, lançado no mesmo 22/09/2026: 40,0% (execução sem fallback, contando intervenção de salvaguarda como falha)
- GPT-6 Astra em esforço
max: 41,4%, com melhor desempenho em todos os domínios, e antes dele nenhum modelo tinha passado de 40%
Se liga no que esses números dizem juntos
O melhor modelo já registrado pela Zapier acerta pouco mais de 40% das tarefas ponta a ponta
O Sol fica em 33,2%, atrás desses dois
Ou seja: nenhum modelo acerta a maioria dos workflows completos hoje
Isso não significa que a ferramenta é ruim, significa que o desenho do piloto precisa ser outro
Escopo estreito (uma tarefa, não um processo inteiro), revisão humana no circuito e critério de sucesso verificável antes de rodar
A OpenAI também afirma que o modelo comete cerca de metade dos erros do antecessor em respostas factuais
É um ganho real de confiabilidade, mas metade dos erros ainda é uma quantidade de erros, e no piloto você quer saber exatamente quais foram
Se o caminho for via código, montar o fluxo com um agente rodando na Agents API te dá o log de cada passo, que é justamente o que você precisa pra auditar o resultado depois
Uma chamada mínima pra sentir o modelo, já fixando o esforço de raciocínio:
from openai import OpenAI
client = OpenAI()
resposta = client.responses.create(
model="gpt-6-sol",
reasoning={"effort": "high"},
input="Classifique este ticket e sugira a resposta seguindo a base de conhecimento anexa."
)
print(resposta.output_text)
Tome cuidado com um detalhe de conta: o padrão do reasoning.effort é medium
Os 33,2% citados foram em xhigh, que gasta mais token de raciocínio e, portanto, mexe no seu custo por tarefa
Não adianta comparar o seu resultado em medium com um número de benchmark feito em xhigh
Por onde começar na prática:
Recapitulando a ordem sugerida:
- Suporte primeiro: volume alto, erro reversível, base de conhecimento já escrita e é um dos domínios mais fortes segundo a leitura da Zapier
- Operações em seguida, pela mesma lógica de desempenho
- Finanças depois, com humano revisando tudo, porque acerto menor mais custo de erro maior é combinação ruim
- RH por último, o domínio mais fraco de todos os modelos testados
Mas presta atenção no que importa de verdade: o critério vale mais que o ranking
Se na SUA empresa o suporte é um caos não documentado e operações tem um fluxo escrito, com volume e com erro reversível, comece por operações
O benchmark descreve a média do mercado, não a sua casa
Próximo passo concreto, pra fazer ainda essa semana:
- Escolha um processo único e já documentado (um, não três)
- Escreva o critério de sucesso de forma verificável ANTES de ligar o modelo, no espírito da avaliação determinística: qual registro precisa estar atualizado, qual mensagem precisa ter sido enviada
- Rode em paralelo com o humano por um período, comparando saída do agente contra saída da pessoa, sem soltar o bicho sozinho
Quando a taxa de acerto no SEU processo estiver estável e você souber exatamente que tipo de erro o modelo comete, aí sim você tira a rodinha
E só então parte pro segundo domínio 😀
Até o próximo post!
Perguntas frequentes
GPT-6 Sol é melhor que o Claude Opus 5 em automação de negócio?
Nesse recorte específico, sim: no AutomationBench 1.0.6 da Zapier o GPT-6 Sol marcou 33,2% em esforço xhigh, contra 26,9% do Claude Opus 5 em esforço max, e a OpenAI aponta custo por tarefa cerca de 11 vezes maior no lado do Opus 5. Só que esse não é o quadro completo: o Claude Opus 5.5, lançado em 22/09/2026, marca 40,0% no mesmo benchmark. Ou seja, vantagem sobre o Opus 5 sim, liderança do leaderboard não.
Qual a diferença entre GPT-6 Sol e GPT-6 Luna?
Os dois foram anunciados juntos em 22 de setembro de 2026, mas a disponibilidade muda por plano. O GPT-6 Sol (identificador gpt-6-sol) está em ChatGPT Work, Codex e na API para Plus, Pro, Business, Enterprise e Edu. Já usuários Free e Go têm acesso apenas ao GPT-6 Luna (gpt-6-luna) no app desktop.
GPT-6 Sol está disponível no plano gratuito do ChatGPT?
Não. No plano Free, assim como no plano Go, o acesso é apenas ao GPT-6 Luna, o modelo menor da dupla, disponível no app desktop. O GPT-6 Sol fica restrito a ChatGPT Work, Codex e API para planos pagos como Plus, Pro, Business, Enterprise e Edu.
Quanto custa usar o GPT-6 Sol na API comparado ao modelo anterior?
O GPT-6 Sol sai a US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída na API. Isso representa 50% menos que o GPT-5.6 Sol, que cobrava US$ 4 de entrada e US$ 20 de saída por milhão de tokens.
GPT-6 Sol é confiável para automatizar processos de RH?
Segundo a Zapier, RH é o domínio mais fraco de todos os modelos testados no AutomationBench. Não existe recorte público por domínio do GPT-6 Sol, então o que dá pra afirmar é que RH é o terreno mais difícil para qualquer agente hoje, e por isso não é o melhor ponto de partida para um primeiro piloto sem supervisão pesada.
O AutomationBench-AA é a mesma coisa que o AutomationBench da Zapier?
Não. O AutomationBench-AA é operado pela Artificial Analysis e usa uma escala própria, onde o GPT-6 Astra aparece com 69%. Esse número não é comparável direto com o leaderboard oficial da Zapier, que mede os 33,2% do GPT-6 Sol e os 41,4% do GPT-6 Astra em esforço max.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como testar o GPT-6 Astra no seu projeto antes de migrar (passo a passo)
Testar o GPT-6 Astra antes de migrar: monte de 10 a 20 tarefas reais do seu produto, compare com seu modelo atual e veja nota, tokens e custo lado a lado.
Como migrar seu projeto para o GPT-6 Astra sem quebrar o que já funciona: checklist antes de trocar o modelo
Migrar para o GPT-6 Astra sem quebrar o que já funciona: checklist com baseline, rota por vez, parâmetros revisados e rollback pronto antes de trocar o modelo.
Por que o GPT-6 Astra corta a resposta no meio? O limite de 128 mil tokens de saída e como fatiar tarefas longas
O GPT-6 Astra lê até 1 milhão de tokens, mas o limite de tokens de saída é 128 mil por resposta. Veja por que ele corta e como fatiar tarefas longas.
