Fugu Ultra v2 e Fugu Max: o que muda na pesquisa autônoma e no raciocínio de múltiplas etapas?

Fugu Ultra v2 e Fugu Max, modelos de pesquisa autônoma da Sakana AI
Resposta rápida

O Fugu Ultra v2 é a variante de maior capacidade da dupla que a Sakana AI anunciou em setembro de 2026, ao lado do Fugu Max, que persegue o menor custo. As duas são a mesma arquitetura de orquestração multiagente: um modelo treinado pra rotear tarefas pra um pool de modelos e chamar instâncias de si mesmo recursivamente. O Ultra v2 sai por US$ 5 de entrada e US$ 30 de saída por milhão de tokens, tem 1 milhão de tokens de contexto e marcou 48,3 no Chartography. Só que todo score divulgado é autorreportado pela própria Sakana, sem reprodução independente

A Sakana AI lançou duas variantes da família Fugu no mesmo anúncio, e elas foram ajustadas pra brigar por coisas opostas: uma quer o melhor resultado possível pelo menor custo, a outra quer a maior capacidade possível em tarefas complexas de múltiplas etapas

Fala aí, beleza? O anúncio se chama "Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier", com cobertura da imprensa técnica datada de 10/09/2026

O recorte deste post é um só: pesquisa autônoma e raciocínio de múltiplas etapas, que é exatamente o terreno onde a variante de alta capacidade foi desenhada pra jogar

O que a Sakana AI anunciou e por que agora

A linha original não é de ontem: Fugu e Fugu Ultra foram lançados em 22/06/2026

O Fugu Ultra v2 é um refresh da MESMA arquitetura, cerca de onze semanas depois

E aqui vale parar pra explicar o que o Fugu é de verdade, porque isso muda a leitura de tudo que vem depois

Que arquitetura é essa? O Fugu é um modelo de linguagem treinado pra rotear tarefas pra um pool de modelos e pra chamar instâncias de si mesmo recursivamente

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 116 aulas
  • 4 projetos
  • 9h 23min

Ou seja: um sistema de orquestração multiagente aprendido, onde a chamada recursiva funciona como forma de escalar computação em tempo de execução

Se você já usou um orquestrador de tarefas, a analogia é próxima: em vez de um modelo tentar resolver tudo numa tacada, ele quebra, distribui, chama de novo, junta

E é justamente essa recursão que sustenta fluxo longo

Pesquisa autônoma não é uma pergunta com uma resposta, é uma corrente de dezenas de decisões pequenas onde cada erro contamina o passo seguinte

Um modelo que consegue gastar mais computação DURANTE a execução é outra categoria de bicho pra esse tipo de missão

Fugu Max ou Fugu Ultra v2: qual variante serve para qual missão?

As duas variantes saem da mesma arquitetura de orquestração multiagente, o que muda é o alvo

Segue o que dá pra afirmar com os dados publicados:

Item Fugu Max Fugu Ultra v2
Missão Melhor resultado possível pelo menor custo Maior capacidade possível em tarefas complexas de múltiplas etapas
Entrada por milhão de tokens US$ 2 US$ 5
Saída por milhão de tokens US$ 6 US$ 30
Entrada em cache por milhão de tokens Não divulgado nos dados confirmados US$ 0,50
Acima de 272 mil tokens de contexto Não divulgado nos dados confirmados US$ 10 de entrada, US$ 45 de saída e US$ 1,00 em cache
Janela de contexto Não divulgado nos dados confirmados 1.000.000 de tokens
Limite de saída Não divulgado nos dados confirmados Até 128.000 tokens de conclusão
Entradas aceitas Não divulgado nos dados confirmados Texto, imagens e arquivos como PDF, devolvendo texto
Recursos Não divulgado nos dados confirmados Function calling, structured outputs via JSON schema e busca web embutida
Busca web embutida no OpenRouter Não divulgado nos dados confirmados US$ 10 por mil chamadas
Cobertura na avaliação da Sakana Melhor score geral em seis benchmarks: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish Melhor ou empatado em melhor em cinco de oito (GDP.pdf, Chartography, SWEFish, DeepSWE e Toolathon) e entre os dois primeiros em sete de oito

Antes que apareça a pergunta: as linhas com "não divulgado" não são desleixo, é que os dados de contexto, cache e limite de saída eu só consegui confirmar na página do modelo no OpenRouter

E por que GDP.pdf e SWEFish aparecem nas DUAS colunas? Porque a contagem da variante de alta capacidade é de "melhor OU empatado em melhor"

Ou seja: empate nesses dois já explica a sobreposição, sem nenhuma das duas linhas se contradizer

Tome cuidado com outra conta também: os nomes citados nas duas colunas somam nove benchmarks distintos, enquanto as frações falam em um total de oito

O que está publicado é a fração sobre oito só na cobertura da variante de alta capacidade, e pro Max uma contagem de benchmarks liderados, sem o conjunto declarado

Então não dá pra afirmar que é exatamente o mesmo conjunto de oito pras duas variantes, e eu prefiro dizer isso a inventar uma tabela redondinha

Lendo a tabela com olho de quem faz pesquisa autônoma: a saída do Ultra v2 custa cinco vezes a do Max

E pesquisa longa é um fluxo que gera MUITO token de saída, porque cada etapa intermediária é texto gerado

Então a conta não é "qual é mais caro", é "em qual tarefa o resultado melhor paga a diferença"

Pesquisa autônoma e raciocínio de múltiplas etapas: onde o Ultra v2 faz diferença

Esse é o coração do lançamento, então bora por partes

Missão agêntica longa, de ponta a ponta:

A linha Ultra é avaliada em tarefas ponta a ponta de comportamento agêntico longo: pesquisa de longo horizonte, síntese de programas, otimização e geração de CAD

A prioridade declarada da linha é extrair a capacidade máxima de um time de agentes quando a qualidade da resposta vem antes do custo

Quando escolher o Max no lugar? Quando a tarefa é curta, repetitiva e roda em volume, tipo classificar, resumir ou extrair campo de um lote de documentos

Raciocínio sobre dados visuais e estruturados:

Aqui está o número mais chamativo do anúncio

No Chartography, benchmark de raciocínio visual e interpretação de dados, o Fugu Ultra v2 marcou 48,3, contra 27,3 do Claude Opus 5 e 29,5 do Claude Fable 5

Esses números são reportados pela própria Sakana AI, guarde isso pra seção do veredito

Se o seu fluxo é ler gráfico, cruzar tabela e sustentar uma conclusão em cima disso, é esse tipo de tarefa que a variante de maior capacidade está mirando

Se é só OCR de um campo fixo, o Max resolve por uma fração do preço

Trabalho de engenharia:

No DeepSWE a variante de alta capacidade marcou 74,3, também autorreportado

Refatoração grande, bug que atravessa vários arquivos, migração: esse é o perfil de tarefa onde a recursão de agentes tem espaço pra trabalhar

Pra tarefa de dev pequena e bem delimitada, o Max aparece com melhor score geral no SWEFish, e o Ultra v2 aparece nesse mesmo benchmark na lista de melhor ou empatado em melhor

Ou seja: ali a diferença não está declarada como vantagem clara de um lado, então não precisa apelar pra variante mais cara sempre

Leitura de PDF e gráfico na mesma corrente:

O Ultra v2 aceita texto, imagens e arquivos como PDF, e devolve texto

Isso importa MUITO pra pesquisa autônoma, porque a fonte da vida real raramente vem em texto limpo: vem em relatório, anexo e print

Com function calling e structured outputs via JSON schema, dá pra amarrar a saída num formato fixo em vez de ficar parseando texto solto na mão

Busca web embutida como perna de pesquisa:

O modelo tem busca web embutida, e no OpenRouter ela é cobrada à parte: US$ 10 por mil chamadas de busca

Parece pouco, só que num agente de pesquisa longo a contagem de chamadas sobe rápido

Tome cuidado! Vale colocar um limite de chamadas por execução antes de soltar o agente pra rodar sozinho a noite inteira

Como usar o Fugu na prática: IDs de modelo, API e Claude Code

Parte operacional, só com o que dá pra confirmar

IDs disponíveis no console da Sakana:

  • fugu-max
  • fugu
  • fugu-ultra (é por esse ID que o Fugu Ultra v2.0 responde)
  • fugu-ultra-v1.0
  • fugu-ultra-v1.1
  • fugu-cyber

Níveis de reasoning effort aceitos:

  • fugu-max, fugu-ultra (v2.0), fugu, fugu-ultra-v1.0 e fugu-cyber aceitam high e xhigh
  • nesses, max é aceito por compatibilidade e mapeia pra xhigh
  • fugu-ultra-v1.1 aceita high, xhigh e max de verdade

Olha esse detalhe com carinho, porque é o tipo de coisa que passa batido: você manda max, o job roda, ninguém reclama, e o esforço aplicado foi xhigh

Sobre as APIs: o Fugu suporta as APIs compatíveis com OpenAI (Chat Completions, Responses e Models) e a API Messages compatível com Anthropic

Na prática, é um baita atalho: o cliente que você já tem escrito provavelmente já fala uma dessas

Passo a passo pra apontar o Claude Code pro Fugu:

  1. Crie a chave no console da Sakana. O erro comum deste passo: a chave é exibida uma única vez, então se você fechar a aba sem salvar, vai ter que gerar outra
  1. Exporte as variáveis de ambiente apontando pro endpoint da Sakana:
export ANTHROPIC_BASE_URL="<endpoint da Sakana>"
export ANTHROPIC_AUTH_TOKEN="<sua chave do console>"
  1. Use ANTHROPIC_AUTH_TOKEN, que é bearer token, e NÃO ANTHROPIC_API_KEY. O erro comum deste passo é exatamente esse: trocar a variável e ficar tomando falha de autenticação sem entender o motivo
  1. Rode o Claude Code normal, sem launcher obrigatório:
claude
  1. Não se assuste com os rótulos: as requisições são cobradas pela Sakana e não consomem assinatura da Anthropic, mas o seletor de modelo e o slider de esforço do Claude Code continuam mostrando rótulos da Anthropic, e a própria Sakana descreve esses rótulos como cosméticos

E os planos? No console da Sakana tem Standard a US$ 20/mês, Pro a US$ 100/mês (10x o uso do Standard) e Max a US$ 200/mês (20x o uso do Standard), além de um pay-as-you-go por consumo de tokens

Vale confiar nos números? O que ainda não dá para afirmar

Agora a parte que quase ninguém escreve no dia do lançamento

Todos os scores de benchmark divulgados são autorreportados pelo fornecedor

Nenhum deles foi reproduzido de forma independente, e não existe página de avaliação de modelos Fugu no Artificial Analysis até 11/09/2026

Isso não quer dizer que os números são falsos, quer dizer que eles ainda não passaram pelo teste de alguém sem interesse no resultado

E tem o outro lado da moeda: velocidade

Relatos de terceiros e reviews apontam que o Fugu Ultra roda mais lento que o Fugu padrão, com esperas longas em tarefas complexas

Um teste público chegou a relatar espera de 25 minutos

Pra pesquisa autônoma rodando em background isso é detalhe, você manda e vai fazer outra coisa

Pra fluxo interativo, onde você fica olhando o cursor piscar, é outra história

Resumo honesto: o Ultra v2 faz sentido hoje pra quem tem missão longa, raciocínio visual pesado e tolerância a espera

Pra o resto (volume, tarefa curta, orçamento apertado), o Max já resolve e custa bem menos

Pra quem quer começar do zero com fluxos de múltiplas etapas no front-end, este vídeo do canal mostra como montar um formulário multistep com React.js, passo a passo

O próximo passo

A régua ficou bem desenhada nesse lançamento: Fugu Max pra volume e custo, Fugu Ultra v2 pra missão longa e raciocínio visual pesado

E o próximo passo é concreto, não é filosofia:

  1. Crie a chave no console da Sakana e salve ela na hora
  2. Escolha o ID de modelo pela missão, não pelo hype: fugu-max ou fugu-ultra
  3. Pegue uma tarefa de pesquisa longa que você JÁ faz hoje e rode ela nas duas variantes
  4. Compare com o que você usa atualmente, olhando custo, tempo e qualidade da resposta final

E lembra: os benchmarks continuam autorreportados, então o único número que vale de verdade pro seu caso é o que sair do seu próprio fluxo 🙂

até o próximo post!

Perguntas frequentes

Como aponto o Claude Code para usar o Fugu Ultra v2?

Basta exportar as variáveis de ambiente ANTHROPIC_BASE_URL e ANTHROPIC_AUTH_TOKEN, essa última sendo o bearer token gerado no console da Sakana, e não o ANTHROPIC_API_KEY. Depois disso é só rodar o claude normalmente, sem precisar de nenhum launcher extra.

Usar o Fugu Ultra v2 dentro do Claude Code consome a minha assinatura da Anthropic?

Não. As requisições feitas por essa rota são cobradas pela Sakana, e o seletor de modelo e o slider de esforço do Claude Code continuam mostrando rótulos da Anthropic. A própria Sakana descreve esses rótulos como cosméticos.

O Fugu Max e o Fugu Ultra v2 podem ser os melhores no mesmo benchmark?

Os dois aparecem em GDP.pdf e SWEFish porque a cobertura da variante Ultra v2 é contada como melhor ou empatado em melhor, então empate explica a sobreposição. Vale notar que os nomes citados nas duas listas somam nove benchmarks distintos, enquanto as frações publicadas para o Ultra v2 falam em um total de oito, sem o conjunto do Fugu Max estar declarado.

O Fugu Ultra v2 é mais lento que o Fugu padrão em tarefas complexas?

Sim, relatos de terceiros apontam que ele troca velocidade por qualidade justamente nas tarefas mais difíceis. Um teste público chegou a relatar espera de 25 minutos numa tarefa complexa.

Os benchmarks divulgados do Fugu Ultra v2 foram confirmados de forma independente?

Não. Todos os números, incluindo o 48,3 no Chartography e o 74,3 no DeepSWE, são autorreportados pela própria Sakana AI. Até 11/09/2026 não existe página de avaliação dos modelos Fugu no Artificial Analysis.

Qual o limite de contexto e de resposta do Fugu Ultra v2?

A janela de contexto vai até 1.000.000 de tokens, com limite de saída de até 128.000 tokens de conclusão. Acima de 272 mil tokens de contexto o preço por milhão de tokens sobe, então vale ficar de olho no tamanho do prompt em tarefas longas.

Quanto custa assinar o Fugu pelo console da Sakana?

O plano Standard sai por US$ 20 por mês, o Pro por US$ 100 (10x o uso do Standard) e o Max por US$ 200 (20x o uso do Standard). Também existe um plano pay-as-you-go cobrado por consumo de tokens, separado do preço por milhão de tokens do modelo.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares