Fugu Ultra v2 e Fugu Max: o que muda na pesquisa autônoma e no raciocínio de múltiplas etapas?

O Fugu Ultra v2 é a variante de maior capacidade da dupla que a Sakana AI anunciou em setembro de 2026, ao lado do Fugu Max, que persegue o menor custo. As duas são a mesma arquitetura de orquestração multiagente: um modelo treinado pra rotear tarefas pra um pool de modelos e chamar instâncias de si mesmo recursivamente. O Ultra v2 sai por US$ 5 de entrada e US$ 30 de saída por milhão de tokens, tem 1 milhão de tokens de contexto e marcou 48,3 no Chartography. Só que todo score divulgado é autorreportado pela própria Sakana, sem reprodução independente
A Sakana AI lançou duas variantes da família Fugu no mesmo anúncio, e elas foram ajustadas pra brigar por coisas opostas: uma quer o melhor resultado possível pelo menor custo, a outra quer a maior capacidade possível em tarefas complexas de múltiplas etapas
Fala aí, beleza? O anúncio se chama "Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier", com cobertura da imprensa técnica datada de 10/09/2026
O recorte deste post é um só: pesquisa autônoma e raciocínio de múltiplas etapas, que é exatamente o terreno onde a variante de alta capacidade foi desenhada pra jogar
O que a Sakana AI anunciou e por que agora
A linha original não é de ontem: Fugu e Fugu Ultra foram lançados em 22/06/2026
O Fugu Ultra v2 é um refresh da MESMA arquitetura, cerca de onze semanas depois
E aqui vale parar pra explicar o que o Fugu é de verdade, porque isso muda a leitura de tudo que vem depois
Que arquitetura é essa? O Fugu é um modelo de linguagem treinado pra rotear tarefas pra um pool de modelos e pra chamar instâncias de si mesmo recursivamente
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 116 aulas
- 4 projetos
- 9h 23min
Ou seja: um sistema de orquestração multiagente aprendido, onde a chamada recursiva funciona como forma de escalar computação em tempo de execução
Se você já usou um orquestrador de tarefas, a analogia é próxima: em vez de um modelo tentar resolver tudo numa tacada, ele quebra, distribui, chama de novo, junta
E é justamente essa recursão que sustenta fluxo longo
Pesquisa autônoma não é uma pergunta com uma resposta, é uma corrente de dezenas de decisões pequenas onde cada erro contamina o passo seguinte
Um modelo que consegue gastar mais computação DURANTE a execução é outra categoria de bicho pra esse tipo de missão
Fugu Max ou Fugu Ultra v2: qual variante serve para qual missão?
As duas variantes saem da mesma arquitetura de orquestração multiagente, o que muda é o alvo
Segue o que dá pra afirmar com os dados publicados:
| Item | Fugu Max | Fugu Ultra v2 |
|---|---|---|
| Missão | Melhor resultado possível pelo menor custo | Maior capacidade possível em tarefas complexas de múltiplas etapas |
| Entrada por milhão de tokens | US$ 2 | US$ 5 |
| Saída por milhão de tokens | US$ 6 | US$ 30 |
| Entrada em cache por milhão de tokens | Não divulgado nos dados confirmados | US$ 0,50 |
| Acima de 272 mil tokens de contexto | Não divulgado nos dados confirmados | US$ 10 de entrada, US$ 45 de saída e US$ 1,00 em cache |
| Janela de contexto | Não divulgado nos dados confirmados | 1.000.000 de tokens |
| Limite de saída | Não divulgado nos dados confirmados | Até 128.000 tokens de conclusão |
| Entradas aceitas | Não divulgado nos dados confirmados | Texto, imagens e arquivos como PDF, devolvendo texto |
| Recursos | Não divulgado nos dados confirmados | Function calling, structured outputs via JSON schema e busca web embutida |
| Busca web embutida no OpenRouter | Não divulgado nos dados confirmados | US$ 10 por mil chamadas |
| Cobertura na avaliação da Sakana | Melhor score geral em seis benchmarks: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish | Melhor ou empatado em melhor em cinco de oito (GDP.pdf, Chartography, SWEFish, DeepSWE e Toolathon) e entre os dois primeiros em sete de oito |
Antes que apareça a pergunta: as linhas com "não divulgado" não são desleixo, é que os dados de contexto, cache e limite de saída eu só consegui confirmar na página do modelo no OpenRouter
E por que GDP.pdf e SWEFish aparecem nas DUAS colunas? Porque a contagem da variante de alta capacidade é de "melhor OU empatado em melhor"
Ou seja: empate nesses dois já explica a sobreposição, sem nenhuma das duas linhas se contradizer
Tome cuidado com outra conta também: os nomes citados nas duas colunas somam nove benchmarks distintos, enquanto as frações falam em um total de oito
O que está publicado é a fração sobre oito só na cobertura da variante de alta capacidade, e pro Max uma contagem de benchmarks liderados, sem o conjunto declarado
Então não dá pra afirmar que é exatamente o mesmo conjunto de oito pras duas variantes, e eu prefiro dizer isso a inventar uma tabela redondinha
Lendo a tabela com olho de quem faz pesquisa autônoma: a saída do Ultra v2 custa cinco vezes a do Max
E pesquisa longa é um fluxo que gera MUITO token de saída, porque cada etapa intermediária é texto gerado
Então a conta não é "qual é mais caro", é "em qual tarefa o resultado melhor paga a diferença"
Pesquisa autônoma e raciocínio de múltiplas etapas: onde o Ultra v2 faz diferença
Esse é o coração do lançamento, então bora por partes
Missão agêntica longa, de ponta a ponta:
A linha Ultra é avaliada em tarefas ponta a ponta de comportamento agêntico longo: pesquisa de longo horizonte, síntese de programas, otimização e geração de CAD
A prioridade declarada da linha é extrair a capacidade máxima de um time de agentes quando a qualidade da resposta vem antes do custo
Quando escolher o Max no lugar? Quando a tarefa é curta, repetitiva e roda em volume, tipo classificar, resumir ou extrair campo de um lote de documentos
Raciocínio sobre dados visuais e estruturados:
Aqui está o número mais chamativo do anúncio
No Chartography, benchmark de raciocínio visual e interpretação de dados, o Fugu Ultra v2 marcou 48,3, contra 27,3 do Claude Opus 5 e 29,5 do Claude Fable 5
Esses números são reportados pela própria Sakana AI, guarde isso pra seção do veredito
Se o seu fluxo é ler gráfico, cruzar tabela e sustentar uma conclusão em cima disso, é esse tipo de tarefa que a variante de maior capacidade está mirando
Se é só OCR de um campo fixo, o Max resolve por uma fração do preço
Trabalho de engenharia:
No DeepSWE a variante de alta capacidade marcou 74,3, também autorreportado
Refatoração grande, bug que atravessa vários arquivos, migração: esse é o perfil de tarefa onde a recursão de agentes tem espaço pra trabalhar
Pra tarefa de dev pequena e bem delimitada, o Max aparece com melhor score geral no SWEFish, e o Ultra v2 aparece nesse mesmo benchmark na lista de melhor ou empatado em melhor
Ou seja: ali a diferença não está declarada como vantagem clara de um lado, então não precisa apelar pra variante mais cara sempre
Leitura de PDF e gráfico na mesma corrente:
O Ultra v2 aceita texto, imagens e arquivos como PDF, e devolve texto
Isso importa MUITO pra pesquisa autônoma, porque a fonte da vida real raramente vem em texto limpo: vem em relatório, anexo e print
Com function calling e structured outputs via JSON schema, dá pra amarrar a saída num formato fixo em vez de ficar parseando texto solto na mão
Busca web embutida como perna de pesquisa:
O modelo tem busca web embutida, e no OpenRouter ela é cobrada à parte: US$ 10 por mil chamadas de busca
Parece pouco, só que num agente de pesquisa longo a contagem de chamadas sobe rápido
Tome cuidado! Vale colocar um limite de chamadas por execução antes de soltar o agente pra rodar sozinho a noite inteira
Como usar o Fugu na prática: IDs de modelo, API e Claude Code
Parte operacional, só com o que dá pra confirmar
IDs disponíveis no console da Sakana:
fugu-maxfugufugu-ultra(é por esse ID que o Fugu Ultra v2.0 responde)fugu-ultra-v1.0fugu-ultra-v1.1fugu-cyber
Níveis de reasoning effort aceitos:
fugu-max,fugu-ultra(v2.0),fugu,fugu-ultra-v1.0efugu-cyberaceitamhighexhigh- nesses,
maxé aceito por compatibilidade e mapeia praxhigh fugu-ultra-v1.1aceitahigh,xhighemaxde verdade
Olha esse detalhe com carinho, porque é o tipo de coisa que passa batido: você manda max, o job roda, ninguém reclama, e o esforço aplicado foi xhigh
Sobre as APIs: o Fugu suporta as APIs compatíveis com OpenAI (Chat Completions, Responses e Models) e a API Messages compatível com Anthropic
Na prática, é um baita atalho: o cliente que você já tem escrito provavelmente já fala uma dessas
Passo a passo pra apontar o Claude Code pro Fugu:
- Crie a chave no console da Sakana. O erro comum deste passo: a chave é exibida uma única vez, então se você fechar a aba sem salvar, vai ter que gerar outra
- Exporte as variáveis de ambiente apontando pro endpoint da Sakana:
export ANTHROPIC_BASE_URL="<endpoint da Sakana>"
export ANTHROPIC_AUTH_TOKEN="<sua chave do console>"
- Use
ANTHROPIC_AUTH_TOKEN, que é bearer token, e NÃOANTHROPIC_API_KEY. O erro comum deste passo é exatamente esse: trocar a variável e ficar tomando falha de autenticação sem entender o motivo
- Rode o Claude Code normal, sem launcher obrigatório:
claude
- Não se assuste com os rótulos: as requisições são cobradas pela Sakana e não consomem assinatura da Anthropic, mas o seletor de modelo e o slider de esforço do Claude Code continuam mostrando rótulos da Anthropic, e a própria Sakana descreve esses rótulos como cosméticos
E os planos? No console da Sakana tem Standard a US$ 20/mês, Pro a US$ 100/mês (10x o uso do Standard) e Max a US$ 200/mês (20x o uso do Standard), além de um pay-as-you-go por consumo de tokens
Vale confiar nos números? O que ainda não dá para afirmar
Agora a parte que quase ninguém escreve no dia do lançamento
Todos os scores de benchmark divulgados são autorreportados pelo fornecedor
Nenhum deles foi reproduzido de forma independente, e não existe página de avaliação de modelos Fugu no Artificial Analysis até 11/09/2026
Isso não quer dizer que os números são falsos, quer dizer que eles ainda não passaram pelo teste de alguém sem interesse no resultado
E tem o outro lado da moeda: velocidade
Relatos de terceiros e reviews apontam que o Fugu Ultra roda mais lento que o Fugu padrão, com esperas longas em tarefas complexas
Um teste público chegou a relatar espera de 25 minutos
Pra pesquisa autônoma rodando em background isso é detalhe, você manda e vai fazer outra coisa
Pra fluxo interativo, onde você fica olhando o cursor piscar, é outra história
Resumo honesto: o Ultra v2 faz sentido hoje pra quem tem missão longa, raciocínio visual pesado e tolerância a espera
Pra o resto (volume, tarefa curta, orçamento apertado), o Max já resolve e custa bem menos
Pra quem quer começar do zero com fluxos de múltiplas etapas no front-end, este vídeo do canal mostra como montar um formulário multistep com React.js, passo a passo
O próximo passo
A régua ficou bem desenhada nesse lançamento: Fugu Max pra volume e custo, Fugu Ultra v2 pra missão longa e raciocínio visual pesado
E o próximo passo é concreto, não é filosofia:
- Crie a chave no console da Sakana e salve ela na hora
- Escolha o ID de modelo pela missão, não pelo hype:
fugu-maxoufugu-ultra - Pegue uma tarefa de pesquisa longa que você JÁ faz hoje e rode ela nas duas variantes
- Compare com o que você usa atualmente, olhando custo, tempo e qualidade da resposta final
E lembra: os benchmarks continuam autorreportados, então o único número que vale de verdade pro seu caso é o que sair do seu próprio fluxo 🙂
até o próximo post!
Perguntas frequentes
Como aponto o Claude Code para usar o Fugu Ultra v2?
Basta exportar as variáveis de ambiente ANTHROPIC_BASE_URL e ANTHROPIC_AUTH_TOKEN, essa última sendo o bearer token gerado no console da Sakana, e não o ANTHROPIC_API_KEY. Depois disso é só rodar o claude normalmente, sem precisar de nenhum launcher extra.
Usar o Fugu Ultra v2 dentro do Claude Code consome a minha assinatura da Anthropic?
Não. As requisições feitas por essa rota são cobradas pela Sakana, e o seletor de modelo e o slider de esforço do Claude Code continuam mostrando rótulos da Anthropic. A própria Sakana descreve esses rótulos como cosméticos.
O Fugu Max e o Fugu Ultra v2 podem ser os melhores no mesmo benchmark?
Os dois aparecem em GDP.pdf e SWEFish porque a cobertura da variante Ultra v2 é contada como melhor ou empatado em melhor, então empate explica a sobreposição. Vale notar que os nomes citados nas duas listas somam nove benchmarks distintos, enquanto as frações publicadas para o Ultra v2 falam em um total de oito, sem o conjunto do Fugu Max estar declarado.
O Fugu Ultra v2 é mais lento que o Fugu padrão em tarefas complexas?
Sim, relatos de terceiros apontam que ele troca velocidade por qualidade justamente nas tarefas mais difíceis. Um teste público chegou a relatar espera de 25 minutos numa tarefa complexa.
Os benchmarks divulgados do Fugu Ultra v2 foram confirmados de forma independente?
Não. Todos os números, incluindo o 48,3 no Chartography e o 74,3 no DeepSWE, são autorreportados pela própria Sakana AI. Até 11/09/2026 não existe página de avaliação dos modelos Fugu no Artificial Analysis.
Qual o limite de contexto e de resposta do Fugu Ultra v2?
A janela de contexto vai até 1.000.000 de tokens, com limite de saída de até 128.000 tokens de conclusão. Acima de 272 mil tokens de contexto o preço por milhão de tokens sobe, então vale ficar de olho no tamanho do prompt em tarefas longas.
Quanto custa assinar o Fugu pelo console da Sakana?
O plano Standard sai por US$ 20 por mês, o Pro por US$ 100 (10x o uso do Standard) e o Max por US$ 200 (20x o uso do Standard). Também existe um plano pay-as-you-go cobrado por consumo de tokens, separado do preço por milhão de tokens do modelo.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

Quanto custa o Fugu Max e o Fugu Ultra v2 por milhão de tokens?
Fugu Max preço por milhão de tokens: valores de entrada e saída, comparação com o Fugu Ultra v2 e com Sonnet 5, GPT 5.6 Terra e Kimi K3.

Fugu Max e Fugu Ultra v2: o que os novos modelos da Sakana entregam para desenvolvimento full-stack?
Fugu Ultra v2 e Fugu Max chegam com preços, contexto e o papel do orquestrador da Sakana AI que roteia tarefas entre modelos open-weight como Nemotron.
O que significa “ChatGPT network error” e como resolver
O “ChatGPT Network Error” é uma ocorrência frequente na rotina de muitos usuários do ChatGPT. Porém, poucos compreendem seu significado, quando esse erro surge, etc. […]
