O que é Fugu Max e Fugu Ultra v2? Entenda a orquestração da Sakana AI

Diagrama ilustrando a orquestração de modelos Fugu Max e Fugu Ultra v2 da Sakana AI
Resposta rápida

Fugu Max e Fugu Ultra v2 são os dois modelos mais recentes da linha Fugu, da Sakana AI, e o ponto principal é que Fugu não é um foundation model: é um orquestrador que roteia a tarefa entre um pool de outros modelos, exposto atrás de uma única API compatível com OpenAI. O Max mira melhor resultado pelo menor custo (US$ 2 por milhão de tokens de entrada e US$ 6 de saída) e o Ultra v2 mira capacidade máxima em tarefas longas de múltiplas etapas (US$ 5 e US$ 30, segundo listagem do OpenRouter). Os benchmarks citados são avaliação da própria Sakana.

Fala aí, beleza? Apareceu um nome estranho na timeline, com cara de sushi, e de repente todo mundo estava comparando ele com os modelos de fronteira 🙂

Fugu Max e Fugu Ultra v2 são da Sakana AI, a empresa japonesa que anunciou a linha Fugu em 22 de junho de 2026

E o detalhe que muda tudo: eles NÃO são mais um foundation model entrando na fila

São orquestradores, coisa diferente, com outra lógica de preço e outro tipo de promessa

Neste post eu te conto o que cada um é, qual problema essa arquitetura resolve, quanto custa, quando vale a pena e o que eu vi rodando dois projetos do zero com o Fugu, tempo e consumo anotados na mão

Já deixo separado desde agora: número de benchmark aqui é claim da própria Sakana, e eu marco isso toda vez que aparecer

O que é meu no post é o teste de consumo e tempo, lá na parte prática

Que problema a orquestração da Sakana AI resolve

Vamos pelo porquê, que é onde a coisa faz sentido

Quando tu escolhe um modelo único pro teu agente, tu paga preço de fronteira pra TODA tarefa

Renomear variável? preço de fronteira

Resumir um parágrafo? preço de fronteira

Refatorar um sistema inteiro? preço de fronteira também, só que aí faz sentido

O Fugu ataca exatamente esse desperdício: ele é um roteador que escolhe, por trás dos panos, qual modelo do pool vai rodar cada pedaço do trabalho

E ele entrega isso como se fosse um modelo só, atrás de uma única API compatível com OpenAI

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Uma chamada de API, várias coisas acontecendo:

Uma única chamada pro Fugu pode virar quatro comportamentos diferentes, segundo a Sakana:

  • resposta direta, quando a pergunta é simples
  • delegação a um modelo especialista
  • verificação intermediária do que foi produzido
  • síntese final juntando as partes

Se você conhece a ideia de time (um cara pensa, outro executa, outro revisa), é mais ou menos isso, só que dentro de um endpoint

De onde vem a base técnica:

Isso não nasceu de um post de marketing

A base do Fugu vem de dois papers da Sakana no ICLR 2026: Trinity e Conductor

O TRINITY usa um coordenador leve evoluído que atribui papéis de Thinker, Worker ou Verifier, delegando o trabalho de forma adaptativa

Ou seja, o "quem faz o quê" não é uma regra fixa escrita na mão, é decidido na hora, por tarefa

É uma ideia massa no papel, e é justamente ela que gera a parte desconfortável: você não escolhe o modelo, ele escolhe por você…

Fugu Max x Fugu Ultra v2: diferenças lado a lado

Os dois são orquestradores, mas com missões otimizadas pra lados opostos da balança

O Max quer o melhor resultado pelo menor custo possível

O Ultra v2 quer capacidade máxima em tarefa complexa de múltiplas etapas

Item Fugu Max Fugu Ultra v2
Foco da missão Melhor resultado pelo menor custo possível Capacidade máxima em tarefas complexas de múltiplas etapas
Preço de entrada US$ 2 por milhão de tokens US$ 5 por milhão de tokens (listagem do OpenRouter)
Preço de saída US$ 6 por milhão de tokens US$ 30 por milhão de tokens (listagem do OpenRouter)
Prompt acima de 272K tokens Sem informação divulgada Cobrado a uma tarifa maior (listagem do OpenRouter)
Pool de modelos Pool ampliado com open-weights e especializados, incluindo a família NVIDIA Nemotron, via colaboração com a NVIDIA; roteia pro modelo mais enxuto capaz de resolver Pool que não contém Claude Fable 5, Claude Fable 5.1 nem GPT-6 Astra
Benchmarks (avaliação da própria Sakana, na data do anúncio) Melhor score geral em 6 benchmarks: Terminal Bench 2.1, GPQA Diamond, AA-LCR, GDP.pdf, AutomationBench e SWEFish Melhor ou empatado em primeiro em 5 de 8 benchmarks; Chartography 48.3 contra Claude Opus 5 em 27.3 e Claude Fable 5 em 29.5; DeepSWE 74.3
Disponibilidade API padrão da Sakana, compatível com OpenAI API padrão da Sakana, compatível com OpenAI

Repara que eu marquei benchmark por benchmark: é avaliação da própria Sakana, divulgada no anúncio

Não é leaderboard independente, e eu não vou vender isso como se fosse

O preço do Ultra v2 eu conferi na página de provedor terceiro, a listagem do OpenRouter, então fica a atribuição também

Por que o pool do Ultra v2 não inclui Claude Fable 5 nem GPT-6 Astra

Essa é a parte que gerou mais confusão na timeline, e vale desfazer

Muita gente assumiu que o Fable 5 ficou de fora por bloqueio regulatório

Não é o caso hoje

O que aconteceu de fato: a Anthropic suspendeu Fable 5 e Mythos 5 depois de uma ordem de export control dos EUA em junho de 2026

Os controles foram levantados em 30/06/2026 e o Fable 5 voltou a ficar disponível globalmente a partir de 01/07/2026, encerrando 19 dias de interrupção

Ou seja: o modelo está de volta, e a ausência dele no pool do Ultra v2 é escolha de projeto, não bloqueio vigente

E a Sakana usa isso como argumento central: o resultado do Ultra v2 não dependeria de um único modelo proprietário de fronteira

É um argumento forte de marketing? é

Mas é um argumento técnico legítimo também, porque depender de um fornecedor só é exatamente o risco que aquele episódio de 19 dias escancarou

E o resto da família Fugu?

Max e Ultra v2 são os nomes do momento, mas a família tem mais gente:

  • Fugu (padrão), com equilíbrio entre desempenho e latência
  • Fugu Ultra, nas versões v1.0 e v1.1
  • Fugu-Cyber, voltado a benchmarks de cibersegurança

Se o Max aposenta ou apenas convive com o Fugu base e o Ultra v1.1 no catálogo, isso a Sakana não deixou claro, então não vou chutar

Quando usar o Fugu Max e quando o Fugu Ultra v2

Aqui a decisão fica bem menos filosófica quando tu olha os números da tabela

Cenários que puxam pro Fugu Max:

  • volume alto de chamadas, onde cada dólar por milhão de tokens vira dinheiro de verdade no fim do mês
  • tarefas repetitivas e previsíveis (classificação, extração, resumo, transformação de texto)
  • pipelines sensíveis a custo, onde a maior parte do trabalho é simples e só uma fração é difícil

É justamente nesse último caso que a proposta brilha: o Max roteia pro modelo mais enxuto capaz de resolver, então tu não paga fronteira pelo trabalho fácil

Cenários que puxam pro Fugu Ultra v2:

  • tarefa longa, de múltiplas etapas, com dependência entre os passos
  • agentes que precisam planejar, executar e revisar dentro do mesmo fluxo
  • contexto muito grande, com vários arquivos ou documentos em jogo

Só lembra do detalhe da tarifa: prompt acima de 272K tokens é cobrado a uma tarifa maior no Ultra v2

Então contexto gigante não é só "cabe ou não cabe", é decisão de orçamento também

E tem o ponto que ninguém comenta: por serem orquestradores, os dois são caixa preta

Você não consegue saber qual modelo respondeu o quê

Pra tarefa de produção que exige rastreabilidade, isso pesa

Quanto custa: API por token e os planos mensais da Sakana

Tem dois caminhos de cobrança, e eles resolvem problemas diferentes

O primeiro é pay-as-you-go por token, aquele modelo clássico de API:

  • Fugu Max: US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída
  • Fugu Ultra v2: US$ 5 de entrada e US$ 30 de saída, conforme a listagem do OpenRouter

O segundo são as três assinaturas mensais da Sakana:

Plano Preço Uso
Standard US$ 20/mês base de referência
Pro US$ 100/mês 10x o uso do Standard
Max US$ 200/mês 20x o uso do Standard

Um aviso importante pra não te dar informação torta: se o Fugu Max e o Fugu Ultra v2 entram nesses planos de assinatura, eu não consegui confirmar

Então não trate como certo antes de olhar tua conta

Sobre o discurso de economia, a Sakana afirma que o preço de saída do Fugu Max é 40% a 60% menor que o de Sonnet 5, GPT 5.6 Terra e Kimi K3

De novo: é comparação da própria Sakana, feita por ela, no anúncio dela

Será que se sustenta na tua carga de trabalho real? só medindo pra saber

Como usar o Fugu dentro do Claude Code

A Sakana mantém uma interface pra usar o Fugu dentro do Claude Code via variáveis de ambiente ANTHROPIC_*

Não tem launcher próprio, não tem instalador especial: é o Claude Code de sempre apontando pra outro endpoint

  1. Exporte a URL base da API da Sakana:
export ANTHROPIC_BASE_URL="https://api.sakana.ai"
  1. Exporte a tua chave da Sakana em ANTHROPIC_AUTH_TOKEN:
export ANTHROPIC_AUTH_TOKEN="sua-chave-da-sakana"

O erro comum deste passo (e olha que é fácil cair nele): usar ANTHROPIC_API_KEY no lugar de ANTHROPIC_AUTH_TOKEN

A variável certa aqui é a de bearer token, ANTHROPIC_AUTH_TOKEN

Trocou uma pela outra, tu vai ficar olhando pra erro de autenticação achando que a chave tá errada

  1. Rode o Claude Code normalmente:
claude

E só isso

Se o problema aparecer ANTES disso, na hora de rodar o claude pela primeira vez, aí é outro assunto: vale checar os erros comuns na instalação do Claude Code antes de culpar a Sakana 😀

Uma coisa eu prefiro OMITIR a te ensinar errado: os identificadores exatos de modelo do Fugu Max e do Fugu Ultra v2 pra selecionar dentro do Claude Code eu não consegui confirmar

A página da interface mostra exemplos da época do Ultra v1.1, e chutar string de modelo é o tipo de coisa que te faz perder meia hora à toa

Testamos o Fugu na prática: consumo e tempo em dois projetos

Antes de sair repetindo benchmark de anúncio, eu assinei o plano pago com as minhas próprias contas pra ver quanto os créditos rendem de verdade

E olha, eu fui no modelo mais simples da linha, não no Ultra, justamente porque achei o preço salgado e queria ver o rendimento real

Rodei no harness do Codex, que interfere pouco no comportamento da IA, então dá pra avaliar o modelo com menos ruído no meio

Teste 1, a landing page:

Pedi uma landing page de produto com tema escuro, arquivos separados, barra de progresso de leitura e rolagem suave até as seções

O modelo quebrou o pedido em tarefas e usou ferramentas, inclusive busca na internet, trazendo informação correta sobre o próprio produto pra dentro da página

Isso foi massa de ver

Tempo: quase 6 minutos pra entregar

Consumo: logo depois do primeiro prompt a tela de assinatura marcava 2% do limite semanal (tinha também um percentual da janela de 5 horas, mas esse número ficou confuso na tela)

Depois da landing page pronta, o acumulado exibido era 18%, e eu atribuí 6% do limite semanal só à criação dessa página

Pra uma landing page simples, isso é trituração de tokens

E o resultado visual? elementos sobrepostos, seções sem respiro e aquele visual genérico de IA com gradiente, mesmo eu tendo dado direção de design

No fim ele ainda ficou abrindo e checando arquivo, coisa desnecessária pra uma página web estática

Teste 2, o Kanban:

Antes de começar eu usei compact e clear na sessão pra não estourar o consumo (e os slash commands herdados funcionaram numa boa)

Pedi um sistema web completo de gestão de tarefas estilo Kanban, com backend e frontend em pastas separadas, nada de arquivo único

Node com Express no backend, banco local pra não precisar instalar nada, frontend livre: ele escolheu React

O consumo exibido no início desse projeto já era 23%

Aos 8 minutos ele indicou que estava finalizando

Aos 12 minutos travou numa etapa de instalação de dependências e exigiu aprovação manual pra seguir

Pra comparar com o que já rodou aqui no canal: em outros testes, só o scaffold costuma levar cerca de 10 minutos, então em velocidade ele foi bem

O entregável tinha arrastar e soltar, campo de busca filtrando os cards e persistência em banco local depois de recarregar a página

Funcionou

O que me incomodou foi ele pular a atualização das tarefas no meio do caminho, indo direto da inspeção da pasta pro teste final, o que tira a tua visibilidade do processo

Veredito sóbrio:

Rápido na entrega inicial, sim

Mas com tropeço em etapa de dependências, consumo alto pro tamanho do que foi pedido e o agravante estrutural: no modo que testei não dá pra reduzir modelo nem nível de raciocínio pra economizar

E como é caixa preta, fica a pergunta que ninguém consegue responder olhando de fora: o orquestrador pode estar roteando pra modelo mais barato e cobrando como se fosse o mais caro? não dá pra verificar

Vale dizer também que boa parte da notoriedade da ferramenta vem do marketing de se posicionar como superior a concorrentes

E marketing não é benchmark

Veja o teste completo em vídeo

No vídeo abaixo eu mostro os dois projetos rodando do zero, a tela de consumo a cada etapa e o momento exato em que ele trava na instalação de dependências

Vale a pena testar o Fugu agora?

Bora separar as coisas, porque tem muita mistura rolando por aí

O que é fato verificado: o Fugu é um orquestrador, não um foundation model; ele roteia entre um pool de modelos atrás de uma API compatível com OpenAI; o Max custa US$ 2 de entrada e US$ 6 de saída por milhão de tokens; o Ultra v2 aparece a US$ 5 e US$ 30 na listagem do OpenRouter, com tarifa maior acima de 272K tokens; o pool do Ultra v2 não inclui Fable 5, Fable 5.1 nem GPT-6 Astra, por escolha de projeto

O que é claim da própria Sakana: os resultados de benchmark (os 6 do Max, os 5 de 8 do Ultra v2, o Chartography 48.3 e o DeepSWE 74.3) e a comparação de saída 40% a 60% mais barata que Sonnet 5, GPT 5.6 Terra e Kimi K3

O que é meu, medido aqui: o tempo e o consumo dos dois projetos lá de cima, com o tropeço na instalação de dependências no meio

Claim não é mentira, mas também não é leaderboard independente, então trate como ponto de partida e não como conclusão

O próximo passo prático, se tu quiser tirar a prova: pluga no Claude Code com as duas variáveis de ambiente, roda um projeto pequeno e MEDE, tempo e consumo anotados

Começa pelo Max, que é a missão de custo, e só sobe pro Ultra v2 se a tarefa for realmente longa e de múltiplas etapas

Porque orquestração é uma ideia excelente, e a execução a gente mede na própria conta, não no slide 🙂

Até o próximo post!

Perguntas frequentes

Dá pra usar o Fugu Max ou o Fugu Ultra v2 dentro do Claude Code?

Dá, a Sakana mantém uma interface pra plugar o Fugu no Claude Code via variáveis de ambiente, sem launcher próprio. É o mesmo passo a passo que está no post: exportar ANTHROPIC_BASE_URL="https://api.sakana.ai", exportar a tua chave da Sakana em ANTHROPIC_AUTH_TOKEN (a variável de bearer token, não ANTHROPIC_API_KEY) e rodar o claude normalmente.

Dá pra assinar o Fugu por mensalidade em vez de pagar por token?

Dá sim. A Sakana oferece três planos mensais: Standard a US$ 20, Pro a US$ 100 (10x o uso do Standard) e Max a US$ 200 (20x o uso do Standard). Também existe o modelo pay-as-you-go, cobrando por token, que é o formato usado nos preços de API do Max e do Ultra v2.

O export control que tirou o Claude Fable 5 do ar ainda está valendo?

Não, esse capítulo já fechou. A Anthropic suspendeu Fable 5 e Mythos 5 depois de uma ordem de export control dos EUA em junho de 2026, mas os controles foram levantados em 30 de junho e o Fable 5 voltou a ficar disponível globalmente a partir de 1º de julho, depois de 19 dias fora do ar.

Fugu Max e Fugu Ultra v2 são LLMs treinados do zero pela Sakana?

Não. Segundo a própria Sakana, o Fugu não é um foundation model único, é um sistema multi-agente entregue como se fosse um modelo só. Por trás da API compatível com OpenAI, ele roteia cada pedaço do trabalho entre um pool de outros modelos, incluindo resposta direta, delegação a especialista, verificação intermediária e síntese final.

Em quais benchmarks a Sakana baseou os resultados do Fugu Max e do Fugu Ultra v2?

São números da própria avaliação da Sakana, divulgados no anúncio, não de um leaderboard independente. O Fugu Max ficou com o melhor score geral em seis benchmarks: Terminal Bench 2.1, GPQA Diamond, AA-LCR, GDP.pdf, AutomationBench e SWEFish. Já o Fugu Ultra v2 ficou melhor ou empatado em primeiro em 5 de 8 benchmarks, com destaque pra Chartography (48.3 contra 27.3 do Claude Opus 5) e DeepSWE (74.3).




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares