Fugu Max: quais modelos ele orquestra e onde entra a NVIDIA Nemotron?

O Fugu Max é a variante custo-desempenho do sistema de orquestração multiagente da Sakana AI, lançada junto do Fugu Ultra v2 e disponível pela API compatível com OpenAI da Sakana. Ele não é um modelo único: é um orquestrador aprendido que roteia subtarefas para um pool de modelos abertos e especializados, e esse pool inclui a família NVIDIA Nemotron, via colaboração entre Sakana AI e NVIDIA, atuando como especialista em programação, tool calling e seguimento de instruções. Preço: US$ 2,00 por milhão de tokens de entrada e US$ 6,00 de saída, com 1 milhão de tokens de contexto
Fala aí, beleza? A Sakana AI acabou de soltar o Fugu Max e o Fugu Ultra v2, e o ponto interessante aqui não é "mais um modelo novo na praça"
É outra pergunta, bem mais estranha: quais modelos estão rodando por trás de cada chamada que você faz?
Porque o Fugu não é um modelo, é um orquestrador, e isso muda tudo na hora de avaliar a coisa
Neste post eu vou direto ao que interessa: o que o Fugu orquestra, onde a família NVIDIA Nemotron entra nessa história, quanto custa cada variante e o que disso tudo ainda depende de verificação independente
O que a Sakana AI anunciou: Fugu Max e Fugu Ultra v2
São duas variantes do mesmo sistema de orquestração multiagente, lançadas juntas e já disponíveis pela API compatível com OpenAI da Sakana, conforme o anúncio oficial
A divisão de papéis é clara:
- Fugu Max: a variante focada em custo-desempenho, que amplia o pool de modelos orquestrados adicionando um grande conjunto de modelos de pesos abertos e especializados
- Fugu Ultra v2: a variante focada em qualidade, mirando raciocínio multi-etapas, pesquisa autônoma e desenvolvimento full-stack
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
E tem um detalhe do Ultra v2 que vale sublinhar: a Sakana afirma que ele não depende de modelos de fronteira proprietários individuais no seu pool
Ou seja, a aposta declarada é montar algo competitivo empilhando modelo aberto, não alugando o modelo fechado do vizinho
As duas ficam atrás do mesmo endpoint, com base_url em https://api.sakana.ai/v1, compatível com a interface padrão do SDK da OpenAI
Como funciona um orquestrador aprendido (e por que isso muda a pergunta "qual modelo você usa?")
A Sakana descreve o Fugu como um sistema de orquestração multiagente aprendido
Traduzindo: é um modelo de linguagem treinado para rotear tarefas entre um pool de modelos abertos e especializados, e treinado também para chamar recursivamente instâncias de si mesmo
Se você já mexeu com um gerenciador de dependências tipo NPM ou composer, a analogia ajuda: você pede uma coisa só e um monte de peça é resolvida por baixo sem você escolher cada uma na mão
O fluxo, do jeito que a Sakana explica, tem três movimentos:
- Seleção dinâmica: o Fugu decide, para cada tarefa, quais modelos combinar
- Delegação: ele quebra o pedido e manda as subtarefas para os especialistas do pool
- Síntese: junta tudo e devolve uma resposta única
E isso tudo acontece atrás de uma API única
Perceba o que muda aqui: a pergunta clássica "qual modelo você tá usando?" perde o sentido
Não existe UM modelo
Existe um roteador decidindo, chamada a chamada, quem faz o quê
Onde a família NVIDIA Nemotron entra no pool do Fugu Max
Agora o núcleo da notícia
A família NVIDIA Nemotron faz parte do pool de agentes da variante Max, via colaboração entre Sakana AI e NVIDIA
Essa colaboração foi anunciada pela própria Sakana, e o objetivo declarado era justamente esse: levar o open model stack da NVIDIA, incluindo a Nemotron, para dentro do Fugu
E dentro do pool os modelos Nemotron não são coringa pra tudo, eles entram como especialistas em três frentes:
- Programação
- Uso de ferramentas (tool calling)
- Seguimento de instruções (instruction following)
Olha que interessante: são exatamente os três eixos que mais pesam quando você usa IA dentro de um harness de desenvolvimento, aquele ciclo de ler arquivo, rodar comando, seguir a regra que você escreveu e não sair inventando
A tese da Sakana pra isso é explícita: modelos abertos são a parte que mais cresce e mais diversa do ecossistema de IA, e ficam MUITO mais úteis orquestrados em conjunto do que usados isoladamente
Do lado da NVIDIA, o movimento tem contexto próprio: a empresa confirmou em comunicado oficial que empresas e startups do Japão estão construindo IA especializada com os modelos abertos Nemotron, citando o ecossistema japonês
Uma ressalva honesta antes que você pergunte: a lista completa e nominal dos outros modelos abertos do pool não foi publicada em fonte oficial
O que está confirmado é a menção explícita à família Nemotron, e mais nada além disso
Fugu Max x Fugu Ultra v2: preço, contexto e recursos
Os números lado a lado, só com o que dá pra confirmar em fonte:
| Item | Fugu Max | Fugu Ultra v2 |
|---|---|---|
| Entrada (por milhão de tokens) | US$ 2,00 | US$ 5,00 |
| Saída (por milhão de tokens) | US$ 6,00 | US$ 30,00 |
| Cache read (por milhão) | não informado | US$ 0,50 |
| Busca web | não informado | US$ 10,00 por mil chamadas |
| Janela de contexto | 1 milhão de tokens | não informado |
| Saída máxima | 128 mil tokens | não informado |
| Esforço de raciocínio | não informado | configurável: high, xhigh, max |
| Recursos | não informado | function calling, saídas estruturadas, imagem e PDF, busca web integrada |
| Foco | custo-desempenho | raciocínio multi-etapas, pesquisa autônoma, full-stack |
A diferença de saída é o que salta: US$ 6,00 contra US$ 30,00 por milhão de tokens
E saída é justamente onde codar dói no bolso, porque geração de código é token de saída na veia
Sobre o posicionamento de preço, aqui vale deixar bem marcado de quem é a afirmação: a própria Sakana diz que o preço de saída do Max é 40% a 60% menor que o de Sonnet 5, GPT 5.6 Terra e Kimi K3
E a própria Sakana posiciona o Max próximo dos modelos de elite com custo de 2x a 6x menor
Comparação feita pelo fabricante é comparação feita pelo fabricante, beleza? Anota no canto da tela
Um ponto que costuma gerar confusão: 1 milhão de tokens de contexto não significa 1 milhão de tokens de resposta, e essa diferença entre contexto e saída máxima é a mesma armadilha que aparece em qualquer modelo de contexto gigante
No Max o teto de saída é 128 mil tokens, e é esse número que limita o tamanho do que ele devolve de uma vez
O que muda na prática para quem desenvolve com IA
O consumo é pela API compatível com o SDK da OpenAI, então na prática você aponta o cliente que já usa para outro endereço:
from openai import OpenAI
client = OpenAI(
base_url="https://api.sakana.ai/v1",
api_key="SUA_CHAVE",
)
O identificador do modelo você pega direto no console da Sakana 🙂
Tem também uma interface do Fugu compatível com Claude Code, anunciada pela Sakana junto do Fugu-Ultra v1.1
E o que o pool ampliado significa pra quem paga por token? Significa que a conta de custo deixou de ser "esse modelo é caro ou barato" e virou "o roteador acertou a escolha nessa tarefa?"
Quando acerta, você paga preço de modelo aberto especializado e recebe resultado de coisa grande
Quando erra, você paga o caminho longo sem saber onde
Duas ressalvas que eu faço questão de deixar no texto:
- Os números de benchmark divulgados no lançamento são reportados pela própria Sakana e ainda não foram reproduzidos de forma independente por laboratórios terceiros
- A cobertura especializada trata o movimento como prova da tese de inteligência coletiva da Sakana, e o the-decoder cobriu a entrada da Nemotron no orquestrador exatamente nesse enquadramento
E vale o lembrete de sempre: orquestrador bom não te dispensa de ler o que saiu
Código gerado por IA continua sendo código que alguém precisa revisar, e essa lógica de onde a revisão humana continua obrigatória não muda só porque agora tem cinco modelos trabalhando em vez de um
Como foi usar o Fugu na prática: o teste em vídeo
Aqui eu falo por experiência própria, porque assinei o plano e fui testar
Usei a variante mais barata da linha, não a Ultra, justamente pra ver quanto os créditos rendiam numa sessão de trabalho de verdade
A sessão tinha 3 projetos planejados
Saíram 2 😅
O medidor de consumo conta a história melhor do que eu:
- Depois do primeiro prompt da landing page: 2% do limite semanal (e 5 horas no medidor)
- Durante a criação da landing page: 18%
- Total do limite semanal gasto só com a landing page: 6%
- No início do projeto kanban: 23%
- Acumulado ao final dos dois projetos (landing page + kanban simples): 66%
Dois projetos, dois terços do limite semanal
E aí a gente volta pro tema deste post
A orquestração é invisível pra quem usa: você manda o prompt, recebe o código, e não tem como saber qual modelo do pool fez cada pedaço
No vídeo eu mostro isso acontecendo: o raciocínio vai e volta, vai e volta, e o que você enxerga na ponta não é "quem trabalhou", é o ponteiro do consumo subindo
Por isso eu acho relevante a Sakana nomear a Nemotron no pool do Fugu
Não resolve a caixa preta, longe disso, mas é a primeira vez que tem um nome concreto do outro lado da chamada
Se quiser ver os dois projetos rodando do começo ao fim, com o medidor na tela e o resultado real de cada um, é só dar o play aí em cima
Conclusão
Recapitulando o que está confirmado sobre o Fugu Max:
- Sakana AI lançou duas variantes, Max (custo-desempenho) e Ultra v2 (qualidade), ambas pela API compatível com OpenAI
- Ele amplia o pool com o maior conjunto de modelos abertos e especializados até hoje
- A família NVIDIA Nemotron está nesse pool, via colaboração Sakana AI + NVIDIA, atuando como especialista em programação, tool calling e seguimento de instruções
- Os preços são bem distintos entre as duas: US$ 2,00 e US$ 6,00 por milhão (entrada e saída) no Max, contra US$ 5,00 e US$ 30,00 no Ultra v2
E o que ainda pede cautela: os benchmarks do lançamento são self-reported e não foram reproduzidos de forma independente, além do inventário completo do pool que ninguém publicou
Próximo passo concreto, se você quer tirar a limpo: aponte seu cliente da OpenAI para https://api.sakana.ai/v1, rode uma tarefa real do seu dia e compare o custo de saída com o do stack que você já usa hoje
Uma tarefa de verdade te diz mais que dez tabelas de benchmark, e é bem mais barato que migrar primeiro e descobrir depois…
Até o próximo post!
Perguntas frequentes
O Fugu Max tem interface compatível com o Claude Code?
A Sakana anunciou uma interface compatível com Claude Code para o Fugu, junto do lançamento do Fugu Ultra v1.1. O detalhe de compatibilidade foi divulgado nesse contexto específico, então vale checar a documentação da Sakana antes de assumir que todo recurso do Claude Code funciona igual na variante Max.
O Fugu Max é mais barato que o Claude Sonnet 5 e o GPT 5.6 Terra?
Segundo a própria Sakana, o preço de saída do Fugu Max é de 40% a 60% menor que o de Sonnet 5, GPT 5.6 Terra e Kimi K3. A Sakana também o posiciona próximo dos modelos de elite com custo de 2x a 6x menor. É bom lembrar que essa comparação parte do fabricante, não de um teste independente.
Os benchmarks divulgados no lançamento do Fugu Max são confiáveis?
Os números de benchmark do lançamento são reportados pela própria Sakana e ainda não foram reproduzidos de forma independente por laboratórios terceiros. Isso não significa que estejam errados, mas é o tipo de dado que pede cautela antes de virar decisão de compra.
Como faço para usar o Fugu Max com o SDK da OpenAI?
A variante fica disponível pela API compatível com OpenAI da Sakana, usando o mesmo base_url que o Fugu Ultra v2: https://api.sakana.ai/v1. Como a interface segue o padrão do SDK da OpenAI, a troca costuma se resumir a apontar o cliente pra esse endpoint.
Qual a diferença prática entre o Fugu Max e o Fugu Ultra v2?
O Max é a variante focada em custo-desempenho, com pool ampliado de modelos abertos e especializados, saída a US$ 6,00 por milhão de tokens. O Ultra v2 mira qualidade em raciocínio multi-etapas, pesquisa autônoma e desenvolvimento full-stack, com saída a US$ 30,00 por milhão de tokens e recursos como esforço de raciocínio configurável e busca web integrada.
O NVIDIA Nemotron substitui os outros modelos do pool?
Não, o Nemotron entra como mais um especialista dentro do pool de agentes, não como substituto dos demais modelos. Seu papel declarado pela Sakana cobre três frentes: programação, uso de ferramentas (tool calling) e seguimento de instruções, enquanto o orquestrador continua decidindo dinamicamente qual modelo chamar para cada subtarefa.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como montar fallback entre Fable 5.1 e GPT-6 Astra quando um dos dois falha
Fallback Fable 5.1 GPT-6 Astra: veja como criar um adaptador único, tratar erros e trocar de modelo sem quebrar seu app.
O que significa “ChatGPT network error” e como resolver
O “ChatGPT Network Error” é uma ocorrência frequente na rotina de muitos usuários do ChatGPT. Porém, poucos compreendem seu significado, quando esse erro surge, etc. […]

Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
