Fugu Max: quais modelos ele orquestra e onde entra a NVIDIA Nemotron?

diagrama mostrando o Fugu Max orquestrando modelos e a NVIDIA Nemotron como especialista em programação
Resposta rápida

O Fugu Max é a variante custo-desempenho do sistema de orquestração multiagente da Sakana AI, lançada junto do Fugu Ultra v2 e disponível pela API compatível com OpenAI da Sakana. Ele não é um modelo único: é um orquestrador aprendido que roteia subtarefas para um pool de modelos abertos e especializados, e esse pool inclui a família NVIDIA Nemotron, via colaboração entre Sakana AI e NVIDIA, atuando como especialista em programação, tool calling e seguimento de instruções. Preço: US$ 2,00 por milhão de tokens de entrada e US$ 6,00 de saída, com 1 milhão de tokens de contexto

Fala aí, beleza? A Sakana AI acabou de soltar o Fugu Max e o Fugu Ultra v2, e o ponto interessante aqui não é "mais um modelo novo na praça"

É outra pergunta, bem mais estranha: quais modelos estão rodando por trás de cada chamada que você faz?

Porque o Fugu não é um modelo, é um orquestrador, e isso muda tudo na hora de avaliar a coisa

Neste post eu vou direto ao que interessa: o que o Fugu orquestra, onde a família NVIDIA Nemotron entra nessa história, quanto custa cada variante e o que disso tudo ainda depende de verificação independente

O que a Sakana AI anunciou: Fugu Max e Fugu Ultra v2

São duas variantes do mesmo sistema de orquestração multiagente, lançadas juntas e já disponíveis pela API compatível com OpenAI da Sakana, conforme o anúncio oficial

A divisão de papéis é clara:

  • Fugu Max: a variante focada em custo-desempenho, que amplia o pool de modelos orquestrados adicionando um grande conjunto de modelos de pesos abertos e especializados
  • Fugu Ultra v2: a variante focada em qualidade, mirando raciocínio multi-etapas, pesquisa autônoma e desenvolvimento full-stack
Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

E tem um detalhe do Ultra v2 que vale sublinhar: a Sakana afirma que ele não depende de modelos de fronteira proprietários individuais no seu pool

Ou seja, a aposta declarada é montar algo competitivo empilhando modelo aberto, não alugando o modelo fechado do vizinho

As duas ficam atrás do mesmo endpoint, com base_url em https://api.sakana.ai/v1, compatível com a interface padrão do SDK da OpenAI

Como funciona um orquestrador aprendido (e por que isso muda a pergunta "qual modelo você usa?")

A Sakana descreve o Fugu como um sistema de orquestração multiagente aprendido

Traduzindo: é um modelo de linguagem treinado para rotear tarefas entre um pool de modelos abertos e especializados, e treinado também para chamar recursivamente instâncias de si mesmo

Se você já mexeu com um gerenciador de dependências tipo NPM ou composer, a analogia ajuda: você pede uma coisa só e um monte de peça é resolvida por baixo sem você escolher cada uma na mão

O fluxo, do jeito que a Sakana explica, tem três movimentos:

  1. Seleção dinâmica: o Fugu decide, para cada tarefa, quais modelos combinar
  2. Delegação: ele quebra o pedido e manda as subtarefas para os especialistas do pool
  3. Síntese: junta tudo e devolve uma resposta única

E isso tudo acontece atrás de uma API única

Perceba o que muda aqui: a pergunta clássica "qual modelo você tá usando?" perde o sentido

Não existe UM modelo

Existe um roteador decidindo, chamada a chamada, quem faz o quê

Onde a família NVIDIA Nemotron entra no pool do Fugu Max

Agora o núcleo da notícia

A família NVIDIA Nemotron faz parte do pool de agentes da variante Max, via colaboração entre Sakana AI e NVIDIA

Essa colaboração foi anunciada pela própria Sakana, e o objetivo declarado era justamente esse: levar o open model stack da NVIDIA, incluindo a Nemotron, para dentro do Fugu

E dentro do pool os modelos Nemotron não são coringa pra tudo, eles entram como especialistas em três frentes:

  • Programação
  • Uso de ferramentas (tool calling)
  • Seguimento de instruções (instruction following)

Olha que interessante: são exatamente os três eixos que mais pesam quando você usa IA dentro de um harness de desenvolvimento, aquele ciclo de ler arquivo, rodar comando, seguir a regra que você escreveu e não sair inventando

A tese da Sakana pra isso é explícita: modelos abertos são a parte que mais cresce e mais diversa do ecossistema de IA, e ficam MUITO mais úteis orquestrados em conjunto do que usados isoladamente

Do lado da NVIDIA, o movimento tem contexto próprio: a empresa confirmou em comunicado oficial que empresas e startups do Japão estão construindo IA especializada com os modelos abertos Nemotron, citando o ecossistema japonês

Uma ressalva honesta antes que você pergunte: a lista completa e nominal dos outros modelos abertos do pool não foi publicada em fonte oficial

O que está confirmado é a menção explícita à família Nemotron, e mais nada além disso

Fugu Max x Fugu Ultra v2: preço, contexto e recursos

Os números lado a lado, só com o que dá pra confirmar em fonte:

Item Fugu Max Fugu Ultra v2
Entrada (por milhão de tokens) US$ 2,00 US$ 5,00
Saída (por milhão de tokens) US$ 6,00 US$ 30,00
Cache read (por milhão) não informado US$ 0,50
Busca web não informado US$ 10,00 por mil chamadas
Janela de contexto 1 milhão de tokens não informado
Saída máxima 128 mil tokens não informado
Esforço de raciocínio não informado configurável: high, xhigh, max
Recursos não informado function calling, saídas estruturadas, imagem e PDF, busca web integrada
Foco custo-desempenho raciocínio multi-etapas, pesquisa autônoma, full-stack

A diferença de saída é o que salta: US$ 6,00 contra US$ 30,00 por milhão de tokens

E saída é justamente onde codar dói no bolso, porque geração de código é token de saída na veia

Sobre o posicionamento de preço, aqui vale deixar bem marcado de quem é a afirmação: a própria Sakana diz que o preço de saída do Max é 40% a 60% menor que o de Sonnet 5, GPT 5.6 Terra e Kimi K3

E a própria Sakana posiciona o Max próximo dos modelos de elite com custo de 2x a 6x menor

Comparação feita pelo fabricante é comparação feita pelo fabricante, beleza? Anota no canto da tela

Um ponto que costuma gerar confusão: 1 milhão de tokens de contexto não significa 1 milhão de tokens de resposta, e essa diferença entre contexto e saída máxima é a mesma armadilha que aparece em qualquer modelo de contexto gigante

No Max o teto de saída é 128 mil tokens, e é esse número que limita o tamanho do que ele devolve de uma vez

O que muda na prática para quem desenvolve com IA

O consumo é pela API compatível com o SDK da OpenAI, então na prática você aponta o cliente que já usa para outro endereço:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.sakana.ai/v1",
    api_key="SUA_CHAVE",
)

O identificador do modelo você pega direto no console da Sakana 🙂

Tem também uma interface do Fugu compatível com Claude Code, anunciada pela Sakana junto do Fugu-Ultra v1.1

E o que o pool ampliado significa pra quem paga por token? Significa que a conta de custo deixou de ser "esse modelo é caro ou barato" e virou "o roteador acertou a escolha nessa tarefa?"

Quando acerta, você paga preço de modelo aberto especializado e recebe resultado de coisa grande

Quando erra, você paga o caminho longo sem saber onde

Duas ressalvas que eu faço questão de deixar no texto:

  • Os números de benchmark divulgados no lançamento são reportados pela própria Sakana e ainda não foram reproduzidos de forma independente por laboratórios terceiros
  • A cobertura especializada trata o movimento como prova da tese de inteligência coletiva da Sakana, e o the-decoder cobriu a entrada da Nemotron no orquestrador exatamente nesse enquadramento

E vale o lembrete de sempre: orquestrador bom não te dispensa de ler o que saiu

Código gerado por IA continua sendo código que alguém precisa revisar, e essa lógica de onde a revisão humana continua obrigatória não muda só porque agora tem cinco modelos trabalhando em vez de um

Como foi usar o Fugu na prática: o teste em vídeo

Aqui eu falo por experiência própria, porque assinei o plano e fui testar

Usei a variante mais barata da linha, não a Ultra, justamente pra ver quanto os créditos rendiam numa sessão de trabalho de verdade

A sessão tinha 3 projetos planejados

Saíram 2 😅

O medidor de consumo conta a história melhor do que eu:

  • Depois do primeiro prompt da landing page: 2% do limite semanal (e 5 horas no medidor)
  • Durante a criação da landing page: 18%
  • Total do limite semanal gasto só com a landing page: 6%
  • No início do projeto kanban: 23%
  • Acumulado ao final dos dois projetos (landing page + kanban simples): 66%

Dois projetos, dois terços do limite semanal

E aí a gente volta pro tema deste post

A orquestração é invisível pra quem usa: você manda o prompt, recebe o código, e não tem como saber qual modelo do pool fez cada pedaço

No vídeo eu mostro isso acontecendo: o raciocínio vai e volta, vai e volta, e o que você enxerga na ponta não é "quem trabalhou", é o ponteiro do consumo subindo

Por isso eu acho relevante a Sakana nomear a Nemotron no pool do Fugu

Não resolve a caixa preta, longe disso, mas é a primeira vez que tem um nome concreto do outro lado da chamada

Se quiser ver os dois projetos rodando do começo ao fim, com o medidor na tela e o resultado real de cada um, é só dar o play aí em cima

Conclusão

Recapitulando o que está confirmado sobre o Fugu Max:

  • Sakana AI lançou duas variantes, Max (custo-desempenho) e Ultra v2 (qualidade), ambas pela API compatível com OpenAI
  • Ele amplia o pool com o maior conjunto de modelos abertos e especializados até hoje
  • A família NVIDIA Nemotron está nesse pool, via colaboração Sakana AI + NVIDIA, atuando como especialista em programação, tool calling e seguimento de instruções
  • Os preços são bem distintos entre as duas: US$ 2,00 e US$ 6,00 por milhão (entrada e saída) no Max, contra US$ 5,00 e US$ 30,00 no Ultra v2

E o que ainda pede cautela: os benchmarks do lançamento são self-reported e não foram reproduzidos de forma independente, além do inventário completo do pool que ninguém publicou

Próximo passo concreto, se você quer tirar a limpo: aponte seu cliente da OpenAI para https://api.sakana.ai/v1, rode uma tarefa real do seu dia e compare o custo de saída com o do stack que você já usa hoje

Uma tarefa de verdade te diz mais que dez tabelas de benchmark, e é bem mais barato que migrar primeiro e descobrir depois…

Até o próximo post!

Perguntas frequentes

O Fugu Max tem interface compatível com o Claude Code?

A Sakana anunciou uma interface compatível com Claude Code para o Fugu, junto do lançamento do Fugu Ultra v1.1. O detalhe de compatibilidade foi divulgado nesse contexto específico, então vale checar a documentação da Sakana antes de assumir que todo recurso do Claude Code funciona igual na variante Max.

O Fugu Max é mais barato que o Claude Sonnet 5 e o GPT 5.6 Terra?

Segundo a própria Sakana, o preço de saída do Fugu Max é de 40% a 60% menor que o de Sonnet 5, GPT 5.6 Terra e Kimi K3. A Sakana também o posiciona próximo dos modelos de elite com custo de 2x a 6x menor. É bom lembrar que essa comparação parte do fabricante, não de um teste independente.

Os benchmarks divulgados no lançamento do Fugu Max são confiáveis?

Os números de benchmark do lançamento são reportados pela própria Sakana e ainda não foram reproduzidos de forma independente por laboratórios terceiros. Isso não significa que estejam errados, mas é o tipo de dado que pede cautela antes de virar decisão de compra.

Como faço para usar o Fugu Max com o SDK da OpenAI?

A variante fica disponível pela API compatível com OpenAI da Sakana, usando o mesmo base_url que o Fugu Ultra v2: https://api.sakana.ai/v1. Como a interface segue o padrão do SDK da OpenAI, a troca costuma se resumir a apontar o cliente pra esse endpoint.

Qual a diferença prática entre o Fugu Max e o Fugu Ultra v2?

O Max é a variante focada em custo-desempenho, com pool ampliado de modelos abertos e especializados, saída a US$ 6,00 por milhão de tokens. O Ultra v2 mira qualidade em raciocínio multi-etapas, pesquisa autônoma e desenvolvimento full-stack, com saída a US$ 30,00 por milhão de tokens e recursos como esforço de raciocínio configurável e busca web integrada.

O NVIDIA Nemotron substitui os outros modelos do pool?

Não, o Nemotron entra como mais um especialista dentro do pool de agentes, não como substituto dos demais modelos. Seu papel declarado pela Sakana cobre três frentes: programação, uso de ferramentas (tool calling) e seguimento de instruções, enquanto o orquestrador continua decidindo dinamicamente qual modelo chamar para cada subtarefa.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares