O que é o Kimi K3 e para que serve?

Kimi K3 da Moonshot AI com arquitetura MoE de 2,8 trilhões de parâmetros voltado para código e agentes
Resposta rápida

O Kimi K3 é o novo modelo de IA da Moonshot AI (empresa chinesa), lançado em 16 de julho de 2026 e apresentado como o maior modelo de pesos abertos já feito, com cerca de 2,8 trilhões de parâmetros em arquitetura MoE e 1 milhão de tokens de contexto. Ele nasceu pra tarefas de código de longa duração, fluxos com agentes e uso de ferramentas, com compreensão visual nativa e raciocínio sempre ativo (thinking mode). Serve pra quem quer um modelo forte em programação, aberto e mais barato que os concorrentes de topo.

Fala aí, beleza? A Moonshot AI soltou um modelo que fez a internet de IA parar pra olhar

O Kimi K3 chegou como o maior modelo de pesos abertos já lançado, e não veio de brincadeira: ele entrou brigando direto com os modelos de topo americanos em tarefas de código e agentes

Se você só ouviu falar e quer entender o que é essa coisa antes de sair testando, esse post é sua porta de entrada

Bora destrinchar o que ele é, pra que serve e por que tanta gente colocou ele no radar

Quem criou o Kimi K3 e o que torna ele diferente

O Kimi K3 é o novo modelo da Moonshot AI, uma empresa chinesa

O lançamento foi em 16 de julho de 2026 (a página de promoção chegou a vazar um dia antes no Kimi Open Platform, mas o modelo mesmo saiu no dia 16)

Agora vamos ao que faz ele ser diferente, porque não é só "mais um modelo"

Ele é um MoE (Mixture-of-Experts) com cerca de 2,8 trilhões de parâmetros totais

"MoE?" É uma arquitetura onde o modelo não ativa tudo de uma vez: ele aciona só as partes (os "experts") que fazem sentido pra cada pergunta

Por baixo, ele é construído sobre o Kimi Delta Attention (KDA), um mecanismo de atenção linear híbrida, somado a uma técnica chamada Attention Residuals

Outro ponto que chama atenção é a janela de contexto: são 1 milhão de tokens (1.048.576, pra ser exato)

Isso é MUITO espaço pra ele ler um projeto inteiro, um monte de arquivos, e ainda lembrar do que rolou lá no começo da conversa

Ele também tem compreensão visual nativa, ou seja, entende imagens e dados visuais sem precisar de um modelo separado pra isso

E tem um modo de raciocínio sempre ligado, o thinking mode, que faz ele "pensar" antes de responder por padrão

Junta tudo isso (aberto, gigante, contexto enorme, multimodal) e dá pra sacar por que ele virou assunto

Para que serve o Kimi K3

Essa é a pergunta que interessa: o que dá pra fazer com ele?

Ele foi pensado pra tarefas de código de longa duração, o famoso long-horizon coding

Na prática isso significa aguentar sessões longas de engenharia sem se perder: ler um repositório, rodar os testes, interpretar as falhas, corrigir e iterar

É o tipo de trabalho que exige fôlego, não uma resposta de uma linha só

Ele também trata tool-calling e agentes como recurso de primeira classe

"Tool-calling?" É a capacidade do modelo de chamar ferramentas por conta própria: rodar um comando no terminal, consultar algo, usar uma função que você deu pra ele

Onde ele mais se destaca, segundo o que foi reportado no lançamento:

  • Frontend (montar interface, tela, layout)
  • Game dev (fazer joguinho, mecânica, tela)
  • Cenários que misturam visual e código ao mesmo tempo
  • Trabalho de conhecimento e raciocínio em geral

Então se o seu uso é sentar do lado da IA pra construir software de verdade, e não só tirar uma dúvida rápida, é aí que ele quer jogar

O Kimi K3 na prática: o teste do jogo

No vídeo abaixo eu peguei o Kimi K3, o GPT-5.6 Sol e o Fable 5 e botei os três pra brigar num projeto ambicioso gerado de uma vez, no esquema one shot

A missão era simples de descrever e difícil de entregar: fazer um jogo do zero

No teste do jogo, o resultado do K3 saiu com música e um acabamento melhor, com a tela inicial mais trabalhada mostrando a cidade

Já a versão do GPT começou sem som, com a conversa bugada e a mira sem funcionar direito

Quando olhei os tempos, o GPT terminou o jogo em 10 minutos, enquanto o Fable ainda estava trabalhando aos 20 minutos

Minha leitura no fim foi honesta: nesse teste o K3 segurou a onda e entregou um jogo mais caprichado que o do GPT

E tem dois trunfos que pesam a favor dele: é aberto e é barato

Eu defendo muito essa ideia, se liga: quando um modelo aberto e barato chega perto (ou passa) de um modelo caro e fechado num teste real, a conta começa a pesar a favor do aberto

Como acessar e quanto custa o Kimi K3

Bora pra parte prática de onde colocar a mão

Ele está disponível em vários lugares:

  • Kimi.com
  • App Kimi
  • Kimi Work
  • Kimi Code
  • API Kimi

No lançamento vieram duas variantes, cada uma pra um tipo de trabalho:

VariantePra que serve
K3 MaxChat e tarefas de agente único
K3 Swarm MaxProcessamento paralelo em larga escala (multiagente)

Se você vai usar via API, o endpoint é https://api.moonshot.ai/v1 e o model ID é kimi-k3 (na documentação do Kimi Code ele aparece como k3)

Sobre preço, esses são os valores da API por 1 milhão de tokens:

ItemPreço por 1M de tokens
Input (cache hit)US$ 0,30
Input (cache miss)US$ 3,00
OutputUS$ 15,00

Outra coisa massa: a Moonshot publica guias de integração pra harnesses de agentes de terceiros

Entre eles estão o Claude Code, o Codex, o Cline e o RooCode, além do próprio Kimi Code CLI

E o tool-calling é compatível com o schema da OpenAI, o que facilita plugar ele onde você já trabalha

Um detalhe importante de agenda: a liberação dos pesos abertos completos do K3 está marcada pra 27 de julho de 2026, junto de um relatório técnico

Ou seja, no momento em que escrevo isso os open weights completos ainda não saíram

Conclusão

O Kimi K3 é um modelo recém-nascido e ambicioso: aberto, gigante, com 1 milhão de tokens de contexto e mirando direto nas tarefas de código e agentes

No lançamento ele estreou no topo do benchmark Frontend Code Arena, à frente do Claude Fable 5

Os pesos abertos completos ainda estão por vir, e no meu teste ele mostrou serviço: entregou um jogo mais caprichado que o do GPT-5.6 Sol, e ainda com um custo bem simpático

O próximo passo é simples: testa você mesmo, pelo Kimi.com ou pela API, antes de adotar ele no seu fluxo

Faça o teste e tira sua própria conclusão

até o próximo post!

Perguntas frequentes

Como usar o Kimi K3 com o Claude Code?

A Moonshot publica guia oficial de integração do Kimi K3 com o Claude Code, junto de outros harnesses como Codex, Cline e RooCode
O tool-calling segue o schema compatível com OpenAI, então você aponta o endpoint https://api.moonshot.ai/v1, usa o model ID kimi-k3 e já encaixa onde você já trabalha sem reescrever muita coisa

Quando os pesos abertos completos do Kimi K3 vão ser liberados?

A liberação está agendada para 27 de julho de 2026, junto de um relatório técnico
No momento em que escrevo isso os open weights completos ainda não tinham saído, então vale ficar de olho nessa data se você quer rodar o modelo localmente

O que é o thinking mode do Kimi K3 e por que ele importa?

É o modo de raciocínio always-on do K3: ele já vem ligado por padrão, sem precisar de prompt especial pra ativar
Na prática isso significa que o modelo ‘pensa’ antes de responder em qualquer tarefa, não só nas que você pedir explicitamente, o que tende a melhorar a qualidade das respostas em problemas mais complexos

Qual a diferença entre Kimi K3 Max e Kimi K3 Swarm Max?

O K3 Max é pra chat e tarefas de agente único, que é o uso mais comum do dia a dia
Já o K3 Swarm Max foi pensado pra processamento paralelo em larga escala, quando você precisa de múltiplos agentes rodando ao mesmo tempo em escala real

O Kimi K3 consegue ler repositórios grandes de código de uma vez?

Ele tem 1.048.576 tokens de contexto (1 milhão), o que dá bastante espaço pra caber um projeto grande inteiro
Ele foi projetado justamente pra sessões longas de engenharia: ler repositório, rodar testes, interpretar falhas e iterar sem perder o fio da meada lá atrás

O Kimi K3 serve só para código ou para outras tarefas também?

Código e agentes são o foco principal, mas ele também tem compreensão visual nativa, ou seja, entende imagens e dados visuais sem precisar de um modelo separado pra isso
Para trabalho de conhecimento e raciocínio em geral ele também se vira bem, graças ao thinking mode sempre ativo e ao contexto de 1 milhão de tokens




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted
Inline Feedbacks
View all comments

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 473 aulas
  • 20 projetos
  • 39h 26min

Blog | Mais populares