O que significa o MiMo-V2.6 ter sido “construído em público” (built in public)?

Dashboard público mostrando o treino do MiMo-V2.6 built in public com reward e custo em tempo real
Resposta rápida

A Xiaomi lançou a série MiMo-V2.6 (Pro e Flash) com a expressão "built in public" no anúncio oficial: o pós-treino por reinforcement learning dos dois modelos foi transmitido ao vivo num dashboard público em mimo.xiaomi.com/rl, com reward, rollouts, tempo por step e custo acumulado saindo direto dos logs do treinador. Entender o MiMo-V2.6 built in public é entender que dá pra auditar custo, método e até as falhas de infra antes do modelo existir. Os pesos saíram no Hugging Face sob licença MIT, junto do relatório técnico, do framework de RL e de mais de 7.000 ambientes de tarefas.

A Xiaomi colocou no ar um painel que transmitia ao vivo o treino de dois modelos que ainda não existiam publicamente

Fala aí, beleza? A Xiaomi soltou a série MiMo-V2.6 (Pro e Flash) e o anúncio oficial não usou a palavra de sempre, usou uma expressão que muda o jogo: "Frontier intelligence, all the modalities, built in public", ou seja, inteligência de fronteira, todas as modalidades, construída publicamente

E "construída publicamente" aqui não é papo de marketing genérico, tem coisa concreta atrás: um dashboard ao vivo em mimo.xiaomi.com/rl transmitindo o pós-treino por reinforcement learning do MiMo-V2.6-Pro e do MiMo-V2.6-Flash, com métricas vindas direto dos logs do treinador

Curvas de reward, contagem de rollouts, tempo por step, custo acumulado de compute

Tudo isso antes do lançamento, enquanto o modelo ainda estava cozinhando

Bora destrinchar o que isso significa na prática, beleza?

O que a Xiaomi realmente abriu no lançamento do MiMo-V2.6

Primeiro a parte chata e importante: inventário do que existe de verdade pra você baixar hoje

Os pesos dos dois modelos foram publicados no Hugging Face sob licença MIT, nos repositórios XiaomiMiMo/MiMo-V2.6-Pro-RL e XiaomiMiMo/MiMo-V2.6-Flash-RL

MIT é a licença permissiva clássica, aquela que não te obriga a abrir o que você constrói em cima

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Dentro do próprio repositório do Pro tem o relatório técnico em PDF, o arquivo MiMo_V2_6_technical_report.pdf

Não é link pra um site de papers, é o PDF morando junto dos pesos

E o pacote aberto do lançamento vai além dos pesos:

  • o relatório técnico
  • mais de 7.000 ambientes de tarefas de RL
  • um framework de RL ponta a ponta
  • mini-harnesses componíveis
  • o modelo MiMo-V2.6-Distill-Qwen-9B

Os ambientes de RL abertos cobrem quatro tipos de tarefa de agente: engenharia de software, reprodução de vulnerabilidades, trabalho intensivo em conhecimento e design/desenvolvimento web

Repara no que isso significa: não é só "toma o modelo pronto", é "toma também o campo de treino onde ele apanhou" 🙂

O dashboard ao vivo: quais métricas ficaram expostas durante o treino

Aqui mora a parte mais insana da história

O painel público começou a expor o treino de dois modelos que ainda NÃO estavam lançados, exibindo inclusive resultados de avaliação de código no meio do run, com scores de benchmark atualizados enquanto o treino rodava

A lista de métricas do dashboard inclui: custo até o momento, tokens, samples, reward ao vivo, step time, entropia e KL, comprimento de contexto, contagem de turnos, taxa de erro de infraestrutura e avaliações offline periódicas (com DeepSWE v1.1 e AutomationBench)

É bastante coisa, então vou separar em grupos pra ficar digerível:

Grupo dinheiro e escala: custo até o momento, tokens e samples

Esse trio conta quanto o treino está custando e quanta experiência o modelo já engoliu. É a régua de "deu quanto de trabalho isso aqui?"

Grupo aprendizado: reward ao vivo, entropia e KL

Reward é o quanto o modelo está acertando a tarefa. Entropia e KL são os sinais de saúde do aprendizado: mostram se o modelo ainda está explorando ou se travou num padrão só, e o quanto ele está se afastando do ponto de partida

Quando isso desanda, o run vira um modelo confiante e burro, aquele clássico

Grupo formato da tarefa: comprimento de contexto e contagem de turnos

Conta se o modelo está treinando em conversinha curta ou em tarefa longa de agente, com várias idas e vindas

Grupo infraestrutura: step time e taxa de erro de infra

Quanto tempo leva cada passo e com que frequência a máquina engasga. Isso normalmente é assunto de sala fechada, quem se interessa pelo assunto de prefill e decode em aceleradores sabe que esse tipo de número raramente aparece pro público

Grupo prova real: avaliações offline periódicas

De tempos em tempos, tira o modelo do treino e mede em benchmark de verdade. É o boletim parcial durante o semestre, não só a nota final

Erros ao vivo: o aviso de VRAM e o reinício do run do Pro

Agora o detalhe que, pra mim, é o mais estranho (no bom sentido) de tudo isso

O painel público não mostrou só curva bonita subindo, ele publicou aviso de erro e eventos do run

Um deles, literalmente: "the mimo-v2.6-pro run is restarting due to a vram issue on one node"

Traduzindo: o run do Pro reiniciou por problema de VRAM em um nó do cluster

Que é o tipo de coisa que acontece TODO dia em treino grande, todo mundo do ramo sabe, mas que ninguém publica

E é exatamente aí que o "built in public" se separa do lançamento fechado tradicional

No modelo fechado, o mundo só vê o resultado polido: post bonito, tabela de benchmark, gráfico de barras onde a barra da casa é a maior

O caminho até ali (o run que morreu, o nó que estourou memória, o step que ficou lento) fica trancado

Aqui não: a falha de infra virou item público no mesmo painel que mostrava o reward subindo

Não é altruísmo, é confiança comprada com transparência. Mas funciona, porque é bem mais difícil maquiar um processo que ficou aberto do começo ao fim

Os números que o processo aberto tornou públicos

Por causa desse processo, alguns números que normalmente morrem dentro de casa vieram a público

O pós-treino por RL custou US$ 2,62 milhões para o Pro e US$ 850 mil para o Flash

Os runs foram concluídos em menos de seis dias, com cerca de 750.000 trajetórias

Para de ler um segundo e pensa nisso: você sabe quanto custou o pós-treino por reinforcement learning do último modelo fechado que você usou?

Nem eu, hehe

E tem a ficha técnica da série:

  • Pro: MoE com 1,02 trilhão de parâmetros totais e 42 bilhões ativos
  • Flash: 309 bilhões de parâmetros
  • ambos omnimodais (texto, imagem, vídeo e áudio), com contexto de até 1 milhão de tokens

MoE é "mixture of experts", se você não conhece: o modelo tem um monte de parâmetro no total, mas ativa só uma fatia deles a cada token

Por isso um bicho de 1,02 trilhão consegue rodar com 42 bilhões ativos por vez. É o que deixa o custo por tarefa civilizado

Ah, e um detalhe de bastidor que explica um pouco a ambição do time: segundo o South China Morning Post, quem lidera o MiMo na Xiaomi é a Luo Fuli, que veio da DeepSeek, onde foi desenvolvedora-chave do DeepSeek-V2

Onde o MiMo-V2.6-Pro aparece nas medições independentes

Processo aberto é legal, mas e o resultado? Vamos pra medição de fora da casa

Na página do modelo no Artificial Analysis, o MiMo-V2.6-Pro marca 46 no Artificial Analysis Intelligence Index, com a Xiaomi creditada como criadora

E no leaderboard vivo de pesos abertos ele aparece hoje em primeiro:

Posição Modelo Intelligence Index
MiMo-V2.6-Pro 46
GLM-5.3 max 45
Kimi K3 max 44

O custo medido pelo Artificial Analysis ficou em US$ 0,13 por tarefa do Intelligence Index, o que colocou o modelo na fronteira de Pareto entre inteligência e custo

Fronteira de Pareto, traduzindo: não tem ninguém que seja ao mesmo tempo mais inteligente E mais barato que ele naquele recorte

O que ainda é alegação do fabricante (e por que isso importa)

Agora a parte que a manchete costuma esconder, e que eu acho que é a mais importante do post

O anúncio oficial afirma que o Pro "performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks", ou seja, desempenho equiparável nesses benchmarks de agente

Isso é claim do fabricante. Ponto

Boa parte dos resultados detalhados do lançamento é vendor-reported, com várias suítes internas da própria Xiaomi, e o teste independente ainda é limitado

E tem um detalhe delicioso: na PRÓPRIA tabela da Xiaomi, o Pro aparece atrás do Claude Opus 5 em 10 de 14 avaliações compartilhadas, com as maiores diferenças em ExploitBench, Terminal-Bench 4.0 e ProgramBench

Então "on par na maioria dos benchmarks de agente" e "atrás em 10 de 14 avaliações comuns" convivem no mesmo lançamento, depende do recorte que você olha

Isso não é escândalo, é como o mercado inteiro comunica lançamento

Mas serve pra fixar uma coisa: processo aberto não é o mesmo que benchmark verificado por terceiros

São duas camadas diferentes de confiança, e misturar as duas é o erro clássico de quem lê só a thread do anúncio. Vale o mesmo ceticismo que a gente aplica em promessas de zero alucinação: a promessa é do fabricante até alguém de fora medir

O que "built in public" muda pra quem vai usar o modelo

Bom, e na sua vida, o que muda? Vou traduzir em consequências práticas

1. Dá pra auditar custo e método antes de confiar

Você não precisa acreditar no "treinamos com muito cuidado", você tem custo acumulado, tempo por step, taxa de erro de infra e o relatório técnico no mesmo repositório dos pesos

Se algo não fecha, dá pra apontar o dedo pra um número específico

2. Dá pra rodar, reproduzir e adaptar

Pesos MIT, framework de RL ponta a ponta e mais de 7.000 ambientes de tarefas: isso é material pra reproduzir pedaço do trabalho, não só pra consumir a saída

Quem trabalha com pesquisa sabe o quanto isso é raro

3. Muda a expectativa sobre mudança

Quando o processo é visível, iteração vira algo esperado, não surpresa

O oposto do modelo fechado, onde você acorda um dia e o comportamento do endpoint mudou e ninguém te explica nada

4. E o limite disso, que é onde muita gente escorrega

Ver o treino não substitui avaliação independente

E, principalmente, não substitui o seu teste, na sua tarefa, com o seu código

Transparência de processo te dá contexto pra decidir. Não te dá o veredito

Lançamento fechado x construído em público: o que muda na prática

O que está em jogo Lançamento fechado (padrão do mercado) MiMo-V2.6 built in public
Quando você descobre o modelo No dia do anúncio, pronto e embrulhado Durante o treino, via dashboard ao vivo em mimo.xiaomi.com/rl
Custo do treino Não divulgado US$ 2,62 mi (Pro) e US$ 850 mil (Flash) no pós-treino por RL
Método Descrito em alto nível, quando muito Relatório técnico em PDF dentro do repo + framework de RL aberto
Falhas de infraestrutura Ficam internas Publicadas no painel, incluindo o reinício do Pro por problema de VRAM
Reprodutibilidade Baixa, depende do que o fabricante contar Pesos, mais de 7.000 ambientes de RL e mini-harnesses disponíveis
Licença Termos de uso do provedor MIT nos repositórios Pro-RL e Flash-RL
O que dá pra auditar O resultado final e o que o marketing mostrar Custo, tokens, reward, step time, erros de infra e avaliações offline durante o run

Observa que do lado fechado eu não coloquei número de ninguém, porque não tem: é exatamente esse o ponto 😀

Pra quem esse tipo de abertura serve de verdade

Nem todo mundo precisa disso, e tá tudo bem. Separei por perfil:

Quem pesquisa e quer reproduzir RL

Esse é o público mais beneficiado, disparado

Framework de RL ponta a ponta, mais de 7.000 ambientes de tarefas e relatório técnico junto dos pesos é material de trabalho, não folheto

Quem constrói agentes

As quatro categorias de ambiente (engenharia de software, reprodução de vulnerabilidades, trabalho intensivo em conhecimento e design/desenvolvimento web) dizem bastante sobre onde o modelo foi treinado pra se virar

Se o seu agente vive numa dessas quatro caixas, o encaixe é natural

Quem precisa de licença permissiva

MIT resolve muita discussão jurídica interna antes dela começar

Quem só quer consumir via API e seguir a vida

Totalmente válido também! Os preços no OpenRouter estão assim:

Modelo Entrada (1M tokens) Saída (1M tokens)
MiMo-V2.6-Pro US$ 0,435 US$ 0,87
MiMo-V2.6-Flash US$ 0,14 US$ 0,28
MiMo-V2.6-Pro-UltraSpeed US$ 4,35 US$ 8,70

Repara no salto do UltraSpeed: velocidade custa, e custa MUITO nesse caso

Conclusão

O dado mais novo do MiMo-V2.6 não é o número do benchmark, é o processo

Transmitir o pós-treino por RL ao vivo, com custo, reward, tempo por step e até o aviso de reinício por VRAM, é uma coisa que praticamente ninguém faz, e abre um tipo de escrutínio que lançamento fechado simplesmente não permite

Já os resultados de desempenho ainda pedem calma: boa parte é reportada pelo próprio fabricante, com suítes internas, e na tabela da própria Xiaomi o Pro fica atrás do Opus 5 em 10 de 14 avaliações comuns

O 46 no Intelligence Index do Artificial Analysis, esse sim, é medição de fora, e coloca ele na frente entre os pesos abertos

Se eu fosse te sugerir um próximo passo, seria esse: abre o MiMo_V2_6_technical_report.pdf no repositório do Hugging Face pra ver o método com seus próprios olhos, e roda o Flash via API numa tarefa real do seu dia a dia antes de pensar em migrar qualquer coisa

Ver o treino ao vivo é massa demais, mas quem decide é o seu teste…

Até o próximo post!

Perguntas frequentes

O que significa a expressão "built in public" usada no anúncio do MiMo-V2.6?

É a frase que a Xiaomi usou no post oficial de lançamento: "Frontier intelligence, all the modalities, built in public". Na prática significa que o pós-treino por reinforcement learning dos modelos rodou num dashboard público, em mimo.xiaomi.com/rl, antes mesmo do lançamento. Não é só marketing, tem métrica real exposta ao vivo, incluindo erro de infraestrutura durante o run.

O dashboard do MiMo-V2.6 ainda está disponível pra consulta?

O painel foi publicado em mimo.xiaomi.com/rl e transmitiu o pós-treino do Pro e do Flash antes do lançamento oficial. Ele exibiu reward, custo acumulado, tokens, entropia e avaliações offline (como DeepSWE v1.1 e AutomationBench) direto dos logs do treinador. Isso é o que consta no material oficial da Xiaomi sobre o processo.

Quanto custou treinar o MiMo-V2.6-Pro e o MiMo-V2.6-Flash?

O pós-treino por RL custou US$ 2,62 milhões para o Pro e US$ 850 mil para o Flash, segundo a própria Xiaomi. Os dois runs foram concluídos em menos de seis dias, somando cerca de 750.000 trajetórias. Esse número só existe publicamente porque o processo foi transparente do começo ao fim.

O MiMo-V2.6 é realmente open source ou só tem os pesos abertos?

Os pesos do Pro e do Flash estão no Hugging Face sob licença MIT, mas o pacote vai além disso. Inclui o relatório técnico, mais de 7.000 ambientes de tarefas de RL, um framework de RL ponta a ponta, mini-harnesses componíveis e o modelo MiMo-V2.6-Distill-Qwen-9B. É bem mais que o padrão de "joga o peso e sai".

Qual a diferença de tamanho entre o MiMo-V2.6-Pro e o Flash?

O Pro é um MoE com 1,02 trilhão de parâmetros totais e 42 bilhões ativos por vez. O Flash é bem mais compacto, com 309 bilhões de parâmetros. Os dois são omnimodais, cobrindo texto, imagem, vídeo e áudio, com contexto de até 1 milhão de tokens.

O MiMo-V2.6-Pro realmente empata com Claude Opus 5 e GPT-5.6 Sol?

Esse é um claim do próprio fabricante, que diz que o Pro performa em pé de igualdade com Claude Opus 5 e GPT-5.6 Sol na maioria dos benchmarks de agente. Vale notar que boa parte dos resultados detalhados é reportada pela própria Xiaomi, com suítes internas, e teste independente ainda limitado. Na tabela publicada pela própria empresa, o Pro fica atrás do Opus 5 em 10 de 14 avaliações compartilhadas.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares