O que significa o MiMo-V2.6 ter sido “construído em público” (built in public)?

A Xiaomi lançou a série MiMo-V2.6 (Pro e Flash) com a expressão "built in public" no anúncio oficial: o pós-treino por reinforcement learning dos dois modelos foi transmitido ao vivo num dashboard público em mimo.xiaomi.com/rl, com reward, rollouts, tempo por step e custo acumulado saindo direto dos logs do treinador. Entender o MiMo-V2.6 built in public é entender que dá pra auditar custo, método e até as falhas de infra antes do modelo existir. Os pesos saíram no Hugging Face sob licença MIT, junto do relatório técnico, do framework de RL e de mais de 7.000 ambientes de tarefas.
A Xiaomi colocou no ar um painel que transmitia ao vivo o treino de dois modelos que ainda não existiam publicamente
Fala aí, beleza? A Xiaomi soltou a série MiMo-V2.6 (Pro e Flash) e o anúncio oficial não usou a palavra de sempre, usou uma expressão que muda o jogo: "Frontier intelligence, all the modalities, built in public", ou seja, inteligência de fronteira, todas as modalidades, construída publicamente
E "construída publicamente" aqui não é papo de marketing genérico, tem coisa concreta atrás: um dashboard ao vivo em mimo.xiaomi.com/rl transmitindo o pós-treino por reinforcement learning do MiMo-V2.6-Pro e do MiMo-V2.6-Flash, com métricas vindas direto dos logs do treinador
Curvas de reward, contagem de rollouts, tempo por step, custo acumulado de compute
Tudo isso antes do lançamento, enquanto o modelo ainda estava cozinhando
Bora destrinchar o que isso significa na prática, beleza?
O que a Xiaomi realmente abriu no lançamento do MiMo-V2.6
Primeiro a parte chata e importante: inventário do que existe de verdade pra você baixar hoje
Os pesos dos dois modelos foram publicados no Hugging Face sob licença MIT, nos repositórios XiaomiMiMo/MiMo-V2.6-Pro-RL e XiaomiMiMo/MiMo-V2.6-Flash-RL
MIT é a licença permissiva clássica, aquela que não te obriga a abrir o que você constrói em cima
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Dentro do próprio repositório do Pro tem o relatório técnico em PDF, o arquivo MiMo_V2_6_technical_report.pdf
Não é link pra um site de papers, é o PDF morando junto dos pesos
E o pacote aberto do lançamento vai além dos pesos:
- o relatório técnico
- mais de 7.000 ambientes de tarefas de RL
- um framework de RL ponta a ponta
- mini-harnesses componíveis
- o modelo MiMo-V2.6-Distill-Qwen-9B
Os ambientes de RL abertos cobrem quatro tipos de tarefa de agente: engenharia de software, reprodução de vulnerabilidades, trabalho intensivo em conhecimento e design/desenvolvimento web
Repara no que isso significa: não é só "toma o modelo pronto", é "toma também o campo de treino onde ele apanhou" 🙂
O dashboard ao vivo: quais métricas ficaram expostas durante o treino
Aqui mora a parte mais insana da história
O painel público começou a expor o treino de dois modelos que ainda NÃO estavam lançados, exibindo inclusive resultados de avaliação de código no meio do run, com scores de benchmark atualizados enquanto o treino rodava
A lista de métricas do dashboard inclui: custo até o momento, tokens, samples, reward ao vivo, step time, entropia e KL, comprimento de contexto, contagem de turnos, taxa de erro de infraestrutura e avaliações offline periódicas (com DeepSWE v1.1 e AutomationBench)
É bastante coisa, então vou separar em grupos pra ficar digerível:
Grupo dinheiro e escala: custo até o momento, tokens e samples
Esse trio conta quanto o treino está custando e quanta experiência o modelo já engoliu. É a régua de "deu quanto de trabalho isso aqui?"
Grupo aprendizado: reward ao vivo, entropia e KL
Reward é o quanto o modelo está acertando a tarefa. Entropia e KL são os sinais de saúde do aprendizado: mostram se o modelo ainda está explorando ou se travou num padrão só, e o quanto ele está se afastando do ponto de partida
Quando isso desanda, o run vira um modelo confiante e burro, aquele clássico
Grupo formato da tarefa: comprimento de contexto e contagem de turnos
Conta se o modelo está treinando em conversinha curta ou em tarefa longa de agente, com várias idas e vindas
Grupo infraestrutura: step time e taxa de erro de infra
Quanto tempo leva cada passo e com que frequência a máquina engasga. Isso normalmente é assunto de sala fechada, quem se interessa pelo assunto de prefill e decode em aceleradores sabe que esse tipo de número raramente aparece pro público
Grupo prova real: avaliações offline periódicas
De tempos em tempos, tira o modelo do treino e mede em benchmark de verdade. É o boletim parcial durante o semestre, não só a nota final
Erros ao vivo: o aviso de VRAM e o reinício do run do Pro
Agora o detalhe que, pra mim, é o mais estranho (no bom sentido) de tudo isso
O painel público não mostrou só curva bonita subindo, ele publicou aviso de erro e eventos do run
Um deles, literalmente: "the mimo-v2.6-pro run is restarting due to a vram issue on one node"
Traduzindo: o run do Pro reiniciou por problema de VRAM em um nó do cluster
Que é o tipo de coisa que acontece TODO dia em treino grande, todo mundo do ramo sabe, mas que ninguém publica
E é exatamente aí que o "built in public" se separa do lançamento fechado tradicional
No modelo fechado, o mundo só vê o resultado polido: post bonito, tabela de benchmark, gráfico de barras onde a barra da casa é a maior
O caminho até ali (o run que morreu, o nó que estourou memória, o step que ficou lento) fica trancado
Aqui não: a falha de infra virou item público no mesmo painel que mostrava o reward subindo
Não é altruísmo, é confiança comprada com transparência. Mas funciona, porque é bem mais difícil maquiar um processo que ficou aberto do começo ao fim
Os números que o processo aberto tornou públicos
Por causa desse processo, alguns números que normalmente morrem dentro de casa vieram a público
O pós-treino por RL custou US$ 2,62 milhões para o Pro e US$ 850 mil para o Flash
Os runs foram concluídos em menos de seis dias, com cerca de 750.000 trajetórias
Para de ler um segundo e pensa nisso: você sabe quanto custou o pós-treino por reinforcement learning do último modelo fechado que você usou?
Nem eu, hehe
E tem a ficha técnica da série:
- Pro: MoE com 1,02 trilhão de parâmetros totais e 42 bilhões ativos
- Flash: 309 bilhões de parâmetros
- ambos omnimodais (texto, imagem, vídeo e áudio), com contexto de até 1 milhão de tokens
MoE é "mixture of experts", se você não conhece: o modelo tem um monte de parâmetro no total, mas ativa só uma fatia deles a cada token
Por isso um bicho de 1,02 trilhão consegue rodar com 42 bilhões ativos por vez. É o que deixa o custo por tarefa civilizado
Ah, e um detalhe de bastidor que explica um pouco a ambição do time: segundo o South China Morning Post, quem lidera o MiMo na Xiaomi é a Luo Fuli, que veio da DeepSeek, onde foi desenvolvedora-chave do DeepSeek-V2
Onde o MiMo-V2.6-Pro aparece nas medições independentes
Processo aberto é legal, mas e o resultado? Vamos pra medição de fora da casa
Na página do modelo no Artificial Analysis, o MiMo-V2.6-Pro marca 46 no Artificial Analysis Intelligence Index, com a Xiaomi creditada como criadora
E no leaderboard vivo de pesos abertos ele aparece hoje em primeiro:
| Posição | Modelo | Intelligence Index |
|---|---|---|
| 1º | MiMo-V2.6-Pro | 46 |
| 2º | GLM-5.3 max | 45 |
| 3º | Kimi K3 max | 44 |
O custo medido pelo Artificial Analysis ficou em US$ 0,13 por tarefa do Intelligence Index, o que colocou o modelo na fronteira de Pareto entre inteligência e custo
Fronteira de Pareto, traduzindo: não tem ninguém que seja ao mesmo tempo mais inteligente E mais barato que ele naquele recorte
O que ainda é alegação do fabricante (e por que isso importa)
Agora a parte que a manchete costuma esconder, e que eu acho que é a mais importante do post
O anúncio oficial afirma que o Pro "performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks", ou seja, desempenho equiparável nesses benchmarks de agente
Isso é claim do fabricante. Ponto
Boa parte dos resultados detalhados do lançamento é vendor-reported, com várias suítes internas da própria Xiaomi, e o teste independente ainda é limitado
E tem um detalhe delicioso: na PRÓPRIA tabela da Xiaomi, o Pro aparece atrás do Claude Opus 5 em 10 de 14 avaliações compartilhadas, com as maiores diferenças em ExploitBench, Terminal-Bench 4.0 e ProgramBench
Então "on par na maioria dos benchmarks de agente" e "atrás em 10 de 14 avaliações comuns" convivem no mesmo lançamento, depende do recorte que você olha
Isso não é escândalo, é como o mercado inteiro comunica lançamento
Mas serve pra fixar uma coisa: processo aberto não é o mesmo que benchmark verificado por terceiros
São duas camadas diferentes de confiança, e misturar as duas é o erro clássico de quem lê só a thread do anúncio. Vale o mesmo ceticismo que a gente aplica em promessas de zero alucinação: a promessa é do fabricante até alguém de fora medir
O que "built in public" muda pra quem vai usar o modelo
Bom, e na sua vida, o que muda? Vou traduzir em consequências práticas
1. Dá pra auditar custo e método antes de confiar
Você não precisa acreditar no "treinamos com muito cuidado", você tem custo acumulado, tempo por step, taxa de erro de infra e o relatório técnico no mesmo repositório dos pesos
Se algo não fecha, dá pra apontar o dedo pra um número específico
2. Dá pra rodar, reproduzir e adaptar
Pesos MIT, framework de RL ponta a ponta e mais de 7.000 ambientes de tarefas: isso é material pra reproduzir pedaço do trabalho, não só pra consumir a saída
Quem trabalha com pesquisa sabe o quanto isso é raro
3. Muda a expectativa sobre mudança
Quando o processo é visível, iteração vira algo esperado, não surpresa
O oposto do modelo fechado, onde você acorda um dia e o comportamento do endpoint mudou e ninguém te explica nada
4. E o limite disso, que é onde muita gente escorrega
Ver o treino não substitui avaliação independente
E, principalmente, não substitui o seu teste, na sua tarefa, com o seu código
Transparência de processo te dá contexto pra decidir. Não te dá o veredito
Lançamento fechado x construído em público: o que muda na prática
| O que está em jogo | Lançamento fechado (padrão do mercado) | MiMo-V2.6 built in public |
|---|---|---|
| Quando você descobre o modelo | No dia do anúncio, pronto e embrulhado | Durante o treino, via dashboard ao vivo em mimo.xiaomi.com/rl |
| Custo do treino | Não divulgado | US$ 2,62 mi (Pro) e US$ 850 mil (Flash) no pós-treino por RL |
| Método | Descrito em alto nível, quando muito | Relatório técnico em PDF dentro do repo + framework de RL aberto |
| Falhas de infraestrutura | Ficam internas | Publicadas no painel, incluindo o reinício do Pro por problema de VRAM |
| Reprodutibilidade | Baixa, depende do que o fabricante contar | Pesos, mais de 7.000 ambientes de RL e mini-harnesses disponíveis |
| Licença | Termos de uso do provedor | MIT nos repositórios Pro-RL e Flash-RL |
| O que dá pra auditar | O resultado final e o que o marketing mostrar | Custo, tokens, reward, step time, erros de infra e avaliações offline durante o run |
Observa que do lado fechado eu não coloquei número de ninguém, porque não tem: é exatamente esse o ponto 😀
Pra quem esse tipo de abertura serve de verdade
Nem todo mundo precisa disso, e tá tudo bem. Separei por perfil:
Quem pesquisa e quer reproduzir RL
Esse é o público mais beneficiado, disparado
Framework de RL ponta a ponta, mais de 7.000 ambientes de tarefas e relatório técnico junto dos pesos é material de trabalho, não folheto
Quem constrói agentes
As quatro categorias de ambiente (engenharia de software, reprodução de vulnerabilidades, trabalho intensivo em conhecimento e design/desenvolvimento web) dizem bastante sobre onde o modelo foi treinado pra se virar
Se o seu agente vive numa dessas quatro caixas, o encaixe é natural
Quem precisa de licença permissiva
MIT resolve muita discussão jurídica interna antes dela começar
Quem só quer consumir via API e seguir a vida
Totalmente válido também! Os preços no OpenRouter estão assim:
| Modelo | Entrada (1M tokens) | Saída (1M tokens) |
|---|---|---|
| MiMo-V2.6-Pro | US$ 0,435 | US$ 0,87 |
| MiMo-V2.6-Flash | US$ 0,14 | US$ 0,28 |
| MiMo-V2.6-Pro-UltraSpeed | US$ 4,35 | US$ 8,70 |
Repara no salto do UltraSpeed: velocidade custa, e custa MUITO nesse caso
Conclusão
O dado mais novo do MiMo-V2.6 não é o número do benchmark, é o processo
Transmitir o pós-treino por RL ao vivo, com custo, reward, tempo por step e até o aviso de reinício por VRAM, é uma coisa que praticamente ninguém faz, e abre um tipo de escrutínio que lançamento fechado simplesmente não permite
Já os resultados de desempenho ainda pedem calma: boa parte é reportada pelo próprio fabricante, com suítes internas, e na tabela da própria Xiaomi o Pro fica atrás do Opus 5 em 10 de 14 avaliações comuns
O 46 no Intelligence Index do Artificial Analysis, esse sim, é medição de fora, e coloca ele na frente entre os pesos abertos
Se eu fosse te sugerir um próximo passo, seria esse: abre o MiMo_V2_6_technical_report.pdf no repositório do Hugging Face pra ver o método com seus próprios olhos, e roda o Flash via API numa tarefa real do seu dia a dia antes de pensar em migrar qualquer coisa
Ver o treino ao vivo é massa demais, mas quem decide é o seu teste…
Até o próximo post!
Perguntas frequentes
O que significa a expressão "built in public" usada no anúncio do MiMo-V2.6?
É a frase que a Xiaomi usou no post oficial de lançamento: "Frontier intelligence, all the modalities, built in public". Na prática significa que o pós-treino por reinforcement learning dos modelos rodou num dashboard público, em mimo.xiaomi.com/rl, antes mesmo do lançamento. Não é só marketing, tem métrica real exposta ao vivo, incluindo erro de infraestrutura durante o run.
O dashboard do MiMo-V2.6 ainda está disponível pra consulta?
O painel foi publicado em mimo.xiaomi.com/rl e transmitiu o pós-treino do Pro e do Flash antes do lançamento oficial. Ele exibiu reward, custo acumulado, tokens, entropia e avaliações offline (como DeepSWE v1.1 e AutomationBench) direto dos logs do treinador. Isso é o que consta no material oficial da Xiaomi sobre o processo.
Quanto custou treinar o MiMo-V2.6-Pro e o MiMo-V2.6-Flash?
O pós-treino por RL custou US$ 2,62 milhões para o Pro e US$ 850 mil para o Flash, segundo a própria Xiaomi. Os dois runs foram concluídos em menos de seis dias, somando cerca de 750.000 trajetórias. Esse número só existe publicamente porque o processo foi transparente do começo ao fim.
O MiMo-V2.6 é realmente open source ou só tem os pesos abertos?
Os pesos do Pro e do Flash estão no Hugging Face sob licença MIT, mas o pacote vai além disso. Inclui o relatório técnico, mais de 7.000 ambientes de tarefas de RL, um framework de RL ponta a ponta, mini-harnesses componíveis e o modelo MiMo-V2.6-Distill-Qwen-9B. É bem mais que o padrão de "joga o peso e sai".
Qual a diferença de tamanho entre o MiMo-V2.6-Pro e o Flash?
O Pro é um MoE com 1,02 trilhão de parâmetros totais e 42 bilhões ativos por vez. O Flash é bem mais compacto, com 309 bilhões de parâmetros. Os dois são omnimodais, cobrindo texto, imagem, vídeo e áudio, com contexto de até 1 milhão de tokens.
O MiMo-V2.6-Pro realmente empata com Claude Opus 5 e GPT-5.6 Sol?
Esse é um claim do próprio fabricante, que diz que o Pro performa em pé de igualdade com Claude Opus 5 e GPT-5.6 Sol na maioria dos benchmarks de agente. Vale notar que boa parte dos resultados detalhados é reportada pela própria Xiaomi, com suítes internas, e teste independente ainda limitado. Na tabela publicada pela própria empresa, o Pro fica atrás do Opus 5 em 10 de 14 avaliações compartilhadas.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
O que significa “ChatGPT network error” e como resolver
O “ChatGPT Network Error” é uma ocorrência frequente na rotina de muitos usuários do ChatGPT. Porém, poucos compreendem seu significado, quando esse erro surge, etc. […]

Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]

Como usar o Antigravity do Google: guia completo do zero ao primeiro app
Aprenda neste guia prático como usar o Antigravity do Google: descubra a instalação, configuração, criação de projetos com o Agent Manager e o primeiro deploy, […]
