Jev jogando Doom: o que a demo da TypeSafe AI prova sobre decidir a partir de estado estruturado?

Jev jogando Doom em demonstração da TypeSafe AI usando estado estruturado em vez de imagem da tela
Resposta rápida

O Jev jogando Doom é a demo que a TypeSafe AI usou para apresentar o Jev, primeiro modelo da classe System One, em acesso antecipado desde 15/09/2026. O modelo não enxerga a tela: recebe o estado do jogo como dado estruturado em texto e toma cerca de 10 decisões por segundo, devolvendo decisão tipada com distribuição de probabilidade e confiança, nunca texto livre. A própria empresa admite que um bot scriptado jogaria melhor: a demo prova reatividade e obediência a instruções dentro de um orçamento de latência, não skill no jogo. Custo citado: cerca de US$ 7 por hora de jogo.

Um modelo que joga Doom sem nunca olhar para a tela, tomando cerca de 10 decisões por segundo

Fala aí, beleza? A TypeSafe AI soltou o acesso antecipado do Jev em 15/09/2026, apresentado como o primeiro modelo da classe System One, e escolheu justamente o Doom pra mostrar do que ele é capaz

Só que a demo não é sobre o jogo

Ela é sobre uma pergunta bem mais chata e bem mais útil: dá pra um modelo decidir, de verdade, dentro do orçamento de tempo de um loop reativo? 🙂

Quem é o Jev e por que ele não escreve texto

Segundo a reportagem do The Register, a TypeSafe AI é liderada por Diogo Almeida, cofundador e CEO, ex-pesquisador da OpenAI e um dos coinventores do RLHF e do ChatGPT

Currículo pesado, e a aposta dele vai na contramão do que todo mundo está fazendo

O Jev não gera texto

Ele não devolve string livre, não escreve parágrafo, não te conta uma historinha sobre a decisão dele. A saída é uma decisão tipada acompanhada de distribuição de probabilidade e uma medida de confiança

Se você já bateu a cabeça tentando fazer um LLM devolver JSON válido em produção, você entende o apelo imediatamente. Aqui a estrutura não é um pedido no prompt, é o formato da saída

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Que classe é essa, System One?

É o nome que a empresa deu pra essa família de modelos, e o Jev é o primeiro modelo público deles

O treino usa uma abordagem chamada RLCD (Reinforcement Learning for Calibrated Decisions), voltada pra calibração. A ideia central do RLCD: a probabilidade declarada deve corresponder à taxa de acerto do grupo de previsões

Traduzindo: quando o modelo declara uma probabilidade, o objetivo é que, no conjunto das vezes em que ele declarou aquele mesmo valor, a taxa de acerto bata com o número que ele disse

Isso é MUITO diferente de um modelo que cospe um número de confiança porque você pediu um número de confiança no prompt

Status atual: o Jev segue em acesso antecipado com lista de espera. Não é disponibilidade geral ainda, então trate como early access mesmo

Como funciona o loop da demo: estado estruturado, decisão, tick seguinte

Agora a parte que interessa pra quem constrói software

O ciclo da demo é curto e repetitivo, e é exatamente isso que o torna interessante

  1. O estado do jogo vira texto estruturado

O Jev não enxerga a tela. A entrada é estado estruturado em texto, não pixels e não vídeo

O ponto de atenção aqui é o mais importante do post inteiro: quem escreve essa representação é você, não o modelo. O que entra no texto, e como entra, é decisão de engenharia

  1. A pergunta é feita através de uma primitiva

O modelo não recebe "me diga o que fazer" em aberto. Ele responde a uma pergunta de formato definido (as três primitivas estão na próxima seção)

Erro comum deste passo: tratar a primitiva como se fosse um prompt de chat. Não é papo, é formulário

  1. O Jev devolve a decisão tipada, com distribuição e confiança

Sai a escolha, sai a distribuição de probabilidade entre as opções e sai a medida de confiança

Ponto de atenção: a confiança só vale alguma coisa se o estado que você mandou descreve bem a situação. Representação pobre gera confiança bonita em cima de nada

  1. O jogo aplica a decisão e gera um novo estado

E aí o ciclo recomeça, cerca de 10 vezes por segundo

É aqui que o negócio aperta: qualquer latência de segundos quebra o loop inteiro. Não tem como "pensar um pouquinho" quando o próximo tick vem em 100 ms

E tem um detalhe que a própria TypeSafe faz questão de dizer: um bot scriptado jogaria Doom melhor

O objetivo da demo era outro. Era mostrar um bot reativo a diferentes representações do estado do jogo, e que segue instruções, dentro de um loop de tempo real

Sacou a diferença? Não é "a IA aprendeu a jogar Doom". É "a IA consegue reagir a um estado que muda e obedecer o que mandaram, rápido o bastante pra caber no tick"

Choice, Score e Noul: as três perguntas que o Jev responde

O Jev expõe três primitivas de pergunta, e elas cobrem uma fatia grande do que a gente realmente pergunta pra um modelo no dia a dia

Primitiva O que ela devolve Tipo de decisão que resolve Como apareceria num loop tipo Doom
Choice Escolhe 1 entre opções predefinidas, com distribuição Decisão categórica: qual caminho seguir Escolher uma ação entre as disponíveis no tick atual
Score Um valor em escala ordenada Priorização, ranqueamento, intensidade Avaliar o quão crítica está a situação naquele estado
Noul Avaliação sim/não calibrada de 0 a 1 Gate binário com grau de certeza Decidir se uma condição está satisfeita antes de agir

Repara que nenhuma das três pede texto

Essa é a mudança de cabeça. Em vez de perguntar "o que você acha que eu devo fazer?" e depois parsear a resposta, você pergunta "entre estas opções, qual?" e recebe já no formato de decisão

Velocidade e custo: os números que a TypeSafe divulgou

Atenção antes da tabela: esses números são da própria TypeSafe, divulgados no anúncio e nas avaliações internas da empresa

Não são medição independente, e eu não encontrei verificação de terceiro pros multiplicadores mais agressivos

Métrica Valor divulgado Origem
Latência ponta a ponta 70 ms a 500 ms Declarado pela empresa
Comparação com LLMs tradicionais 40x a 200x mais rápido Declarado pela empresa
Demo de tempo de resposta no site Jev 0,114 s contra 8,566 s do GPT-5.6 Terra (OpenAI) Demo do site da TypeSafe
Classificação, velocidade Até 193,6x mais rápido que Claude Sonnet 5 Avaliações da própria empresa
Classificação, custo 444,6x mais barato que Opus 5 Avaliações da própria empresa
Preço de entrada US$ 0,042 por milhão de tokens OpenRouter
Preço de saída US$ 0,00 por milhão de tokens OpenRouter
Versão e contexto Jev 1.13, janela de 32.000 tokens OpenRouter
Custo da demo do Doom Cerca de US$ 7 por hora de jogo TypeSafe

Número de fabricante é ponto de partida, nunca conclusão, e vale a mesma régua que a gente usa pra ler uma tabela de benchmark sem se enganar: olhar qual tarefa foi medida, contra quem, e quem fez a medição

Aqui a tarefa é classificação, o comparativo do site é uma pergunta única e a empresa é a autora da avaliação. Continua sendo informação útil, só não é veredito

Um detalhe que salta aos olhos: saída a US$ 0,00 por milhão de tokens

Faz sentido quando a saída é uma decisão tipada e não um texto gerado. Você não está pagando pra ele falar, está pagando pra ele decidir 😀

Traduzindo o Doom para software reativo de verdade

Agora esquece o jogo e pensa no seu backend

Cada tick do Doom equivale a cada evento entrando no seu sistema. Uma requisição, uma mensagem na fila, um webhook, um registro novo

Os casos de uso que a TypeSafe divulga pro Jev são exatamente esses:

  • Triagem e roteamento de requisições
  • Pontuação de registros
  • Checagem de saídas de IA contra tentativas de jailbreak

O exemplo de saída citado pela reportagem é um roteamento de chamado:

{"billing": 0.08, "technical": 0.85, "sales": 0.07}

Com confiança 0.82

E aqui mora a graça

Você não recebe só "é technical". Você recebe o quanto ele está espalhado entre as opções e o quanto ele confia naquilo

Isso te dá um botão que texto livre nunca deu: política de roteamento baseada em confiança

Confiança alta e distribuição concentrada? Segue automático. Confiança baixa ou distribuição espalhada entre duas categorias? Manda pro humano

A checagem contra jailbreak segue a mesma lógica, e combina bem com a primitiva Noul: é um gate binário calibrado, rodando antes de a saída chegar no usuário, com custo e latência baixos o bastante pra caber no caminho quente da requisição

Tome cuidado com uma coisa: nada disso te livra de definir bem o que entra no estado

Se a sua representação do chamado é um blob de texto bagunçado, o modelo vai devolver uma distribuição bonita em cima de uma entrada ruim. O mesmo problema do Doom

O que a demo prova e o que ela não prova

Vamos ser honestos, porque lançamento sempre vem embalado em superlativo

O que ela prova:

Que dá pra um modelo tomar decisão dentro de um orçamento de latência de tempo real, a partir de estado estruturado, e seguir instruções enquanto o estado muda embaixo dele

Isso não é pouco. Loop de 10 decisões por segundo é um território onde LLM de chat simplesmente não entra

O que ela NÃO prova:

Que o modelo é bom em Doom. A própria TypeSafe diz que um bot scriptado joga melhor, e não há métrica de desempenho dentro do jogo divulgada

Que você deveria trocar lógica determinística por modelo. Onde um if resolve, um if resolve, e custa zero

Que a calibração se sustenta sozinha. A promessa do RLCD é que a probabilidade declarada bata com a taxa de acerto, mas isso depende de a representação do estado ser boa o bastante pra decisão fazer sentido

E tem o preço: cerca de US$ 7 por hora de jogo na demo

É um sinal claro de que loop apertado tem custo. Dez chamadas por segundo, hora após hora, vira conta

Antes de sair colocando modelo em cada tick, pergunte quantas dessas decisões realmente precisam de julgamento e quantas são regra disfarçada de julgamento

O que muda para quem constrói agentes hoje

O Jev está disponível no OpenRouter sob o provedor typesafe, com o modelo jev-1.13 tendo página própria

E também está no AI Gateway da Netlify, conforme o changelog do produto

O acesso antecipado da TypeSafe segue com lista de espera, então o caminho pela waitlist continua sendo waitlist. Não tem prazo divulgado pra disponibilidade geral

Mas a mudança real não é de fornecedor, é de mentalidade

A gente se acostumou a pedir texto e depois domar o texto: parser, retry, validação de schema, prompt implorando "responda APENAS com JSON"

A proposta aqui é pedir decisão direto, com o tipo e a incerteza vindo de fábrica

Mesmo que você nunca use o Jev, essa pergunta é boa pro seu sistema hoje: quantos lugares do seu código estão pedindo uma redação quando precisavam de um voto? 🙂

Conclusão

A demo do Jev jogando Doom não é sobre o jogo, e nem sobre o tamanho do modelo

O que ela escancara é que o gargalo de um agente reativo é a representação do estado

O modelo só é tão bom quanto o retrato que você entrega a ele a cada tick. Estado bem estruturado gera decisão boa e confiança que significa alguma coisa. Estado bagunçado gera número bonito e decisão aleatória

Próximo passo que eu sugiro, e dá pra fazer sem esperar waitlist nenhuma:

Pega o seu sistema e mapeia. Quais decisões são Choice (escolher uma entre opções fechadas), quais são Score (ordenar, priorizar) e quais são Noul (passa ou não passa)

Só esse exercício já limpa muita coisa, e provavelmente vai revelar que metade delas nem precisava de modelo nenhum haha

Depois disso, aí sim, pensa em qual modelo entra…

até o próximo post!

Perguntas frequentes

Onde vejo o vídeo de Jev jogando Doom?

A demo faz parte do material de lançamento da TypeSafe AI, publicado junto com o acesso antecipado do Jev em 15/09/2026. Nela o modelo toma cerca de 10 decisões por segundo a partir de estado estruturado em texto, sem enxergar a tela do jogo.

O Jev enxerga a imagem do jogo pra jogar Doom?

Não. A entrada é estado estruturado em texto, não pixels e não vídeo. Quem monta essa representação do estado do jogo é a engenharia por trás da demo, não o modelo.

Quanto custa rodar a demo do Jev jogando Doom?

A TypeSafe citou um custo aproximado de US$ 7 por hora de jogo pra inferência da demo. Isso casa com o preço de US$ 0,042 por milhão de tokens de entrada e US$ 0,00 por milhão de tokens de saída listado no OpenRouter.

O Jev é melhor jogador de Doom que um bot comum?

Não, e a própria TypeSafe admite isso: um bot scriptado jogaria Doom melhor. O objetivo da demo era mostrar reatividade a diferentes representações de estado e obediência a instruções dentro de um loop de tempo real, não desempenho no jogo.

Como o Jev decide tão rápido dentro do jogo?

A latência declarada é de 70 ms a 500 ms de ponta a ponta, o suficiente pra caber no tick de cerca de 10 decisões por segundo da demo. Cada decisão sai já tipada, com distribuição de probabilidade e confiança, sem passar por geração de texto livre.

Dá pra testar o Jev fora da demo do Doom?

Sim, o Jev tem página de modelo própria no OpenRouter, na versão 1.13 e com janela de contexto de 32.000 tokens, como já aparece na tabela de preços acima. Já o acesso pela própria TypeSafe segue em lista de espera, sem disponibilidade geral.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares