Jev jogando Doom: o que a demo da TypeSafe AI prova sobre decidir a partir de estado estruturado?

O Jev jogando Doom é a demo que a TypeSafe AI usou para apresentar o Jev, primeiro modelo da classe System One, em acesso antecipado desde 15/09/2026. O modelo não enxerga a tela: recebe o estado do jogo como dado estruturado em texto e toma cerca de 10 decisões por segundo, devolvendo decisão tipada com distribuição de probabilidade e confiança, nunca texto livre. A própria empresa admite que um bot scriptado jogaria melhor: a demo prova reatividade e obediência a instruções dentro de um orçamento de latência, não skill no jogo. Custo citado: cerca de US$ 7 por hora de jogo.
Um modelo que joga Doom sem nunca olhar para a tela, tomando cerca de 10 decisões por segundo
Fala aí, beleza? A TypeSafe AI soltou o acesso antecipado do Jev em 15/09/2026, apresentado como o primeiro modelo da classe System One, e escolheu justamente o Doom pra mostrar do que ele é capaz
Só que a demo não é sobre o jogo
Ela é sobre uma pergunta bem mais chata e bem mais útil: dá pra um modelo decidir, de verdade, dentro do orçamento de tempo de um loop reativo? 🙂
Quem é o Jev e por que ele não escreve texto
Segundo a reportagem do The Register, a TypeSafe AI é liderada por Diogo Almeida, cofundador e CEO, ex-pesquisador da OpenAI e um dos coinventores do RLHF e do ChatGPT
Currículo pesado, e a aposta dele vai na contramão do que todo mundo está fazendo
O Jev não gera texto
Ele não devolve string livre, não escreve parágrafo, não te conta uma historinha sobre a decisão dele. A saída é uma decisão tipada acompanhada de distribuição de probabilidade e uma medida de confiança
Se você já bateu a cabeça tentando fazer um LLM devolver JSON válido em produção, você entende o apelo imediatamente. Aqui a estrutura não é um pedido no prompt, é o formato da saída
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Que classe é essa, System One?
É o nome que a empresa deu pra essa família de modelos, e o Jev é o primeiro modelo público deles
O treino usa uma abordagem chamada RLCD (Reinforcement Learning for Calibrated Decisions), voltada pra calibração. A ideia central do RLCD: a probabilidade declarada deve corresponder à taxa de acerto do grupo de previsões
Traduzindo: quando o modelo declara uma probabilidade, o objetivo é que, no conjunto das vezes em que ele declarou aquele mesmo valor, a taxa de acerto bata com o número que ele disse
Isso é MUITO diferente de um modelo que cospe um número de confiança porque você pediu um número de confiança no prompt
Status atual: o Jev segue em acesso antecipado com lista de espera. Não é disponibilidade geral ainda, então trate como early access mesmo
Como funciona o loop da demo: estado estruturado, decisão, tick seguinte
Agora a parte que interessa pra quem constrói software
O ciclo da demo é curto e repetitivo, e é exatamente isso que o torna interessante
- O estado do jogo vira texto estruturado
O Jev não enxerga a tela. A entrada é estado estruturado em texto, não pixels e não vídeo
O ponto de atenção aqui é o mais importante do post inteiro: quem escreve essa representação é você, não o modelo. O que entra no texto, e como entra, é decisão de engenharia
- A pergunta é feita através de uma primitiva
O modelo não recebe "me diga o que fazer" em aberto. Ele responde a uma pergunta de formato definido (as três primitivas estão na próxima seção)
Erro comum deste passo: tratar a primitiva como se fosse um prompt de chat. Não é papo, é formulário
- O Jev devolve a decisão tipada, com distribuição e confiança
Sai a escolha, sai a distribuição de probabilidade entre as opções e sai a medida de confiança
Ponto de atenção: a confiança só vale alguma coisa se o estado que você mandou descreve bem a situação. Representação pobre gera confiança bonita em cima de nada
- O jogo aplica a decisão e gera um novo estado
E aí o ciclo recomeça, cerca de 10 vezes por segundo
É aqui que o negócio aperta: qualquer latência de segundos quebra o loop inteiro. Não tem como "pensar um pouquinho" quando o próximo tick vem em 100 ms
E tem um detalhe que a própria TypeSafe faz questão de dizer: um bot scriptado jogaria Doom melhor
O objetivo da demo era outro. Era mostrar um bot reativo a diferentes representações do estado do jogo, e que segue instruções, dentro de um loop de tempo real
Sacou a diferença? Não é "a IA aprendeu a jogar Doom". É "a IA consegue reagir a um estado que muda e obedecer o que mandaram, rápido o bastante pra caber no tick"
Choice, Score e Noul: as três perguntas que o Jev responde
O Jev expõe três primitivas de pergunta, e elas cobrem uma fatia grande do que a gente realmente pergunta pra um modelo no dia a dia
| Primitiva | O que ela devolve | Tipo de decisão que resolve | Como apareceria num loop tipo Doom |
|---|---|---|---|
| Choice | Escolhe 1 entre opções predefinidas, com distribuição | Decisão categórica: qual caminho seguir | Escolher uma ação entre as disponíveis no tick atual |
| Score | Um valor em escala ordenada | Priorização, ranqueamento, intensidade | Avaliar o quão crítica está a situação naquele estado |
| Noul | Avaliação sim/não calibrada de 0 a 1 | Gate binário com grau de certeza | Decidir se uma condição está satisfeita antes de agir |
Repara que nenhuma das três pede texto
Essa é a mudança de cabeça. Em vez de perguntar "o que você acha que eu devo fazer?" e depois parsear a resposta, você pergunta "entre estas opções, qual?" e recebe já no formato de decisão
Velocidade e custo: os números que a TypeSafe divulgou
Atenção antes da tabela: esses números são da própria TypeSafe, divulgados no anúncio e nas avaliações internas da empresa
Não são medição independente, e eu não encontrei verificação de terceiro pros multiplicadores mais agressivos
| Métrica | Valor divulgado | Origem |
|---|---|---|
| Latência ponta a ponta | 70 ms a 500 ms | Declarado pela empresa |
| Comparação com LLMs tradicionais | 40x a 200x mais rápido | Declarado pela empresa |
| Demo de tempo de resposta no site | Jev 0,114 s contra 8,566 s do GPT-5.6 Terra (OpenAI) | Demo do site da TypeSafe |
| Classificação, velocidade | Até 193,6x mais rápido que Claude Sonnet 5 | Avaliações da própria empresa |
| Classificação, custo | 444,6x mais barato que Opus 5 | Avaliações da própria empresa |
| Preço de entrada | US$ 0,042 por milhão de tokens | OpenRouter |
| Preço de saída | US$ 0,00 por milhão de tokens | OpenRouter |
| Versão e contexto | Jev 1.13, janela de 32.000 tokens | OpenRouter |
| Custo da demo do Doom | Cerca de US$ 7 por hora de jogo | TypeSafe |
Número de fabricante é ponto de partida, nunca conclusão, e vale a mesma régua que a gente usa pra ler uma tabela de benchmark sem se enganar: olhar qual tarefa foi medida, contra quem, e quem fez a medição
Aqui a tarefa é classificação, o comparativo do site é uma pergunta única e a empresa é a autora da avaliação. Continua sendo informação útil, só não é veredito
Um detalhe que salta aos olhos: saída a US$ 0,00 por milhão de tokens
Faz sentido quando a saída é uma decisão tipada e não um texto gerado. Você não está pagando pra ele falar, está pagando pra ele decidir 😀
Traduzindo o Doom para software reativo de verdade
Agora esquece o jogo e pensa no seu backend
Cada tick do Doom equivale a cada evento entrando no seu sistema. Uma requisição, uma mensagem na fila, um webhook, um registro novo
Os casos de uso que a TypeSafe divulga pro Jev são exatamente esses:
- Triagem e roteamento de requisições
- Pontuação de registros
- Checagem de saídas de IA contra tentativas de jailbreak
O exemplo de saída citado pela reportagem é um roteamento de chamado:
{"billing": 0.08, "technical": 0.85, "sales": 0.07}
Com confiança 0.82
E aqui mora a graça
Você não recebe só "é technical". Você recebe o quanto ele está espalhado entre as opções e o quanto ele confia naquilo
Isso te dá um botão que texto livre nunca deu: política de roteamento baseada em confiança
Confiança alta e distribuição concentrada? Segue automático. Confiança baixa ou distribuição espalhada entre duas categorias? Manda pro humano
A checagem contra jailbreak segue a mesma lógica, e combina bem com a primitiva Noul: é um gate binário calibrado, rodando antes de a saída chegar no usuário, com custo e latência baixos o bastante pra caber no caminho quente da requisição
Tome cuidado com uma coisa: nada disso te livra de definir bem o que entra no estado
Se a sua representação do chamado é um blob de texto bagunçado, o modelo vai devolver uma distribuição bonita em cima de uma entrada ruim. O mesmo problema do Doom
O que a demo prova e o que ela não prova
Vamos ser honestos, porque lançamento sempre vem embalado em superlativo
O que ela prova:
Que dá pra um modelo tomar decisão dentro de um orçamento de latência de tempo real, a partir de estado estruturado, e seguir instruções enquanto o estado muda embaixo dele
Isso não é pouco. Loop de 10 decisões por segundo é um território onde LLM de chat simplesmente não entra
O que ela NÃO prova:
Que o modelo é bom em Doom. A própria TypeSafe diz que um bot scriptado joga melhor, e não há métrica de desempenho dentro do jogo divulgada
Que você deveria trocar lógica determinística por modelo. Onde um if resolve, um if resolve, e custa zero
Que a calibração se sustenta sozinha. A promessa do RLCD é que a probabilidade declarada bata com a taxa de acerto, mas isso depende de a representação do estado ser boa o bastante pra decisão fazer sentido
E tem o preço: cerca de US$ 7 por hora de jogo na demo
É um sinal claro de que loop apertado tem custo. Dez chamadas por segundo, hora após hora, vira conta
Antes de sair colocando modelo em cada tick, pergunte quantas dessas decisões realmente precisam de julgamento e quantas são regra disfarçada de julgamento
O que muda para quem constrói agentes hoje
O Jev está disponível no OpenRouter sob o provedor typesafe, com o modelo jev-1.13 tendo página própria
E também está no AI Gateway da Netlify, conforme o changelog do produto
O acesso antecipado da TypeSafe segue com lista de espera, então o caminho pela waitlist continua sendo waitlist. Não tem prazo divulgado pra disponibilidade geral
Mas a mudança real não é de fornecedor, é de mentalidade
A gente se acostumou a pedir texto e depois domar o texto: parser, retry, validação de schema, prompt implorando "responda APENAS com JSON"
A proposta aqui é pedir decisão direto, com o tipo e a incerteza vindo de fábrica
Mesmo que você nunca use o Jev, essa pergunta é boa pro seu sistema hoje: quantos lugares do seu código estão pedindo uma redação quando precisavam de um voto? 🙂
Conclusão
A demo do Jev jogando Doom não é sobre o jogo, e nem sobre o tamanho do modelo
O que ela escancara é que o gargalo de um agente reativo é a representação do estado
O modelo só é tão bom quanto o retrato que você entrega a ele a cada tick. Estado bem estruturado gera decisão boa e confiança que significa alguma coisa. Estado bagunçado gera número bonito e decisão aleatória
Próximo passo que eu sugiro, e dá pra fazer sem esperar waitlist nenhuma:
Pega o seu sistema e mapeia. Quais decisões são Choice (escolher uma entre opções fechadas), quais são Score (ordenar, priorizar) e quais são Noul (passa ou não passa)
Só esse exercício já limpa muita coisa, e provavelmente vai revelar que metade delas nem precisava de modelo nenhum haha
Depois disso, aí sim, pensa em qual modelo entra…
até o próximo post!
Perguntas frequentes
Onde vejo o vídeo de Jev jogando Doom?
A demo faz parte do material de lançamento da TypeSafe AI, publicado junto com o acesso antecipado do Jev em 15/09/2026. Nela o modelo toma cerca de 10 decisões por segundo a partir de estado estruturado em texto, sem enxergar a tela do jogo.
O Jev enxerga a imagem do jogo pra jogar Doom?
Não. A entrada é estado estruturado em texto, não pixels e não vídeo. Quem monta essa representação do estado do jogo é a engenharia por trás da demo, não o modelo.
Quanto custa rodar a demo do Jev jogando Doom?
A TypeSafe citou um custo aproximado de US$ 7 por hora de jogo pra inferência da demo. Isso casa com o preço de US$ 0,042 por milhão de tokens de entrada e US$ 0,00 por milhão de tokens de saída listado no OpenRouter.
O Jev é melhor jogador de Doom que um bot comum?
Não, e a própria TypeSafe admite isso: um bot scriptado jogaria Doom melhor. O objetivo da demo era mostrar reatividade a diferentes representações de estado e obediência a instruções dentro de um loop de tempo real, não desempenho no jogo.
Como o Jev decide tão rápido dentro do jogo?
A latência declarada é de 70 ms a 500 ms de ponta a ponta, o suficiente pra caber no tick de cerca de 10 decisões por segundo da demo. Cada decisão sai já tipada, com distribuição de probabilidade e confiança, sem passar por geração de texto livre.
Dá pra testar o Jev fora da demo do Doom?
Sim, o Jev tem página de modelo própria no OpenRouter, na versão 1.13 e com janela de contexto de 32.000 tokens, como já aparece na tabela de preços acima. Já o acesso pela própria TypeSafe segue em lista de espera, sem disponibilidade geral.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

Como montar um workflow de automação combinando decisões do Jev em código
Aprenda a montar um workflow com Jev: decisões tipadas encadeadas em código, alta confiança agindo sozinha e casos incertos escalando para revisão.

Para quem o Jev serve (e para quem não serve)?
Jev serve pra roteamento, scoring e guardrails em IA, não pra texto ou código. Veja pra quem o Jev serve e quando evitar.

Jev decide, LLM escreve: como dividir os papéis dentro de um agente de IA
Jev é o modelo que decide, não escreve: entenda como dividir papéis entre Jev e LLM dentro de um agente de IA e quando usar cada um.
