O que é Jev, o System One Model da TypeSafe AI?

Jev é o primeiro modelo público da TypeSafe AI e estreia a categoria System One models, anunciada em 15/09/2026. Diferente de um LLM de chat, o Jev não escreve texto: ele recebe um state e um mapa de perguntas tipadas (Noul, Choice e Score) e devolve decisões estruturadas com probabilidade e confiança entre 0 e 1, em uma única passagem paralela. A saída fica limitada ao schema que você mandou, então não tem alucinação de valor nem erro de tipo. Serve para classificação, roteamento e scoring dentro do software, não para chat ou geração de código. Input custa US$ 0,042 por milhão de tokens e output, US$ 0,00
Fala aí, beleza? Existe um modelo que não escreve absolutamente nada e mesmo assim resolve o problema
Parece contradição, né? Mas é exatamente essa a proposta do Jev, o primeiro modelo público da TypeSafe AI, anunciado em 15/09/2026 junto com a saída do stealth da empresa e com uma categoria nova que eles chamam de System One models
A ideia é simples de falar e estranha de digerir: em vez de cuspir prosa pra você ler, o modelo devolve decisão tipada com probabilidade, pronta pro seu código consumir
Este post é a página de entrada do assunto: bora definir o vocabulário (System One, typed outputs, confiança calibrada), ver como a coisa funciona de verdade e separar o que é fato do que é claim de fornecedor
O que são System One models (e por que a TypeSafe criou a categoria)
System One models não geram texto
Eles avaliam perguntas tipadas contra um state (o conteúdo ou o estado que seu programa está segurando) e devolvem resultados estruturados, sem você precisar extrair valor de dentro de um parágrafo gerado
Se você conhece aquele fluxo de pedir "responda só com JSON" pra um LLM e depois passar um parser em cima, o System One é a tentativa de matar essa etapa inteira
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Passagem paralela contra geração token a token
Aqui mora a diferença de arquitetura
Um LLM de texto é autorregressivo: ele escolhe o próximo token, olha o que escreveu, escolhe o próximo, e assim por diante até fechar a resposta
O Jev recebe o estado não estruturado do programa e devolve as decisões tipadas e probabilísticas em uma única passagem paralela, não autorregressiva
É outro jeito de gastar computação: em vez de construir uma frase pra depois você minerar um valor dela, ele já resolve a distribuição de probabilidade sobre as respostas possíveis
De onde vem o nome e quem está por trás
O nome Jev é referência ao Paradoxo de Jevons, aquela ideia de que quando uma coisa fica mais barata e eficiente, o consumo dela explode em vez de cair
Dá pra sentir o recado que a empresa quis dar, né? 😀
A TypeSafe AI saiu do stealth com US$ 40 milhões em rodada seed liderada pela DCVC
A fundação é de Diogo Almeida (ex-OpenAI, co-inventor do RLHF/ChatGPT), Erik Gafni e Sasha Sheng
Como o Jev funciona na prática: state, questions e respostas tipadas
O mecanismo é enxuto e isso é parte da graça
Seu programa manda duas coisas principais: um state, que é o conteúdo a avaliar (string ou dado estruturado), e um mapa de questions, onde as chaves são IDs escolhidos por você
Cada pergunta enxerga o mesmo state, é avaliada de forma independente e a resposta volta sob a mesma chave que você definiu
Então se você mandou uma pergunta com o ID tem_dado_sensivel, é ali que a resposta tipada dela aparece
O endpoint único
A API HTTP do System One tem um endpoint só (lembrando que o acesso pela TypeSafe ainda é por early access, então o que vem abaixo é o desenho documentado, não algo que você sai rodando hoje sem convite):
curl -X POST https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d @request.json
Se você já passou pelo processo de conectar um modelo pela chave de API em outro serviço, esse pedaço não tem mistério nenhum: header Authorization: Bearer <API_KEY>, Content-Type: application/json e bora, assim que a sua chave sair da fila do early access
Os três campos de topo do request
O corpo da requisição tem exatamente três campos no nível de cima: state, model e questions
{
"state": "conteúdo ou estado que você quer avaliar",
"model": "jev-latest",
"questions": {
"tem_dado_sensivel": { "...": "..." },
"categoria_do_ticket": { "...": "..." }
}
}
O identificador do modelo flagship na API é jev-latest
Repare no desenho: você faz uma chamada só carregando o state e pendura várias perguntas independentes em cima dele
Nada de montar três prompts diferentes repetindo o mesmo contexto em cada um
As três primitivas do System One: Noul, Choice e Score
A TypeSafe define três primitivas de pergunta
Todo uso do Jev nasce de uma dessas três, então vale entender uma por uma
Noul: a pergunta de sim ou não
Noul é a pergunta binária do System One
A resposta retorna a probabilidade de a resposta ser sim
É a primitiva pra perguntas do tipo "esse texto contém dado pessoal?", "essa resposta respondeu o que foi perguntado?", "esse input é spam?"
Repare que não vem um booleano seco: vem a probabilidade, e o corte é decisão sua no código
Choice: escolher uma opção do conjunto
Choice seleciona uma opção dentro de um conjunto que VOCÊ definiu
A resposta inclui a opção escolhida, uma probabilidade para cada opção e a confiança
Esse é o feijão com arroz de roteamento: escolher pra qual fila mandar um ticket, qual ferramenta o agente deve chamar, qual template usar
E como você recebe a probabilidade de cada opção, dá pra saber se a escolha foi tranquila ou se foi uma decisão apertada entre duas candidatas
Score: avaliar contra níveis ordenados
Score avalia conteúdo contra níveis ordenados e descritivos
A resposta inclui o score, uma probabilidade para cada nível e a confiança
Pensa em "qualidade da resposta: ruim, aceitável, boa, excelente", com cada nível descrito de forma clara
Ordenado é a palavra chave aqui: os níveis têm uma escada entre eles, não são rótulos soltos como no Choice
A confiança entre 0 e 1
Respostas de Choice e Score carregam um valor de confiança derivado da distribuição de probabilidade, entre 0 e 1
Ou seja: não é um número inventado à parte, é uma leitura de quão concentrada ou espalhada ficou a distribuição
Já volto nesse número mais pra frente, porque é ele que muda a forma como você escreve a lógica em volta
Por que "typed outputs" significa zero alucinação de valor
Essa é a promessa central e ela é mais forte do que parece
A saída é limitada ao schema informado: o modelo devolve distribuição sobre as opções ou os níveis que VOCÊ forneceu, nunca um valor de fora da lista
As respostas conformam aos tipos e ao JSON schema que o código espera, e por construção não há alucinação de valor nem erro de tipo
Compara com o padrão atual, que todo mundo aqui já sofreu:
- você pede JSON pro LLM de texto
- ele devolve o JSON embrulhado em “`
`json“` e mais um parágrafo simpático em volta - você faz o parse, valida o enum e descobre que ele inventou uma categoria que não existe no seu sistema
- você reprocessa, gastando token e latência de novo
No System One esse ciclo de validar e reprocessar não existe, porque a resposta nasce dentro do conjunto
É uma diferença de natureza, não de capricho de prompt
O que é confiança calibrada e como usar esse número na sua lógica
Ter probabilidade é uma coisa
Ter probabilidade calibrada é outra bem diferente
System One models são treinados para decisões calibradas, com as probabilidades otimizadas contra desfechos pra refletir incerteza de verdade
O método tem nome próprio na casa: RLCD (Reinforcement Learning for Calibrated Decisions), que faz parte de um stack com arquitetura nova e sampler paralelo
O uso prático do número
A parte que interessa pro seu código: a confiança serve pra decidir quando agir sozinho e quando escalar
O desenho fica mais ou menos assim:
- confiança alta: o software age direto, sem humano no meio
- confiança baixa: escala pra uma pessoa ou pra um modelo de raciocínio, que é caro mas resolve o caso difícil
Ou seja, você para de tratar toda decisão com o mesmo peso
O caso fácil sai barato e rápido, o caso duro sobe pro caro
Isso é MUITO diferente de olhar pra um texto gerado e tentar adivinhar se o modelo estava seguro ou apenas escrevendo bonito 🙂
Para que serve (e para que não serve) o Jev
Aqui o corte é honesto e a própria empresa faz questão de deixar claro
Os casos alvo, segundo a TypeSafe e a cobertura de imprensa:
- classificação, roteamento, scoring e ramificações dentro do software
- automação de IA
- aplicações em tempo real
- jobs de map reduce pra classificar grandes corpora
- verificação de entradas de IA
- harnesses de modelos
E o que ele não faz:
- chat
- geração de código
- qualquer coisa que exija explicação escrita
Se o seu problema pede uma resposta que um humano vai ler, o Jev não é o lugar
Se o seu problema é um if que hoje está sendo resolvido por um LLM caro que devolve prosa pra você parsear, aí sim
Jev x LLM de texto: quando cada um faz sentido
Não é substituição, é divisão de trabalho
| Critério | Jev (System One) | LLM de texto |
|---|---|---|
| Formato de saída | Decisão tipada com probabilidade | Prosa |
| Modo de geração | Passagem única paralela | Autorregressiva, token a token |
| Garantia de tipo | Saída limitada ao schema informado, sem valor fora dele | Depende de validação e reprocessamento no seu código |
| Confiança calibrada | Sim, entre 0 e 1 em Choice e Score | Não faz parte do formato da resposta |
| Custo de output | US$ 0,00 por milhão de tokens | Cobrado por token gerado |
| Tarefa indicada | Classificação, roteamento, scoring, ramificação | Chat, geração de código, explicação escrita |
O preço de input do Jev é US$ 0,042 por milhão de tokens
E o output custa US$ 0,00 por milhão, o que faz sentido quando você lembra que ele não está gerando texto pra cobrar por isso
Velocidade e desempenho: o que a TypeSafe afirma e o que dá para verificar
Agora a parte do ceticismo saudável, que é onde eu acho que o leitor de blog ganha mais
O claim oficial
A TypeSafe afirma que o Jev entrega inteligência similar à de LLMs existentes em tarefas System One, sendo duas ordens de magnitude mais rápido e mais eficiente
Dado do fornecedor, tá? Não é medição independente
Vou repetir porque é importante: duas ordens de magnitude é o que a página oficial diz, e é só isso que dá pra citar com segurança
A demo do Doom
A empresa publicou uma demo em que o Jev joga Doom, com o estado do jogo entregue como dado estruturado em texto (não imagem)
Os tempos comparados: 0,114s do Jev contra 8,566s do GPT-5.6 Terra
É uma demo boa de assistir e serve pro ponto que eles querem fazer: em loop de tempo real, esperar um modelo escrever é inviável
A pegadinha metodológica
Agora se liga nisso, porque é o detalhe que quase ninguém comenta
A metodologia de avaliação da TypeSafe não usa ground truth independente
A empresa assume um workflow correto em código e usa as predições dos modelos externos maiores e mais caros como probabilidades de referência, com todos os modelos recebendo o mesmo workflow
Traduzindo: o "gabarito" é o que os modelos grandes responderam
Isso mede concordância com os grandes, não acerto no mundo real
Não invalida o trabalho, mas muda bastante o peso do número na sua cabeça, né?
O perfil declarado do modelo
A TypeSafe mantém uma página de limitações (jaggedness) do jev-1.13, revisada em 16/09/2026
O perfil descrito lá: rápido, calibrado e bom em julgamento de senso comum
O fato de existir uma página assumindo as irregularidades do modelo já é um ponto a favor da casa
Onde acessar o Jev hoje: API, SDKs, OpenRouter e Cloudflare
O acesso pela API da própria TypeSafe é early access: tem fila de espera no site deles e os desenvolvedores estão sendo liberados aos poucos
Fora a API própria, o modelo já aparece listado em outras plataformas:
SDKs oficiais
Existem SDKs para Python e JavaScript/TypeScript
pip install "typesafe-sdk>=0.5.7"
No JS/TS, você importa o TypeSafeClient e usa o método systemOne, passando state e questions, exatamente o mesmo par conceitual do request HTTP
OpenRouter
O Jev está no OpenRouter em beta, na versão 1.13, com janela de contexto listada de 32.000 tokens
Esse é o limite de contexto do modelo: 32k tokens para o state mais a pergunta mais longa
Tome cuidado com isso na hora de desenhar o state, principalmente se você estiver mandando dado estruturado grande
Cloudflare Workers
O Jev também está na plataforma de IA da Cloudflare, como typesafe/jev, e pode ser chamado de dentro de um Worker:
const resposta = await env.AI.run('typesafe/jev', { /* ... */ })
Pra quem já roda lógica na borda, essa combinação de latência baixa com decisão tipada é bem interessante
A agent skill oficial
A TypeSafe publica uma agent skill com o contexto da API pra agentes de código
No Claude Code:
claude plugin marketplace add typesafe-ai/skills
claude plugin install typesafe@typesafe-ai
Depois é só invocar com /typesafe:typesafe-ai
Em outros agentes:
npx skills add typesafe-ai/skills --skill typesafe-ai
A instalação é local ao projeto por padrão, e -g instala global
Vale o mesmo raciocínio de sempre com agente de código: contexto bem entregue é o que separa código certo de invenção, e é a mesma lógica de fazer o Claude Code respeitar o design system do projeto em vez de sair criando componente do nada
Vale a pena entrar na fila do Jev agora?
Bora separar as coisas
Fato: o Jev devolve decisão tipada com probabilidade calibrada, a saída fica presa ao schema que você mandou, roda em passagem paralela, tem limite de 32k tokens, custa US$ 0,042 por milhão de tokens de input e US$ 0,00 de output, e já aparece no OpenRouter em beta e na plataforma de IA da Cloudflare
Promessa do fornecedor: as duas ordens de magnitude de velocidade e eficiência, com inteligência similar à de LLMs em tarefas System One, medidas por uma metodologia que usa modelos maiores como referência em vez de ground truth independente
O ganho real aparece pra quem JÁ tem classificação, roteamento ou scoring rodando em cima de LLM de texto e paga caro por isso, em token e em latência
Se o seu caso é chat ou geração de código, esquece, não é pra você
Próximo passo concreto, se ficou curioso: entra na waitlist em typesafe.ai ou testa via OpenRouter em beta
Mas antes disso faz o dever de casa mais útil de todos: abre o seu código e mapeia quais decisões hoje cabem em Noul, Choice ou Score
Se a lista sair grande, você acabou de descobrir quanto está gastando pra um modelo escrever texto que ninguém lê 😛
Até o próximo post!
Perguntas frequentes
Jev serve para gerar código ou responder perguntas em chat?
Não. Segundo a própria TypeSafe e a cobertura de imprensa, o Jev é feito pra classificação, roteamento, scoring e ramificações dentro do software. Não serve pra chat, geração de código ou qualquer coisa que exija explicação escrita.
Quanto custa usar o Jev pela API?
O preço é de US$ 0,042 por milhão de tokens de input e US$ 0,00 por milhão de tokens de output. É esse valor que entra na conta quando você soma volume de state processado pelo endpoint da TypeSafe.
Dá pra usar o Jev fora da API oficial da TypeSafe?
Dá. Enquanto a API da própria TypeSafe segue em early access, o Jev já aparece listado no OpenRouter em beta, com 32.000 tokens de contexto, e na plataforma de IA da Cloudflare, chamado dentro de Workers como o modelo typesafe/jev via env.AI.run(‘typesafe/jev’, …).
Qual é o limite de contexto do Jev?
O limite é de 32k tokens, somando o state mais a pergunta mais longa enviada dentro do mapa de questions. Isso vale pra API HTTP direta com o modelo jev-latest.
Como instalar o suporte ao Jev no Claude Code?
A TypeSafe publica uma agent skill com o contexto da API pra agentes de código, com instalação específica por produto. No Claude Code ela entra pelo marketplace de plugins da própria TypeSafe, e os comandos exatos estão na seção sobre a agent skill oficial, aqui no post.
O Jev já está disponível pra qualquer desenvolvedor usar?
Pela API da própria TypeSafe, ainda não: o acesso é early access, com fila de espera em typesafe.ai e desenvolvedores sendo liberados aos poucos. Fora esse caminho, o modelo já aparece listado no OpenRouter em beta e na plataforma de IA da Cloudflare.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Kimi K3, GLM ou DeepSeek: qual modelo barato aguenta refatorar código de verdade?
Kimi K3 vs GLM vs DeepSeek num teste real de refatoração: veja custo por token, erros e retrabalho para escolher o modelo barato certo no Claude Code.
O que é o Hy4 preview, o modelo de 770B da Tencent?
O Hy4 preview é o novo modelo da Tencent: MoE de 770B parâmetros (49B ativos), 1M de tokens de contexto e pesos abertos sob Apache 2.0. Veja o que ele faz.
O que é Ox Alpha, o modelo stealth que apareceu na OpenRouter?
Ox Alpha é o modelo stealth listado na OpenRouter em 20/08/2026, com 1M de tokens de contexto e preço zero no preview. Entenda o que se sabe até agora.
