Jev (TypeSafe AI)

Sobre

Jev é o primeiro modelo público da TypeSafe AI, lançado em early access em 15/09/2026. Inaugura uma nova classe chamada System One Models: modelos de fronteira feitos para tomar decisões rápidas e estruturadas, consumíveis diretamente por software — não para gerar texto.

  • Fundador: Diogo Almeida (ex-OpenAI, trabalhou na pesquisa de instruction following que originou o ChatGPT)
  • Proposta: funciona como uma “chamada de função com inteligência de fronteira” — estado não estruturado entra, decisões tipadas e probabilísticas saem
  • Abre mão da geração de strings em troca de velocidade, custo e ausência de alucinação/erros de tipo

Funcionamento

  • Arquitetura nova focada em automação
  • Sampler paralelo: gera todas as saídas em uma única consulta, em vez de token a token (autorregressivo)
  • RLCD (Reinforcement Learning for Calibrated Decisions): método de treino que otimiza decisões com probabilidades calibradas, em vez de preferência humana (RLHF) ou recompensas verificáveis (RLVR)
  • Saídas definidas previamente via schema (docs); o modelo não comete erros de tipo por construção
  • Toda resposta vem acompanhada de probabilidades calibradas e score de confiança
  • Entrada com ênfase em estado estruturado do programa, não em mensagens sequenciais

LLMs vs. System One (Jev)

AspectoLLMs tradicionaisJev
TreinoRLHF / RLVRRLCD
SaídaStrings (precisam de parse/validação)Valores tipados com probabilidades
SamplingSequencialParalelo
Latência3 s a 329 s70 ms a 500 ms
Custo inputUS$ 0,20 – 10 / MTokUS$ 0,042 / MTok
Custo output~5x o inputGratuito
ConfiançaTende a ser excessiva e inconsistenteCalibrada e consistente

Casos de Uso

  • Workflows com IA / “if-statements inteligentes”: classificar, rotear, pontuar, extrair e ramificar onde regras manuais são frágeis
  • Map-reduce sobre big data: transformar grandes volumes de dados em features e insights
  • Aplicações em tempo real: ~100 ms permite uso em fluxos sensíveis a UX
  • Verificação/guardrails: pontuar, julgar, detectar jailbreaks e validar prompts, raciocínios ou saídas de LLMs

Resultados Divulgados

  • Workflow evals: mesmo grafo de execução para todos os modelos, usando como referência a média de GPT-6 Astra e Claude Fable 5.1. Jev domina a fronteira de Pareto custo/qualidade — alegação de 193,6x mais rápido e 444,6x mais barato (a própria empresa considera o limite superior de ganhos reais). Detalhes em evals.typesafe.ai
  • Alucinação/type-safety: 0% de erros de schema (garantido por construção, não medido empiricamente)
  • Demo lado a lado contra GPT-5.6 Terra: concordância em quase todas as respostas
  • Demos lúdicas:
    • Doom: bot jogando com ~10 queries/s (~US$ 7/hora), sobre estado textual (não imagens)
    • Wikiracing: navegação entre páginas da Wikipedia escolhendo entre centenas/milhares de links

Limitações

  • Não gera texto livre — apenas decisões estruturadas
  • Cardinalidade máxima de 255 opções por escolha; acima disso usa um sistema em 2 etapas (scoring + escolha), com perda de velocidade
  • Serviço hospedado na Costa Oeste dos EUA (latência pode variar por região)
  • Sustentabilidade do preço ainda não comprovada (pode ser subsidiado)
  • Evals criados pela própria equipe e referência enviesada para modelos OpenAI/Anthropic — possível viés reconhecido pela empresa
  • Disponível apenas em early access (lista de espera)
  • Conteúdo baseado exclusivamente no post de lançamento; as respostas do FAQ do post não estavam acessíveis

Curiosidades

  • System One: referência a Rápido e Devagar (Daniel Kahneman) — Sistema 1 (rápido, intuitivo) vs. Sistema 2 (lento, deliberado)
  • Jev: homenagem a William Stanley Jevons (Paradoxo de Jevons) — queda no custo da inteligência deve multiplicar a demanda e os casos de uso

Referências