Jev (TypeSafe AI)
Sobre
Jev é o primeiro modelo público da TypeSafe AI, lançado em early access em 15/09/2026. Inaugura uma nova classe chamada System One Models: modelos de fronteira feitos para tomar decisões rápidas e estruturadas, consumíveis diretamente por software — não para gerar texto.
- Fundador: Diogo Almeida (ex-OpenAI, trabalhou na pesquisa de instruction following que originou o ChatGPT)
- Proposta: funciona como uma “chamada de função com inteligência de fronteira” — estado não estruturado entra, decisões tipadas e probabilísticas saem
- Abre mão da geração de strings em troca de velocidade, custo e ausência de alucinação/erros de tipo
Funcionamento
- Arquitetura nova focada em automação
- Sampler paralelo: gera todas as saídas em uma única consulta, em vez de token a token (autorregressivo)
- RLCD (Reinforcement Learning for Calibrated Decisions): método de treino que otimiza decisões com probabilidades calibradas, em vez de preferência humana (RLHF) ou recompensas verificáveis (RLVR)
- Saídas definidas previamente via schema (docs); o modelo não comete erros de tipo por construção
- Toda resposta vem acompanhada de probabilidades calibradas e score de confiança
- Entrada com ênfase em estado estruturado do programa, não em mensagens sequenciais
LLMs vs. System One (Jev)
| Aspecto | LLMs tradicionais | Jev |
|---|---|---|
| Treino | RLHF / RLVR | RLCD |
| Saída | Strings (precisam de parse/validação) | Valores tipados com probabilidades |
| Sampling | Sequencial | Paralelo |
| Latência | 3 s a 329 s | 70 ms a 500 ms |
| Custo input | US$ 0,20 – 10 / MTok | US$ 0,042 / MTok |
| Custo output | ~5x o input | Gratuito |
| Confiança | Tende a ser excessiva e inconsistente | Calibrada e consistente |
Casos de Uso
- Workflows com IA / “if-statements inteligentes”: classificar, rotear, pontuar, extrair e ramificar onde regras manuais são frágeis
- Map-reduce sobre big data: transformar grandes volumes de dados em features e insights
- Aplicações em tempo real: ~100 ms permite uso em fluxos sensíveis a UX
- Verificação/guardrails: pontuar, julgar, detectar jailbreaks e validar prompts, raciocínios ou saídas de LLMs
Resultados Divulgados
- Workflow evals: mesmo grafo de execução para todos os modelos, usando como referência a média de GPT-6 Astra e Claude Fable 5.1. Jev domina a fronteira de Pareto custo/qualidade — alegação de 193,6x mais rápido e 444,6x mais barato (a própria empresa considera o limite superior de ganhos reais). Detalhes em evals.typesafe.ai
- Alucinação/type-safety: 0% de erros de schema (garantido por construção, não medido empiricamente)
- Demo lado a lado contra GPT-5.6 Terra: concordância em quase todas as respostas
- Demos lúdicas:
- Doom: bot jogando com ~10 queries/s (~US$ 7/hora), sobre estado textual (não imagens)
- Wikiracing: navegação entre páginas da Wikipedia escolhendo entre centenas/milhares de links
Limitações
- Não gera texto livre — apenas decisões estruturadas
- Cardinalidade máxima de 255 opções por escolha; acima disso usa um sistema em 2 etapas (scoring + escolha), com perda de velocidade
- Serviço hospedado na Costa Oeste dos EUA (latência pode variar por região)
- Sustentabilidade do preço ainda não comprovada (pode ser subsidiado)
- Evals criados pela própria equipe e referência enviesada para modelos OpenAI/Anthropic — possível viés reconhecido pela empresa
- Disponível apenas em early access (lista de espera)
- Conteúdo baseado exclusivamente no post de lançamento; as respostas do FAQ do post não estavam acessíveis
Curiosidades
- System One: referência a Rápido e Devagar (Daniel Kahneman) — Sistema 1 (rápido, intuitivo) vs. Sistema 2 (lento, deliberado)
- Jev: homenagem a William Stanley Jevons (Paradoxo de Jevons) — queda no custo da inteligência deve multiplicar a demanda e os casos de uso