Um laboratório conseguiria construir isto. Porque é que ainda pode não o fazer.

A TypeSafe lançou o Jev a 15 de setembro de 2026, ainda em acesso antecipado. Este texto põe o preço oficial e o relato do treino ao lado da tabela de um incumbente, e explica porque um modelo de juízo com saída gratuita choca com vender saída longa ao token.

Coautor: folkbench.com (Folkbench é uma plataforma de avaliação e seleção que se pode rever, para APIs de IA, serviços de modelos e sites relacionados. Apoia-se em informação publicada sobre o serviço, preços, disponibilidade, latência e janelas de evidência para ajudar os utilizadores a comparar e a escolher um caminho.)

Dez textos nesta série:

A 15 de setembro de 2026, a TypeSafe lançou o Jev, e ainda estava em acesso antecipado. Este é o primeiro modelo System One deles. Só faz juízos. Não se apoia em conversa fiada. O fundador, Diogo Almeida, trabalhou antes em seguimento de instruções na OpenAI, na investigação que se tornou o ChatGPT.

O próprio Jev não tem fosso técnico. Qualquer laboratório de modelos, com uma equipa pequena, conseguiria fazer a sua versão em meio mês. Tecnicamente, nada o impede.

O trabalho oficial fez, de facto, algo de novo. Construíram uma arquitetura nova. O amostrador é paralelo: uma consulta acaba o juízo, sem gerar um token atrás do outro. Construíram um método de treino à parte, chamado RLCD, aprendizagem por reforço sobre decisões calibradas. A confiança que o modelo reporta tem de alinhar com a parte das decisões posteriores que estão certas. Isso é a implementação deles. O que outra pessoa imitaria é a forma do produto: não gerar strings, e emitir probabilidades calibradas só em perguntas fechadas. A pergunta fica fixa de antemão, o modelo devolve um juízo com uma probabilidade, e o código ramifica nesse número. Meio mês imita essa forma. Não copia a investigação da TypeSafe tal como está. Quem a imita não tem de a desmontar primeiro.

Um fosso é difícil de reivindicar. Fixa a forma, e a implementação pode ser trocada por inteiro. Depois da troca, o sistema em que se liga continua a receber a mesma coisa: state à frente, um juízo atrás.

O produto de um modelo de chat é uma string. Uma string pode escrever-se muito longa, e o software que de facto precisa dessa string tem de a analisar mais uma vez. O Jev não produz strings. Sem esse trecho de texto que se pode alongar, a saída não tem uma conta que suba com o comprimento.

A tabela de preços dos incumbentes

O preço torna-o claro. A entrada do Jev é $0.042 por milhão de tokens, perto de gratuita, e a saída é gratuita. O relato oficial diz que a saída é barata demais para se medir. Também admitem que não conseguem provar que este preço não está subsidiado. A longo prazo, esperam que o preço desça, não que suba.

A tabela de preços dos incumbentes é a outra ponta. A entrada vai de $0.20 a $10 por milhão de tokens, e a saída é cerca de cinco vezes mais cara ainda. O dinheiro de um modelo de chat assenta na saída longa. Uma resposta para uma pessoa ler, e os passos que um Agent continua a executar, ambos têm de ser escritos como texto. Quando o texto é longo, o dinheiro cai do lado da saída. Mesmo que a entrada seja muito pressionada para baixo, uma escrita longa continua a ser o grosso da chamada.

Os dois lados não se encontram. Os incumbentes vendem tokens. Um modelo cuja saída é gratuita, e cuja entrada é quase gratuita, come o negócio dos tokens.

O conflito é estrutural. Quanto mais largamente se usa um modelo de juízo com saída gratuita, menos gente compra os tokens que antes queriam dizer «deixar um modelo grande classificar, encaminhar e pontuar». Um relatório de despesas confere-se com um recibo, e alguém tem de julgar se a descrição bate com a prova. Dispara um alerta de segurança, e alguém tem de julgar se esta máquina se isola já. Articulações desse género eram antes entregues inteiras a um modelo de chat, que escrevia uma razão, depois da qual a conclusão era escavada do texto. O texto escavado tem preço de saída, no escalão mais caro. Uma pergunta fechada entrega o juízo diretamente. O que é devolvido é um conjunto de probabilidades, o comprimento está fixo de antemão, e não há texto que se possa continuar a escrever para baixo. A razão pode ficar por escrever, e esse escalão de cobrança não tem onde cair.

O que o incumbente danifica é o próprio relatório. Quanto mais largamente o modelo se usa, mais depressa cai a coluna antiga. Este é um negócio que entra por baixo. O juízo barato viaja com o fluxo e substitui as pequenas decisões que antes chamavam um modelo grande. O que se substitui não é a chamada acima, a que escreve um texto longo. É a pequena decisão que tem de ser feita a meio do fluxo. As chamadas que ainda têm de ser escritas devagar ainda se podem vender. A expectativa oficial de que o próprio preço continue a descer não preenche a coluna que o incumbente perdeu.

O nome Jev vem de William Stanley Jevons. A analogia oficial é o carvão e a máquina a vapor. Depois de a máquina a vapor ter subido a eficiência de queimar carvão, o carvão não foi queimado menos. Foi queimado mais. A eficiência sobe, e o uso não encolhe. Cresce. O juízo barato chama o uso à existência. Perguntar uma vez a um modelo antes não era barato, por isso as pessoas só lhe entregavam os poucos passos mais valiosos, e escreviam o resto como regras mortas, ou olhavam elas próprias. Quando o juízo é barato o bastante para se perguntar vezes sem conta dentro do código, as perguntas que não valia a pena fazer chegam todas juntas. O que sobe é a contagem.

O uso que é chamado à existência não é o género de token que os incumbentes mais querem vender hoje. O comprimento escrito numa só chamada desce, e a saída não se cobra. Por mais alto que a contagem se empilhe, não entra na tabela que eles usam hoje, a que ganha dinheiro com saída longa.

A pessoa que define este género de modelo

A parte difícil é a pessoa.

Só quem tem ao mesmo tempo uma vista do negócio e uma vista do modelo vê articulações por todo um sistema. O que uma articulação precisa não é o que um cérebro precisa. Um cérebro precisa de um trecho de palavras que possa continuar. Uma articulação não quer palavras. Quer um resultado em que se possa ramificar. Se a probabilidade é sólida, o programa continua. Se a probabilidade está incerta, deixa-se a uma pessoa. Quem só constrói modelos vê isto com facilidade como um formato de saída. Quem só faz o negócio sente com facilidade que chamar o modelo grande mais uma vez chega. As duas vistas têm de assentar numa pessoa antes de essa pessoa definir este género de modelo. Essas pessoas são poucas. O item não aparece por si num roadmap.

Usar bem este género de modelo, uma pessoa encontra a mesma dificuldade. O instinto só consegue responder a perguntas que o instinto consegue responder. Se algo é assim, e qual de uns poucos itens fixos escolher, o instinto consegue responder. Escrever um trecho de conteúdo que não estava lá, ou pensar os passos até ao fim numa pergunta que ainda não foi enquadrada, o instinto não aguenta. Isso é trabalho de outro género de modelo. O instinto é rápido, e é barato. Quando o programa precisa de perguntar, pergunta uma vez, e o tempo e o dinheiro aguentam. Por muitas vezes que pergunte, as perguntas continuam a ser as que o instinto aguenta. Por isso fica dentro de um programa que continua a correr.

Os grandes laboratórios conseguem construí-lo. As pessoas e a capacidade de cálculo estão lá. Fechar a saída de uma string numa pergunta fechada é algo que a engenharia consegue atravessar, e isso não é o mesmo que reproduzir a investigação da TypeSafe em meio mês. O que meio mês produz é uma forma utilizável. A implementação da TypeSafe continua nas mãos deles.

Essa coluna ainda está a receber dinheiro. Quando o juízo se muda para uma pergunta fechada, e a saída se faz gratuita, a coluna perde um trecho. A parte perdida vê-se num relatório trimestral. O lugar mais à frente fica para projetos que ainda estão a escrever a saída longa. O contexto continua a crescer, os Agents correm mais uns ciclos, e o que sai a mais é exatamente o token que esta tabela de preços reconhece.

Conseguem construí-lo. Não será calendarizado à frente.

Fontes

Série