Até onde chega, afinal, «não pode alucinar»
A TypeSafe diz que o Jev não pode alucinar. A frase só se aguenta no tipo: uma resposta não pode sair da tabela fixada de antemão. A calibração e o acerto são coisas à parte, e a avaliação de workflow alinha-se com a média do Astra e do Fable.
Coautor: folkbench.com (Folkbench é uma plataforma de avaliação e seleção que se pode rever, para APIs de IA, serviços de modelos e sites relacionados. Apoia-se em informação publicada sobre o serviço, preços, disponibilidade, latência e janelas de evidência para ajudar os utilizadores a comparar e a escolher um caminho.)
Dez textos nesta série:
- JEV - Uma articulação não precisa de um cérebro
- JEV - Porque é que um Jev que não conversa serve um Agent
- JEV - Até onde chega, afinal, «não pode alucinar»
- JEV - Sim-não, escolha e nível chegam para uma linguagem?
- JEV - Um laboratório conseguiria construir isto. Porque é que ainda pode não o fazer.
- JEV - As duas demos que eu fiz
- JEV - As pessoas recuam do meio do ciclo para a margem
- JEV - Passada essa linha, eu já não distingo quem é mais inteligente
- JEV - Algumas perguntas não lhe pertencem
- JEV - Um modelo reduzido ao essencial, uma suite e um que não fala
A TypeSafe diz que o Jev «não pode alucinar». A frase soa como se a alucinação tivesse sido proibida de um golpe. O mesmo texto estreita-a. O que escreveram é que a correspondência ao schema é uma garantia, não uma estatística, pelo que os erros de tipo podem escrever-se como 0%. Um contraexemplo chegaria para refutar isso. Dizem que é matematicamente impossível.
A única camada em que essa frase se aguenta é o tipo. O Jev abandonou a geração de strings. Devolve uma estrutura fixada de antemão, não uma passagem de texto gerada no momento. Se a probabilidade é exata, e se o juízo está certo, são duas outras questões. Se quem lê não as separar, «não escreveu prosa» ouve-se como «a resposta está correta».
Não pode sair da tabela
Há só três tipos de pergunta, e todos estão selados. Noul pergunta se uma coisa se verifica, e o que é devolvido é uma probabilidade de 0 a 1. As opções de Choice têm de ser escritas de antemão por quem chama, no máximo 255 numa tabela. O que é devolvido é a opção escolhida, com uma probabilidade em cada opção e uma confiança. Os níveis de Score também têm de ser escritos de antemão, no mínimo dois e no máximo dez. A pontuação pode cair entre dois níveis. A resposta traz ao mesmo tempo a probabilidade de cada nível e uma confiança. Essa pontuação continua a ser uma posição na escala, não um parágrafo novo.
Não pode sair da tabela de opções. O modelo também não pode, de repente, escrever um pedaço de prosa e falar até a resposta ganhar forma. A documentação diz isto em direto. O que o modelo devolve é uma distribuição sobre as opções ou os níveis que quem chama submeteu. Não devolve um valor fora dessa distribuição. O código pode usar estes valores diretamente, sem primeiro ir escavar campos num parágrafo gerado.
Os modelos de chat normalmente não entregam o trabalho assim. Entregam strings. Uma string pode ser uma resposta normal, e pode ser uma alucinação. O software ainda tem de a analisar e de a validar. Se a validação falha, o programa não a pode usar diretamente. A TypeSafe põe a segurança de tipos e a alucinação juntas, e trata a segurança de tipos como a condição mínima da automação. Se o tipo está errado no fundo de uma cadeia de chamadas, os ramos seguintes ligam-se ao sítio errado. O texto oficial também diz que os modelos atuais, por muito inteligentes que sejam, ainda alucinam, e ainda cometem erros de tipo.
Ficar dentro do tipo não impede o juízo de estar errado. Escolher o item errado numa pergunta fechada continua a ser um erro. No fluxo público do alerta de segurança, o modelo tem de escolher entre fechá-lo, entregá-lo a um analista, e contê-lo já. As três opções estão na tabela. Se o modelo escolhe a errada, o tipo continua legal.
O relato oficial não chama ao System One sempre correto. Escreveram que o pensamento System 1 dá a impressão de ser propenso ao erro. Acreditam que os modelos System One se podem tornar mais fiáveis do que as alternativas. Deixam as razões concretas para mais tarde. Essa é a direção deles. Não é «sempre correto».
Choice tem outra aresta dura. Quando as opções passam de 255, uma tabela não as comporta. Uma corrida da Wikipédia que percorre ligações tem de escolher, num passo, entre centenas ou milhares de ligações. Passam a duas etapas: pontuar de forma independente, e depois fazer uma escolha. De vez em quando abranda. Essa lentidão apareceu na demo da corrida da Wikipédia. Cardinalidade alta não é infinita. «Sem alucinação», aqui, ainda só quer dizer que não devolve uma ligação que não esteja na tabela. As opções não se podem acrescentar sem limite.
A confiança é uma questão à parte
A calibração é uma questão à parte. O relato oficial é que as respostas trazem probabilidade e confiança. Quando a confiança é mais alta, a exatidão é mais alta. Entradas parecidas devolvem respostas parecidas. Do outro lado, escrevem sobre modelos de chat. Mesmo que você peça a um deles, no prompt, que reporte uma confiança, é muitas vezes confiante demais, e instável. Se uma tarefa se faz bem 95% das vezes e o modelo não diz quais 5% o deixam incerto, essa tarefa não se pode automatizar.
A confiança em Choice e em Score não é uma frase à parte de certeza que o modelo reporte. O número calcula-se a partir da forma da distribuição. Probabilidade amontoada numa opção ou num nível, e o número é alto. Probabilidade espalhada por vários sítios, e o número é baixo. Quem chama age quando o número é alto, e entrega o caso a uma pessoa quando é baixo. Noul não junta uma confiança à parte. A probabilidade de sim ou não é ela própria o sinal. A tabela oficial de comparação escreve a probabilidade e a confiança juntas. Aplicado às três perguntas, Choice e Score têm as duas, e Noul só tem a probabilidade.
Uma confiança de 1.0 só quer dizer que a distribuição está toda assente num resultado. Descreve a forma desta resposta. Quando a distribuição está toda assente na opção errada, a confiança ainda pode ser alta. Um número grande não quer dizer que o resultado esteja certo.
Um erro de tipo não pode sair. Isso é matematicamente impossível. A calibração não tem uma garantia dessa espécie. O que o relato oficial dá é uma correspondência: confiança mais alta, exatidão mais alta. Se essa correspondência se parte, o tipo continua sem poder escapar, e a confiança já não pode ser um limiar. Portanto esta camada tem um mecanismo, e tem uma afirmação. Se os erros são menos quando o número é mais alto, e se entradas parecidas voltam com distribuições parecidas, as duas coisas têm de se ver à parte. O campo estar presente todas as vezes só quer dizer que quem chama consegue ler o número.
Certo não é o mundo
O certo e o errado têm de se separar mais uma vez. A workflow eval mede quão perto um modelo chega de uma referência dentro do mesmo fluxo. Essa referência não é uma resposta objetiva do mundo. Assumem que o código do fluxo está certo, e não discutem se os rótulos estão certos. Os rótulos de referência são a média do GPT-6 Astra e do Claude Fable 5.1. Os dois usam high thinking, e cada um responde a todas as perguntas do fluxo. Os outros modelos comparam-se no raciocínio predefinido de cada fornecedor.
O Jev aproximar-se dessa média quer dizer aproximar-se do consenso desses dois modelos. Não se pode escrever como mais verdadeiro do que os factos. Se o consenso se inclina, uma resposta colada ao consenso também se inclina. O texto oficial diz que usar a média destes dois como referência enviesa as respostas para os modelos da OpenAI e da Anthropic.
Durante a comparação, os modelos grandes são embrulhados no System One LLM adapter, que os força a emitir também decisões estruturadas, para poderem ser comparados dentro dos mesmos tipos de pergunta. O relato oficial admite que perguntar com probabilidades é normalmente mais lento e mais caro do que dar uma decisão sem probabilidades. A conclusão deles é que esta é a maneira mais exata de tirar uma decisão de um modelo grande. Essa exatidão compara-se com uma decisão que não traz probabilidades. Não quer dizer que a decisão tenha batido certo com um facto externo.
Os números de erro de tipo dos modelos grandes no gráfico vêm da OpenRouter, e estão enviesados. Consultas mais complexas podem ser encaminhadas para um modelo mais forte. O 0% do Jev não é o mesmo género de estatística. O texto oficial diz que o número deles não é um resultado empírico. A correspondência ao schema está garantida, pelo que o gráfico se pode preencher com 0%. Um lado é uma observação depois do encaminhamento. O outro lado é um número preenchido a partir de uma garantia. Não são a mesma taxa de erro.
O lado a lado com o GPT-5.6 Terra usou o raciocínio predefinido. O relato oficial escolheu esse modelo porque, segundo a leitura deles, a inteligência dele é em média a mais próxima do Jev. Na execução gravada, a única discordância é «Churn likelihood level». A visão oficial é que a pergunta é ambígua e a resposta não se pode dizer de forma limpa. Numa pergunta ambígua, uma distribuição é mais honesta do que um rótulo rígido.
«Não pode alucinar», no fim, quer dizer que não produz saída fora do tipo. É por isso que escrevem os erros de tipo como 0%. A calibração tem de ser aceite à parte, por se a confiança pode servir de limiar. Se o juízo está certo, esta avaliação de fluxo não pode dar a resposta própria do mundo. Aquilo com que se alinha é a média do Astra e do Fable.
Fontes
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://github.com/typesafe-ai/system-one-adapter-python
- https://docs.typesafe.ai/primitives/choice
- https://docs.typesafe.ai/primitives/score
- https://docs.typesafe.ai/confidence