As duas demos que eu fiz

O mesmo state de negócio passou por duas demos: perguntas fechadas feitas de uma vez, e depois parou-se uma pergunta de risco cuja confiança não subia. O lado a lado oficial com o GPT-5.6 Terra serviu só para ver qual pergunta discordava.

Coautor: folkbench.com (Folkbench é uma plataforma de avaliação e seleção que se pode rever, para APIs de IA, serviços de modelos e sites relacionados. Apoia-se em informação publicada sobre o serviço, preços, disponibilidade, latência e janelas de evidência para ajudar os utilizadores a comparar e a escolher um caminho.)

Dez textos nesta série:

Hoje eu fiz duas demos, a experimentar o Jev. Nenhuma das duas lhe pedia que conversasse. Eu meti um pedaço de state de negócio, fiz perguntas fechadas, e olhei para o que foi devolvido.

State é uma fatia do negócio, o bastante para se julgar a partir dela. Eu não a transformei numa história. Um modelo de chat, com este género de entrada, muitas vezes começa com um parágrafo de compreensão, e depois um conselho. Eu não queria conselho. Eu queria ver se ele conseguia ficar no meio de um fluxo como articulação, emitir números, e deixar o código continuar.

A primeira demo

Eu meti esse state e fiz as perguntas fechadas numa só passagem. Eu cliquei. Voltou de imediato.

O intervalo oficial é de 70 a 500 milissegundos. Eu não cronometrei, por isso não consigo dizer onde eu caí dentro do intervalo. O que eu senti foi que nunca cheguei à impaciência. Com modelos que escrevem respostas longas, eu estou habituado a deixar a janela e a ir fazer outra coisa. Desta vez eu nunca cheguei a deixar a janela. O resultado já estava na página antes de eu mudar de sítio.

Eu contei o dinheiro à parte. A saída não se cobra. A entrada é $0.042 por milhão de tokens. Quando o state é curto, o custo de entrada de uma chamada é algo que eu tenho de ir procurar na conta antes de o conseguir ver. Como articulação, é barato. Um nó assim percorre-se muitas vezes. Um modelo grande que também cobra a saída, eu começo a poupar à segunda frase. Aqui, fazer mais uma pergunta não traz esse peso.

As perguntas eram aquelas três.

Para o sim-não eu usei Noul. Eu perguntei se esta encomenda devia ser tirada do fluxo automático e dada primeiro a uma pessoa. Não responde com um «sim» ou um «não» nu. Responde com a probabilidade de «sim», entre 0 e 1. Eu olho para que extremo se cola. Se se cola a um extremo, eu trato a pergunta como assente. Se oscila no meio, a pergunta continua aberta.

Para a classificação eu usei Choice, uma escolha única. As opções e o sentido de cada uma foram escritos por mim. Eu não as empilhei em direção a 255. O teto oficial é 255, e esta pergunta não precisava dele. Itens demais, e eu próprio não os consigo ver. Com poucos itens eu consigo julgar. Peso claramente amontoado numa opção, e as outras muito finas: só esse género de primeiro lugar eu deixo entrar num ramo. Se os dois primeiros se mordem de perto, eu não aceito só porque há um primeiro lugar. Um primeiro lugar que só está um pouco acima ainda não se separou.

Para o risco eu usei Score, para ver em que nível caía. A escala do Score é de 2 a 10 níveis. Eu cortei esta pergunta dentro desse intervalo, do leve ao pesado. Eu não inventei outra escala. Devolve a probabilidade de cada nível, e uma posição ponderada por essas probabilidades. Eu não me atrevo a usar essa posição sozinha. Se a probabilidade está amontoada num nível, a posição é esse nível. Se a probabilidade se divide por dois níveis vizinhos, a posição cai no meio. A posição parece mais fina, e os dois níveis continuam lá. Eu não vou escrever esse género de posição numa condição posterior.

Não escreve uma explicação. Olhe para a probabilidade, não para uma explicação. Quando eu usava um modelo de chat para o mesmo género de juízo, a conclusão vinha embrulhada num parágrafo. Eu tinha de descascar as palavras antes de me atrever a preencher um campo, e tinha medo de tomar a cortesia por uma posição. Hoje não há essa camada de palavras. Lá dentro está o tipo e a probabilidade. O que esta demo me confirmou é que serve como articulação. Eu não tenho de acabar de ler um texto curto antes de ligar o código.

Eu tirei o compromisso da distribuição, não de uma sensação do momento. Um sim-não colado a um extremo, eu deixei passar automaticamente. Peso de categoria amontoado num item, eu deixei o código ligar. A distribuição da pergunta de risco não se juntou, e eu não a congelei nesta demo. Eu deixei-a para a seguinte.

A segunda parte a mesma coisa

A segunda demo usou o mesmo state. Eu não fui procurar um novo. Eu dividi as perguntas, para verificar a frase de que uma pessoa não tem de estar no meio de cada ciclo.

Confiança alta, eu estava pronto a dar ao código. Confiança baixa, eu guardei para olhar. Depois de experimentar, eu estava disposto a largar as altas. Sim-não colado a um extremo, e categoria amontoada de um lado, eu deixei o programa seguir por si. As altas vão diretas para um ramo. A regra está escrita no código. A confiança chega, e o programa continua. A confiança não chega, e o programa para à minha frente. Quando eu li o registo, esses ciclos altos não tinham esperado o meu assentimento. Eu não os confirmei um a um.

A baixa era a pergunta de risco. Eu não a tinha perguntado com aperto suficiente, e ao state também faltava material que pudesse separar dois níveis vizinhos. A distribuição estava espalhada, e a confiança não subia. Enquanto eu olhava, eu até queria escolher um nível por ele, para o fluxo inteiro poder acabar. Esse pensamento não se pode seguir. Uma vez espalhada, eu não quero fechá-la por ele. Se eu escolho um nível ao acaso e o escrevo, os passos seguintes vão tratar esse nível como facto. Isso sou eu a fornecer uma decisão que ele não fez, e a vesti-la de resposta já acabada.

Por isso a pergunta parou. Ficou para eu olhar, e não entrou num ramo automático. Eu não a voltei a correr para tentar a sorte. O material continuava o mesmo, e a distribuição muito provavelmente continuaria espalhada. Esta pergunta não deve ser forçada. Mais tarde eu posso engrossar o state, ou escrever os níveis como formulações que de facto fiquem separadas. Se eu lhe forço agora um nível, o que é devolvido é uma média. Se eu meto esse número num ramo, o que se segue vai tratá-lo como um risco já decidido.

Eu não escrevi «eu sinto que é mais grave» ao lado. A minha sensação não pode sobrepor-se a uma distribuição espalhada e depois ser mandada correr automaticamente. Se a distribuição se inclinasse mesmo, o peso amontoar-se-ia de um lado por si. Se não consegue amontoar-se para lá, eu não tenho legitimidade para o amontoar por ele. Eu parei a segunda demo aí.

O lado a lado oficial

Só depois das duas demos é que eu abri o exemplo lado a lado no playground oficial. Um lado é o Jev. O outro é o GPT-5.6 Terra. O Terra usou o raciocínio predefinido. Eu não estava ali para julgar quem é mais inteligente. Eu só olhei para a pergunta em que a discordância caiu.

Eu conferi-os até ao fim. Só «Churn likelihood level» diferia nos dois lados. As outras perguntas alinhavam. A própria pergunta é vaga. Quão alto pode ser o churn não é fácil de fechar num nível limpo. Quando é vaga, o que dá é uma distribuição. O outro lado, para acabar uma resposta, tem de emitir uma palavra. Eu não registei a discordância como vitória ou derrota. Dar uma distribuição é mais honesto do que forçar uma palavra. Essa palavra pode ficar dentro de uma frase que uma pessoa diz. Não pertence a um ramo que se vai executar por si.

Eu olhei para trás, para a minha própria pergunta de risco baixa. A minha e este lado a lado são do mesmo género. Não há um segundo modelo ao lado, e eu mesmo assim não devo apertar uma probabilidade espalhada até a fazer um só nível.

Não saber conversar, eu tomei primeiro como um defeito. Depois de o usar, eu não o vejo assim. Não há frase de abertura no que é devolvido. Eu não tenho de apagar uma frase de abertura. Quando eu antes escavava um juízo de uma interface de chat, eu tinha de saltar primeiro a cortesia, e também de me guardar de ele mudar de ideias mais tarde. Hoje não há texto para limpar. Para mim isso é um alívio. É menos uma coisa fácil de fazer mal.

O que eu fiz hoje são estas duas demos. O lado a lado no playground, eu só abri e olhei. Não conta como uma terceira que eu tenha feito. A primeira assentou, para mim, que pode ficar numa articulação, e que a confiança alta se pode dar ao código. Na segunda, eu parei a pergunta cuja distribuição estava espalhada, e eu não a vesti de já respondida. É rápido, e a este preço eu também acho baratas as chamadas repetidas. O que é devolvido não é um artigo. É uma distribuição.

Fontes

Série