Uma articulação não precisa de um cérebro
O Jev é o modelo System One da TypeSafe. Não escreve texto livre. Devolve uma probabilidade por cada pergunta fechada, nos nós em que as regras se esgotam e um modelo de chat seria desperdício.
Coautor: folkbench.com (Folkbench é uma plataforma de avaliação e seleção que se pode rever, para APIs de IA, serviços de modelos e sites relacionados. Apoia-se em informação publicada sobre o serviço, preços, disponibilidade, latência e janelas de evidência para ajudar os utilizadores a comparar e a escolher um caminho.)
Dez textos nesta série:
- JEV - Uma articulação não precisa de um cérebro
- JEV - Porque é que um Jev que não conversa serve um Agent
- JEV - Até onde chega, afinal, «não pode alucinar»
- JEV - Sim-não, escolha e nível chegam para uma linguagem?
- JEV - Um laboratório conseguiria construir isto. Porque é que ainda pode não o fazer.
- JEV - As duas demos que eu fiz
- JEV - As pessoas recuam do meio do ciclo para a margem
- JEV - Passada essa linha, eu já não distingo quem é mais inteligente
- JEV - Algumas perguntas não lhe pertencem
- JEV - Um modelo reduzido ao essencial, uma suite e um que não fala
Os modelos de base passaram a linha. A maioria das pessoas já não consegue propor uma tarefa que fique para lá deles. As perguntas em que você pensa, os modelos atuais na maior parte aceitam. Comparar quem conversa um pouco melhor não sustenta um produto novo. A diferença passou para a definição do produto. O Jev está definido para esta fase.
É o modelo System One da TypeSafe AI. Não gera texto livre. Você dá-lhe um state, texto ou estado de programa, mais um conjunto de perguntas fechadas. Cada pergunta é devolvida como uma distribuição de probabilidade.
Não vende chat. Vende as articulações de um sistema.
Os nós vêm em tipos. Alguns podem escrever-se como regras, e aí ficam feitos. Outros têm de ser raciocinados em aberto e ditos até ao fim a uma pessoa. Isso é trabalho de cérebro. Resta um lote no meio. As regras não o esgotam. Chamar um cérebro para isso é desperdício. A articulação assenta nesse lote.
Uma dobra chega
Quando você caminha, o joelho não pede licença ao cérebro. Chão duro, dobra um pouco. Ladeira íngreme, aguenta. Sem explicação, e sem rascunho.
Uma articulação não precisa de inteligência. Uma articulação precisa de instinto. O instinto fica acima das regras. O que se pode esgotar vai para as regras: o state coincide, toma-se esse ramo; não coincide, para. O que as regras ainda não decidem, mas para o qual uma pessoa com prática se inclina numa olhadela, vai para o instinto. Quando a razão tem de ser posta à vista, e alguém tem de ser interpelado, chame a inteligência. Não espere que uma pergunta faça ao mesmo tempo o trabalho das regras e o de um cérebro.
O Jev fica nessa camada do meio. A pergunta é fechada, e a forma da resposta também. A probabilidade pode espalhar-se. Espalhada, quer dizer que não tem a certeza. Só atribui probabilidade dentro das respostas que você lhe deu. A linha oficial sobre uma pergunta adequada é estreita: um juízo que uma pessoa que conhece o domínio faz num segundo, a olhar para o contexto. O que exige uma análise longa não cabe como uma só pergunta. Divida-a.
É o mesmo género de trabalho de um classificador geral de antes do GPT. A compreensão semântica é melhor, e é mais rápido. Lê uma frase que dá a volta, e lê uma intenção metida no estado do programa. Não o leve a conversar.
O nome oficial da posição é System One. Toma de empréstimo o System 1 do Kahneman: rápido, intuitivo. O pensamento lento que escreve os passos para uma pessoa ler não está nesta posição.
O nome vem de William Stanley Jevons. Depois de o carvão e as máquinas a vapor ficarem mais eficientes, a procura não caiu. Subiu. O uso oficial do nome diz que, quando o juízo fica barato, cresce com isso o número de nós de um sistema que precisam de um juízo.
Só estas três perguntas
Há só três tipos de pergunta.
Sim-não, chamado Noul. Uma frase que verdadeiro ou falso consegue fechar. O que é devolvido é a probabilidade de «sim», de 0 a 1. O código põe um limiar nesse número. Passada a linha, corre. Aquém da linha, para, ou entrega o caso a uma pessoa.
Escolha única, chamada Choice. As opções ficam fixas de antemão, no máximo 255. Cada opção pode seguir-se de uma frase a dizer o que significa. O que é devolvido é a distribuição inteira, mais a opção com a probabilidade mais alta. Não acrescenta nada que não esteja na lista.
Níveis ordenados, chamados Score. De 2 a 10 níveis. Ordenados do mais baixo ao mais alto, cada nível escrito como uma situação concreta. Não lhe entregue apenas um número. O ponto em que cai pode ficar entre dois níveis, e a probabilidade de cada nível continua lá. Se o negócio precisar de um inteiro, o código recolhe-o.
As três podem perguntar-se no mesmo pedido. O mesmo state, cada pergunta por si. Um sim-não não rascunha a escolha única. Que pergunta usar, e qual deixar cair, decide o código. Acrescentar perguntas quase não acrescenta tempo. O que você acrescenta são os tokens da própria pergunta. A entrada cobra-se por token. O custo extra é esse pequeno pedaço.
A amostragem não é a do chat. O relato oficial é uma arquitetura nova, amostragem em paralelo. Uma passagem recolhe todas as saídas. Não token a token. Os modelos de chat são lentos porque uma palavra espera pela seguinte, e a saída vai ficando cara pelo caminho. O Jev não cresce uma palavra de cada vez.
O método de treino chama-se RLCD, Reinforcement Learning for Calibrated Decisions. O alvo é a calibração: a confiança que reporta tem de alinhar com a frequência com que acerta de facto. «Lê-se como uma pessoa» não é o alvo.
A entrada é $0.042 por milhão de tokens. A saída é gratuita. De ponta a ponta, cerca de 70ms a 500ms. Setenta milissegundos acontece, e quinhentos milissegundos acontece. O juízo oficial sobre a inteligência vem declarado ao lado: em tarefas System One, aproximadamente o mesmo que os modelos grandes atuais, e uma a duas ordens de grandeza mais rápido. Esse «aproximadamente o mesmo» só vale para juízos fechados. Usá-lo para escrever um artigo, ou para levar uma pergunta por fechar até ao fim da conversa, não cabe nessa afirmação.
Onde as regras param
Nós com esta forma não são raros. Classificação, encaminhamento, pontuação, revisão, controlo de risco, mais os nós de juízo dentro de um Agent, todos a têm. A que fila entra um ticket, que troço de código toma o salto seguinte, quão acesa está uma reclamação, se uma frase pode passar, se uma operação parece a exceção que deve ser travada, se uma ferramenta numa bifurcação é entregue. Tudo isto se pode perguntar depressa, e tudo isto se pode fechar.
As regras conseguem comer o troço que é fácil de escrever. Quando as exceções se acumulam, as condições emaranham-se. Muda-se uma, e as do lado podem falhar com ela, de modo que mais tarde ninguém se atreve a mexer-lhes.
Há quem atire o state inteiro a um modelo que sabe conversar e lhe peça uma frase de conselho. Um modelo de chat consegue isso. O nó só precisa de uma inclinação. Você ainda tem de decompor a frase num ramo, e tentar outra vez quando isso falha. O tempo gasta-se na forma do texto.
Um cérebro é permitido. Este nó não merece recebê-lo primeiro. O Jev toma este troço. Entra uma pergunta fechada, sai uma distribuição. Se passa a linha, e se escala, escreve-se no código ao lado. Como o fluxo se move continua a ser assunto do código.
Um reembolso parte-se em três perguntas: se estão a pedir um reembolso, se o pedido é um reembolso, uma alteração de bilhete, ou só uma pergunta sobre as regras, e em que nível cai a irritação. Noul, Choice e Score, a olhar para o mesmo state. As frases escritas na política ficam com as regras. O que as regras não apanham lê-se na distribuição. A resposta ao cliente não lhe cabe escrever.
Um Agent parte-se da mesma maneira. A frase que uma pessoa acaba por ler fica para um modelo que sabe falar. Os juízos do meio não devem acordar um cérebro a cada passo. Acorde-o uma vez, e esse passo corre ao custo de um chat. Troque o juízo por uma articulação, e a resposta que sai pode ficar como está.
Para escrever, outro modelo
Não consegue escrever um artigo. Não gera texto. Ponha o tema e o tom no state, e mesmo assim só responde às perguntas fechadas que você escreveu. Se algo está fora de tema, isso consegue julgar. As frases têm de vir de outro modelo.
Não comprima uma pergunta aberta numa escolha única. «O que devemos fazer a seguir» não tem célula no Choice enquanto você não acabar de listar os caminhos. Divida primeiro. O que se pode esgotar fica com as regras. O que o instinto consegue responder, escreva-o como estas três perguntas. O que precisa de raciocínio posto à vista, e de se falar a uma pessoa até as palavras acabarem, é aí que entra a inteligência. Se não se conseguir dividir, ainda não é uma articulação.
Há quem ouça System One como uma descida de gama. Mais abaixo estão as regras. System One é o instinto acima das regras. É rápido, e não escreve uma explicação. Ainda tem de perceber o sentido, senão as regras teriam chegado. Acima disso está a inteligência. A afirmação oficial de inteligência é «aproximadamente o mesmo» em tarefas fechadas, e a de velocidade é uma a duas ordens de grandeza mais rápido. Com essa velocidade, uma chamada pode ficar dentro de um ciclo, em vez de esperar que um chat acabe.
Quando os modelos de base tiverem nivelado as tarefas que a maioria das pessoas consegue propor, um produto tem de fechar-se numa interface definida. O Jev fecha-se numa articulação. O chat não está à venda. Os nós em que as regras não se conseguem acabar, e em que chamar um cérebro seria desperdício, são o lugar dele.
Fontes
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://docs.typesafe.ai/primitives