Um modelo reduzido ao essencial, uma suite e um que não fala

DeepSeek, Kimi e Jev não são lugares num quadro geral. Um serve para empilhar throughput, outro é uma frente já feita, e o Jev fica dentro de um fluxo, emite uma probabilidade e não fala.

Coautor: folkbench.com (Folkbench é uma plataforma de avaliação e seleção que se pode rever, para APIs de IA, serviços de modelos e sites relacionados. Apoia-se em informação publicada sobre o serviço, preços, disponibilidade, latência e janelas de evidência para ajudar os utilizadores a comparar e a escolher um caminho.)

Dez textos nesta série:

O grupo da turma volta a passar quadros. Alguém atira a pontuação da DeepSeek. Alguém atira a pontuação da Kimi. Por baixo, alguém arrasta o Jev e pergunta qual dos três é mais forte. Eu olhei uma vez e saí. Eu não respondi. O que o grupo quer é um nome, e eu não tenho esse género de nome à mão. Estes três não são lugares no mesmo quadro. Force um ordenamento, e o ruído fica no grupo. Tem pouco que ver com a maneira como eu trabalho esta semana.

Eu uso-os agora por nicho, não por um quadro geral. O sucesso que eu reconheço é assim estreito: um modelo lidera no seu próprio nicho, e não tem de ser o primeiro em tudo. Passada a linha do Opus 4.5 ao 4.6, esse hábito está fixo. Eu acho que 90% dos utilizadores já não conseguem propor uma tarefa para lá do modelo. Suba a inteligência geral mais um patamar, e os meus dias quase não se mexem. Compare outra vez a inteligência geral, e eu não a consigo sentir. Se algo fala ou não, isso eu escolho todos os dias. A interface também afeta se eu consigo continuar a usá-la. O preço é mais direto. Tem de ser barato o bastante para eu me atrever a escrevê-lo num ciclo antes de eu meter o modelo no código.

Os que falam, eu uso-os à parte

A DeepSeek, para mim, é o caminho empurrado até ao extremo simples. Engenharia levada até onde der, ritmo cheio, preço cortado a meio. Eu abro-a, e não há muito na página por onde vaguear, nem uma bancada de indústria à espera. A DeepSeek põe o esforço em correr depressa e em cortar o preço. Eu atrevo-me a correr a mesma coisa mais umas voltas. Mude para uma mais cara, e eu começo a calcular se hei de poupar. Trabalho em lote de um dia para o outro, eu também lho atiro. As pessoas dormem, as chamadas continuam a correr, e com um modelo caro eu fico inquieto.

Eu uso-a para trabalho que quer throughput. Eu empurro um lote de registos para os varrer, e eu aperto rascunhos de interface para trás e para a frente, muitas voltas do mesmo género de pergunta. Eu vigio duas coisas: não encravar, e não ficar caro. O cursor gira tempo demais, ou uma volta começa a doer no dinheiro, e o pipeline parte-se por si. Também sabe escrever frases. Eu normalmente mudo-as de passagem e uso-as. Eu raramente paro para as provar. Eu também não falo de gosto com ela neste trabalho. O gosto tem de ser moído palavra a palavra. Não foi posta a este preço para uma pessoa moer frases.

Eu ponho a Kimi do outro lado. Não para provar quem é mais inteligente. A capacidade de frontend está cheia. Um pedaço longo de material entra, aparece um índice, as citações continuam lá, e a fonte pode abrir-se para se ler em confronto. Se eu montasse isso eu próprio, uma tarde ia-se. Também construiu suites especificamente para finanças e direito. As fontes de dados estão ligadas lá dentro, as competências a usar estão ali sentadas, e há uma superfície pronta quando o trabalho é entregue. Regulamentos e relatórios financeiros, eu folheio-os nessa superfície. Eu não abro uma pilha de outras páginas. Quando finanças ou direito se abrem como material longo, eu não quero construir primeiro o ambiente eu próprio. O que eu quero é sentar-me e folhear, não passar metade do tempo como o meu próprio frontend. Eu abro-a quando preciso de ler documentos longos, e quando preciso de uma bancada que já esteja lá.

O que eu aceito depois de os usar é uma coisa. Isto é um produto. Não é um modelo a ficar mais inteligente e portanto a fazer crescer um sítio de lado. De que casa os dados se ligam, e a que cláusula de um regulamento se chega, não crescem por si porque um modelo é mais inteligente. O aspeto de um relatório quando é entregue, alguém tem de fazer primeiro do fluxo uma interface. Quando a fala é rápida e barata, eu empilho chamadas, e o que eu uso é a DeepSeek. Quando eu preciso mesmo de ler material e de entregar trabalho, eu abro a frente da Kimi. Os dois sabem falar. Eu não substituo um pelo outro.

O que não fala, eu meto-o dentro do fluxo

Eu não levo o Jev a conversar. O state entra, as perguntas fechadas são feitas, e o que é devolvido é probabilidade. Que item escolher, ou em que nível cai, incluindo um sim ou não simples, o tipo tem de ser escrito fechado de antemão. Se a pergunta ainda não foi fechada, eu não o chamo. A saída é gratuita. A entrada é $0.042 por milhão de tokens. A velocidade é do género rápido, 70 a 500 milissegundos. A este preço eu atrevo-me a perguntar vezes sem conta dentro de um fluxo, sem contas de cabeça na fatura a cada pergunta. Eu trato-o como uma chamada dentro do fluxo. Eu pergunto, e eu sigo.

Metido no meu próprio fluxo como articulação. O código limpa primeiro o state, e depois atira uma pergunta fechada. A probabilidade é devolvida, e o ramo é percorrido pelo programa a seguir. Para mim trata da classificação e do encaminhamento, trata dos níveis, e trata de se este passo deve chamar uma pessoa. Depois da classificação eu continuo e pergunto em que nível cai, e depois de o nível sair eu pergunto se se chama uma pessoa. Tudo perguntas fechadas, tudo o mesmo género de chamada. Razões e explicações escritas para outra pessoa ler não são o trabalho dele. Texto que tem mesmo de ser visto por uma pessoa, eu ligo um modelo que sabe falar. Se este género de juízo é dado a um modelo que sabe conversar, muitas vezes volta como um parágrafo inteiro, com uma atitude e com um conselho. Eu tenho então de escrever outra camada, e escavar o parágrafo até um ramo. Mais uma camada na articulação, e eu não acho que valha a pena.

Eu só abri a avaliação uma vez. Dentro do workflow, os juízos dele comparam-se com o Astra e o Fable 5.1. O que se compara é a proximidade, e o custo, não uma vitória ou uma derrota no chat. Isso é outro sistema de coordenadas. Quando eu percebi isso, eu fechei a página.

Um lançamento devia dizer para quem é

A vaga do GPT-6 fez do computer use outra vez algo que as pessoas reconhecem. O modelo vai e clica ele próprio no ecrã, abre software, e acaba uma coisa no ambiente de trabalho. Havia gente a fazer isto antes. Depois de o Astra sair, operar um computador voltou a ser algo a que as pessoas conseguem apontar, já não só um extra fora da caixa de chat. Posto ao lado destes três, isso fica ainda mais assente. No momento em que um modelo é lançado, quem o lança tem de dizer com clareza para quem é.

Pessoas prontas a entregar a máquina inteira podem usar computer use. Outro grupo senta-se à frente de uma caixa de chat e quer a fala acabada. A DeepSeek e a Kimi falam as duas, mas uma é para empilhar throughput e a outra é para uma frente já feita, e esses já não são o mesmo uso. O Jev não está do lado de quem fala. O código é meu. Só é responsável por emitir uma probabilidade, para o programa a seguir poder andar. Se eu lhe fizesse uma página de chat, eu usá-lo-ia mal. No momento em que há uma caixa de chat, eu quero que escreva a razão.

Eu não vou escrever um texto chamado «quem é o mais forte em 2026». Essa frase não ajuda este ano. Os dois dentro da caixa de chat, e este que não fala, eu separei-os no uso há muito. Eu também não estou a preparar-me para escrever esse género de texto.

É assim que eu os tomo. Trabalho que quer throughput, eu dou-o à DeepSeek. Eu não me gasto num puxão sobre o estilo, e eu não quero subir para um caro. Material longo, se também vem com uma bancada já feita, eu abro a Kimi. Quando o código chega ao passo que tem de fazer um juízo — classificação e encaminhamento, um nível, e se se chama uma pessoa — eu meto aí o Jev, e eu mando-o não abrir a boca. O quadro geral que se atualize, se lhe apetece. Eu tomo-os por nicho. O lugar na tabela, eu já não olho.

Fontes

Série