Un modèle dépouillé, une suite, et un qui ne parle pas

DeepSeek, Kimi et Jev ne sont pas des rangs sur un seul tableau. L'un sert à empiler le débit, l'autre est un frontal déjà construit, et Jev se tient dans un flux, émet une probabilité, et ne parle pas.

Co-auteur : folkbench.com (Folkbench est une plateforme vérifiable d’évaluation et de sélection pour les API d’IA, les services de modèles et les sites associés. Elle s’appuie sur les informations publiées sur le service, les prix, la disponibilité, la latence et les fenêtres de preuve pour aider les utilisateurs à comparer des voies et à en choisir une.)

Dix textes dans cette série :

Le groupe de classe fait encore passer des tableaux. Quelqu'un jette le score de DeepSeek. Quelqu'un jette le score de Kimi. En dessous, quelqu'un traîne Jev dedans et demande lequel des trois est le plus fort. J'ai regardé une fois et je suis parti. Je n'ai pas répondu. Ce que le groupe veut, c'est un nom, et je n'ai pas ce genre de nom sous la main. Ces trois-là ne sont pas des rangs sur le même tableau. Forcez un classement, et le bruit reste dans le groupe. Cela a peu à voir avec la façon dont je travaille cette semaine.

Je m'en sers maintenant par niche, pas par un tableau général. Le succès que je reconnais est aussi étroit : un modèle mène dans sa propre niche, et il n'a pas à être premier en tout. Passé la ligne d'Opus 4.5 à 4.6, cette habitude est fixée. Je pense que 90% des utilisateurs ne peuvent plus poser une tâche au-delà du modèle. Levez l'intelligence générale d'un palier de plus, et mes jours bougent à peine. Comparez encore l'intelligence générale, et je ne peux pas le sentir. Qu'une chose parle ou non, cela, je le choisis chaque jour. L'interface pèse aussi sur le fait que je puisse continuer à m'en servir. Le prix est plus direct. Il doit être assez bon marché pour que j'ose l'écrire dans une boucle avant que je mette le modèle dans le code.

Ceux qui parlent, je les utilise à part

DeepSeek, pour moi, est le chemin poussé à l'extrême du simple. L'ingénierie poussée aussi loin qu'elle peut aller, le débit rempli, le prix coupé de moitié. Je l'ouvre, et il n'y a pas grand-chose sur la page où flâner, et pas d'établi de métier qui attend. DeepSeek met son effort à courir vite et à couper le prix. J'ose faire tourner la même chose plusieurs tours de plus. Passez à un plus cher, et je commence à calculer s'il faut économiser. Le travail par lots de la nuit, je le lui jette aussi. Les gens dorment, les appels tournent encore, et avec un modèle cher je me sens mal à l'aise.

Je m'en sers pour le travail qui veut du débit. Je pousse un lot de journaux à balayer, et je presse des brouillons d'interface dans les deux sens, beaucoup de tours de la même sorte de question. Je regarde deux choses : ne pas caler, et ne pas devenir cher. Le curseur tourne trop longtemps, ou un tour commence à faire mal sur l'argent, et le pipeline casse tout seul. Il peut écrire des phrases aussi. Je les change d'habitude au passage et je m'en sers. Je m'arrête rarement pour les goûter. Je ne parle pas non plus de goût avec lui sur ce travail. Le goût doit se moudre mot par mot. Il n'a pas été tarifé ainsi pour qu'une personne moule des phrases.

Je mets Kimi de l'autre côté. Pas pour prouver qui est le plus intelligent. La capacité frontale est remplie. Un long morceau de matériau entre, une table des matières apparaît, les citations sont encore là, et la source peut s'étaler pour être lue en regard. Si je montais cela moi-même, un après-midi serait parti. Il a aussi construit des suites tout exprès pour la finance et le droit. Les sources de données sont branchées dedans, les compétences à utiliser sont posées là, et il y a une surface prête quand le travail est remis. Les règlements et les rapports financiers, je les feuillette sur cette surface. Je n'ouvre pas une pile d'autres pages. Quand la finance ou le droit est étalé en long matériau, je ne veux pas d'abord construire l'environnement moi-même. Ce que je veux, c'est m'asseoir et feuilleter, pas passer la moitié du temps comme mon propre frontal. Je l'ouvre quand j'ai besoin de lire de longs documents, et quand j'ai besoin d'un établi qui est déjà là.

Ce que j'accepte après usage, c'est une chose. C'est un produit. Ce n'est pas un modèle qui devient plus intelligent et qui, pour cela, fait pousser un site à côté. De quelle maison les données se branchent, et à quelle clause d'un règlement on tourne, cela ne pousse pas tout seul parce qu'un modèle est plus intelligent. À quoi ressemble un rapport quand il est remis, quelqu'un doit d'abord faire du flux une interface. Quand la parole est rapide et bon marché, j'empile les appels, et ce dont je me sers est DeepSeek. Quand j'ai vraiment besoin de lire du matériau et de remettre le travail, j'ouvre le frontal de Kimi. Les deux peuvent parler. Je ne substitue pas l'un à l'autre.

Celui qui ne parle pas, je le pose dans le flux

Je ne prends pas Jev pour discuter. L'état entre, les questions fermées sont posées, et ce qui revient est de la probabilité. Quel élément choisir, ou sur quel niveau cela tombe, y compris un simple oui ou non, le type doit être écrit fermé d'avance. Si la question n'a pas encore été fermée, je ne l'appellerai pas. La sortie est gratuite. L'entrée est à $0.042 par million de tokens. La vitesse est du genre rapide, 70 à 500 millisecondes. À ce prix j'ose redemander encore et encore dans un seul flux, sans calcul mental de la facture à chaque question. Je le traite comme un appel dans le flux. Je demande, et je m'en vais.

Posé dans mon propre flux comme une articulation. Le code nettoie d'abord l'état, puis jette une question fermée de l'autre côté. La probabilité revient, et la branche est parcourue par le programme d'après. Pour moi il gère la classification et le routage, il gère les niveaux, et il gère si ce pas devrait appeler une personne. Après la classification je continue et je demande sur quel niveau cela tombe, et après que le niveau est sorti je demande s'il faut appeler une personne. Toutes des questions fermées, toutes le même genre d'appel. Les raisons et les explications écrites pour que quelqu'un d'autre les lise ne sont pas son travail. Le texte qui doit vraiment être vu par une personne, je branche un modèle qui sait parler. Si ce genre de jugement est donné à un modèle qui sait discuter, il revient souvent comme un paragraphe entier, avec une attitude et avec un conseil. Je dois alors écrire une autre couche, et creuser le paragraphe en une branche. Une couche de plus sur l'articulation, et je ne pense pas que cela vaille.

Je n'ai ouvert l'évaluation qu'une fois. Dans le workflow, ses jugements sont comparés à Astra et à Fable 5.1. Ce qui est comparé, c'est la proximité, et le coût, pas une victoire ou une défaite au chat. C'est un autre système de coordonnées. Une fois que j'ai compris cela, j'ai fermé la page.

Une sortie devrait dire pour qui elle est

La vague GPT-6 a fait du computer use quelque chose que les gens reconnaissent de nouveau. Le modèle va cliquer l'écran lui-même, ouvre le logiciel, et finit une chose sur le bureau. Des gens faisaient cela avant. Après la sortie d'Astra, opérer un ordinateur est redevenu quelque chose que les gens peuvent montrer du doigt, plus seulement un extra hors de la boîte de chat. Mis à côté de ces trois-là, c'est encore plus réglé. Au moment où un modèle sort, les gens qui le sortent doivent dire clairement pour qui il est.

Les personnes prêtes à remettre toute la machine peuvent se servir du computer use. Un autre groupe s'assied devant une boîte de chat et veut que la parole soit finie. DeepSeek et Kimi parlent tous les deux, mais l'un est pour empiler le débit et l'autre est pour un frontal déjà construit, et ce ne sont déjà pas le même usage. Jev n'est pas du côté de la parole. Le code est le mien. Il n'est responsable que d'émettre une probabilité, pour que le programme d'après puisse avancer. Si je lui faisais une page de chat, je m'en servirais mal. Au moment où il y a une boîte de chat, je veux qu'il écrive la raison.

Je n'écrirai pas un texte appelé « qui est le plus fort en 2026 ». Cette phrase n'aide pas cette année. Les deux dans la boîte de chat, et celui-ci qui ne parle pas, je les ai séparés à l'usage depuis longtemps. Je ne me prépare pas non plus à écrire ce genre de texte.

C'est ainsi que je les prends. Le travail qui veut du débit, je le donne à DeepSeek. Je ne me dépense pas dans un tiraillement de style, et je ne veux pas monter vers un cher. Le long matériau, s'il vient aussi avec un établi déjà construit, j'ouvre Kimi. Quand le code atteint le pas qui doit faire un jugement — classification et routage, un niveau, et s'il faut appeler une personne — je pose Jev là, et je lui fais ne pas ouvrir la bouche. Le tableau général peut se mettre à jour s'il veut. Je les prends par niche. Le rang, je ne le regarde plus.

Sources

Série