Passé cette ligne, je ne sais plus qui est le plus intelligent

La ligne est placée entre Opus 4.5 et 4.6 : la plupart des gens ne peuvent plus poser une tâche au-delà du modèle. Passé cela, ce qui peut encore se séparer est la définition du produit. Jev émet une probabilité, pas le tronçon suivant d'un chat plus intelligent.

Co-auteur : folkbench.com (Folkbench est une plateforme vérifiable d’évaluation et de sélection pour les API d’IA, les services de modèles et les sites associés. Elle s’appuie sur les informations publiées sur le service, les prix, la disponibilité, la latence et les fenêtres de preuve pour aider les utilisateurs à comparer des voies et à en choisir une.)

Dix textes dans cette série :

La compétition entre modèles de fondation en est à sa troisième année. La plupart de ceux qui sont encore à la table ont passé une ligne. La ligne n'est pas basse.

Ma définition tient en une phrase. Quatre-vingt-dix pour cent des utilisateurs ne peuvent plus poser une tâche hors de la portée d'un modèle. Le travail est encore là. Les gens n'arrêtent pas de demander. Ces demandes, les modèles peuvent les prendre. Répondre au courrier, recueillir un compte rendu, corriger une erreur, tourner une pile de matériau en quelques éléments : j'ai cessé depuis longtemps de m'en servir pour les classer. Ils se tiennent dans la ligne. Je situe ce seuil entre Opus 4.5 et 4.6. Au-dessus, cela se brouille en une seule tache.

Les deux années d'avant, je courais encore les sorties et je changeais pour comparer, sérieusement, qui était le plus fort. Cette année j'ai cessé de comparer. Les tableaux se mettent encore à jour. Le travail dans mes mains n'a pas gagné un palier de plus.

Après le changement, il ne reste qu'une sensation

Avant la ligne, je pouvais dire. Savoir si un long morceau allait se défaire, je le savais en changeant de modèle. Savoir si les conditions d'avant étaient encore là une fois les pas empilés, je pouvais le sentir dans la semaine. Après la ligne, je ne sens plus la différence de capacité. Changer de modèle ne laisse souvent qu'une impression : c'est devenu un peu mieux. Mieux en quoi, je ne peux pas le dire.

Le même genre de travail avait besoin de ma reprise le mois dernier, et ce mois-ci il passe. Les notes de réunion entrent, et les choses à faire sortent. Deux fournisseurs sortent à une ligne ou deux d'écart, et les deux me semblent utilisables. Le code, c'est pareil. Collez une erreur, et les deux peuvent donner un changement. Parfois je sens que l'un est plus net, avec un diff plus petit. Je ne peux pas montrer la mise à jour où ils se sont écartés. S'il faut choisir, je choisis le changement le plus petit. Il n'y a pas de jour au milieu que je puisse montrer en disant, à partir d'ici il savait le faire. Les incréments n'ont pas cessé d'arriver. Ils sont trop fins pour que mes jours s'en souviennent.

Alors j'ai moins changé de modèle pour cela. Qui est le plus intelligent au palier suivant, je ne peux pas le dire.

Ceux-là, je peux encore les séparer

La première chose que je peux sentir, c'est la forme de ce qu'il émet. Ce qui émet du texte, je le traite comme quelqu'un à qui parler. Je lui remets un enregistrement en désordre et je lui fais recueillir les quelques choses à faire. Je le lis une fois, je change quelques mots, et je le rejette si je ne suis pas satisfait. Cet aller-retour est familier. La voix est un autre chemin. Je lui parle, et il parle en retour. Je ne m'en sers pas beaucoup. Je l'allume pendant que je suis en route. Au moment où je dois changer des mots, je reviens au texte que je peux copier. Je reconnais cette forme.

Ce qui émet des actions est plus différent. Il opère un ordinateur et clique un flux jusqu'au bout tout seul. Je regarde ses mains. Cliquez au mauvais endroit, et si complets que soient les mots d'après, ils ne servent à rien. Il y a une autre sorte qui ne donne qu'une probabilité. Jev est de cette sorte. Il n'émet pas de texte, et il n'opère pas un ordinateur. J'ai rencontré tout cela. Je peux les séparer parce que la façon dont je reprends est différente.

Le tempérament et le goût séparent aussi les gens. Remettez le même matériau, et certains l'écrivent très plein, ajoutant une phrase au bord, de peur que je ne comprenne pas. D'autres s'arrêtent ici et laissent le jugement à une personne. Qui je garde dépend souvent de savoir si ce tempérament tient dans la main. Celui qui s'arrête au bon endroit, je le garde dans la fenêtre que j'ouvre chaque jour. Un score plus haut à côté, et je change encore rarement de fenêtre pour le score.

Le coût et la latence se sentent ensemble. Sur quel tronçon de la courbe de coût il se tient, et sur quel tronçon de la courbe de latence, deux usages suffisent à le savoir. Discuter avec une personne, je peux supporter d'attendre un peu plus. Une personne doit de toute façon faire une pause. Posez-le sur un flux qui tourne encore et encore, et l'attente devient un bouchon. Assez lent pour que j'aille me verser un verre d'eau, et il n'a sa place que dans une conversation. Assez cher pour que je n'ose pas l'appeler une fois de plus, et il ne peut pas entrer dans les pas qui sont petits et denses. S'il est bon marché, et qu'il revient vite, alors j'ose l'étaler. Si ce qui revient est un passage que je dois finir de lire, bon marché ne sert à rien. Je ne peux toujours pas le mettre dans une boucle.

Le refus est aussi une différence. Ce qu'il refuse, et comment il refuse, se montre après un moment d'usage. Certains refusent directement, en très peu de mots. Je sais que le chemin est fermé, je change la demande, et une phrase changée suffit pour continuer. Certains ne le disent pas. Ils contournent la chose et rendent un travail qui a dévié. Je penserai encore que je ne l'ai pas dit clairement, et je remoudrai un tour sur un mauvais résultat. Ce que je regarde maintenant, c'est si j'ose lui remettre ce travail la prochaine fois.

Un modèle neuf dit d'abord sa place

GPT-6 a fait reconnaître de nouveau au monde le computer use. Opérer un ordinateur a été remis au devant d'une sortie. Ce qui m'importe, ce n'est pas que les modèles savaient se servir d'une souris avant. Passé la ligne, cela n'est plus neuf. Je regardais une sortie pour un palier de hauteur de plus. Cette fois j'ai changé la question. Une société qui sort un modèle neuf doit d'abord penser à sa propre niche : pour qui il est, et en quoi il est particulièrement bon. Il n'a pas à se lever pour dire qu'il est le palier suivant, plus intelligent.

Jev est un extrême que j'ai vraiment touché récemment. Il ne concourt pas avec Opus à l'écriture. L'écriture, il ne la prend pas. Ce qu'il occupe, c'est l'articulation. Le matériau atteint le point où une décision doit se prendre, la question est fermée, et les options ont été données d'avance. Ce qui revient est une probabilité. Cela revient tout de suite. Du côté du chat, je change encore de fenêtre et j'attends. Ici je n'ai pas à changer d'écran. Le résultat est déjà revenu. Ce genre de sortie n'est pas facturé. Ce que je jette de l'autre côté n'est pas « écris-moi un paragraphe ». C'est un jugement déjà cerclé : est-ce que ce chemin passe, et à quel point c'est sûr. Après que la probabilité est revenue, ce qui reprend, c'est un programme, pas moi assis là à finir de lire puis à décider. Je n'ai pas envie de discuter avec lui. La place n'est pas réservée au chat. Les modèles de chat peuvent monter plus haut, et ce qu'ils émettent est encore du texte. Jev retire le pas de générer du texte. Ce n'est pas un chat plus intelligent. C'est un autre genre de produit.

Entre les sociétés de modèles, je regarde maintenant la route, et je regarde si la définition du produit peut être menée jusqu'au bout. Comment un modèle se conçoit maintenant se ramène à ces deux choses. Ce n'est pas le premier nom d'un tableau qui décide. Les noms sur le tableau changent au bout d'un moment. Ce qu'un modèle a l'intention d'émettre, une fois la forme fixée, l'entraînement et l'interface suivent, et le prix suit aussi.

Les autres routes, ce texte n'en porte qu'une phrase. Certains poussent l'ingénierie à un extrême. Certains se tournent et construisent une suite verticale. Le reste ne parle tout simplement pas, et continue de pousser un modèle général. Les suites particulières de DeepSeek et de Kimi ne sont pas dépliées ici. Elles sont écrites dans JEV - Un modèle dépouillé, une suite, et un qui ne parle pas.

Passé cette ligne, je ne sais plus qui est le plus intelligent. Quand je change, cela peut encore sembler un peu mieux. Cette sensation ne me suffit pas pour choisir. Ce que je peux séparer, c'est la définition du produit. Est-ce que vous émettez du texte, est-ce que vous émettez des actions, ou est-ce que vous n'émettez qu'une probabilité.

Sources

Série