Un labo pourrait le construire. Pourquoi il ne le ferait peut-être pas.

TypeSafe a sorti Jev le 15 septembre 2026, encore en accès anticipé. Ce texte met le prix officiel et le récit d'entraînement à côté d'une grille d'acteurs en place, et explique pourquoi un modèle de jugement à sortie gratuite heurte la vente de longue sortie au token.

Co-auteur : folkbench.com (Folkbench est une plateforme vérifiable d’évaluation et de sélection pour les API d’IA, les services de modèles et les sites associés. Elle s’appuie sur les informations publiées sur le service, les prix, la disponibilité, la latence et les fenêtres de preuve pour aider les utilisateurs à comparer des voies et à en choisir une.)

Dix textes dans cette série :

Le 15 septembre 2026, TypeSafe a sorti Jev, et il était encore en accès anticipé. C'est leur premier modèle System One. Il ne fait que des jugements. Il ne s'appuie pas sur le bavardage. Le fondateur, Diogo Almeida, travaillait avant sur le suivi d'instructions chez OpenAI, sur la recherche qui est devenue ChatGPT.

Jev lui-même n'a pas de fossé technique. N'importe quel labo de modèles, avec une petite équipe, pourrait faire sa propre version en un demi-mois. Techniquement, rien ne le bloque.

Le travail officiel a bien fait quelque chose de neuf. Ils ont construit une architecture nouvelle. L'échantillonneur est parallèle : une requête finit le jugement, sans générer un token après l'autre. Ils ont construit une méthode d'entraînement à part, appelée RLCD, de l'apprentissage par renforcement sur des décisions calibrées. La confiance que le modèle rapporte doit s'aligner sur la part des décisions ultérieures qui sont justes. Ce sont leur implémentation. Ce que quelqu'un d'autre imiterait, c'est la forme du produit : ne pas générer de chaînes, et n'émettre des probabilités calibrées que sur des questions fermées. La question est fixée d'avance, le modèle rend un jugement avec une probabilité, et le code branche sur ce nombre. Un demi-mois imite cette forme. Cela ne copie pas la recherche de TypeSafe telle qu'elle est. La personne qui imite n'a pas à démonter cette recherche d'abord.

Un fossé est difficile à revendiquer. Une fois la forme fixée, l'implémentation peut être échangée en bloc. Après l'échange, le système dans lequel elle se branche reçoit encore la même chose : l'état devant, un jugement derrière.

Le produit d'un modèle de chat est une chaîne. Une chaîne peut s'écrire très longue, et le logiciel qui a vraiment besoin de cette chaîne doit l'analyser encore une fois. Jev ne produit pas de chaînes. Sans ce tronçon de texte qui peut s'allonger, la sortie n'a pas de facture qui monte avec la longueur.

La grille de prix des acteurs en place

Le prix le rend net. L'entrée de Jev est à $0.042 par million de tokens, proche du gratuit, et la sortie est gratuite. Le récit officiel dit que la sortie est trop bon marché pour qu'on la mesure. Ils admettent aussi qu'ils ne peuvent pas prouver que ce prix n'est pas subventionné. Sur la longue durée, ils attendent que le prix descende, pas qu'il monte.

La grille de prix des acteurs en place est l'autre bout. L'entrée va de $0.20 à $10 par million de tokens, et la sortie est environ cinq fois plus chère encore. L'argent d'un modèle de chat se tient sur la sortie longue. Une réponse pour qu'une personne la lise, et les pas qu'un Agent continue d'exécuter, les deux doivent s'écrire en texte. Une fois le texte long, l'argent atterrit du côté de la sortie. Même si l'entrée est pressée très bas, une écriture longue reste le gros de l'appel.

Les deux côtés ne se rencontrent pas. Les acteurs en place vendent des tokens. Un modèle dont la sortie est gratuite, et dont l'entrée est proche du gratuit, mange le métier du token.

Le conflit est structurel. Plus un modèle de jugement à sortie gratuite est utilisé largement, moins les gens achètent les tokens qui voulaient dire « laissez un grand modèle classer, router et noter ». Une note de frais est vérifiée contre un reçu, et quelqu'un doit juger si la description correspond à la pièce. Une alerte de sécurité part, et quelqu'un doit juger si cette machine est isolée maintenant. Des articulations de ce genre étaient remises entières à un modèle de chat, qui écrivait une raison, après quoi la conclusion était creusée hors du texte. Le texte creusé est tarifé comme sortie, sur le palier le plus cher. Une question fermée remet le jugement directement. Ce qui revient, c'est un ensemble de probabilités, la longueur est fixée d'avance, et il n'y a pas de texte qui puisse continuer à s'écrire vers le bas. La raison peut rester non écrite, et ce palier de frais n'a nulle part où se poser.

Ce que l'acteur en place abîme, c'est son propre rapport. Plus le modèle est utilisé largement, plus l'ancienne colonne tombe vite. C'est un métier qui entre par le bas. Le jugement bon marché voyage avec le flux et remplace les petites décisions qui appelaient un grand modèle. Ce qui est remplacé, ce n'est pas l'appel d'au-dessus qui écrit un long morceau. C'est la petite décision qui doit se prendre à mi-chemin du flux. Les appels qui doivent encore s'écrire lentement peuvent encore se vendre. L'attente officielle que leur propre prix continue de descendre ne remplit pas la colonne que l'acteur en place a perdue.

Le nom Jev vient de William Stanley Jevons. L'analogie officielle, c'est le charbon et la machine à vapeur. Après que la machine à vapeur a élevé l'efficacité de la combustion du charbon, on n'a pas brûlé moins de charbon. On en a brûlé plus. L'efficacité monte, et l'usage ne se resserre pas. Il grandit. Le jugement bon marché appelle l'usage à l'existence. Demander une fois à un modèle n'était pas bon marché, alors les gens ne lui remettaient que les quelques pas les plus précieux, et écrivaient le reste en règles mortes, ou regardaient eux-mêmes. Une fois le jugement assez bon marché pour être redemandé encore et encore dans le code, les questions qui ne valaient pas d'être posées arrivent toutes ensemble. Ce qui monte, c'est le compte.

L'usage qu'on appelle à l'existence n'est pas le genre de token que les acteurs en place veulent le plus vendre aujourd'hui. La longueur écrite sur un seul appel baisse, et la sortie n'est pas facturée. Si haut que le compte s'empile, il n'entre pas dans la table dont ils se servent aujourd'hui, celle qui gagne de l'argent sur la sortie longue.

La personne qui définit ce genre de modèle

Le dur, c'est la personne.

Seule une personne qui tient en même temps une vue métier et une vue modèle voit des articulations partout dans un système. Ce dont une articulation a besoin n'est pas ce dont un cerveau a besoin. Un cerveau a besoin d'un tronçon de mots qui peut continuer. Une articulation ne veut pas de mots. Elle veut un résultat sur lequel on peut brancher. Si la probabilité est solide, le programme continue. Si la probabilité n'est pas sûre, on la laisse à une personne. Quelqu'un qui ne construit que des modèles voit facilement cela comme un format de sortie. Quelqu'un qui ne fait que le métier sent facilement qu'appeler le grand modèle une fois de plus suffit. Les deux vues doivent se tenir sur une seule personne avant que cette personne définisse ce genre de modèle. De telles personnes sont rares. L'item n'apparaît pas tout seul sur une feuille de route.

Bien se servir de ce genre de modèle, une personne rencontre la même difficulté. L'instinct ne peut répondre qu'aux questions que l'instinct peut répondre. Savoir si une chose est ainsi, et lequel d'un petit nombre d'éléments fixés choisir, l'instinct peut répondre. Écrire un tronçon de contenu qui n'était pas là, ou penser les pas jusqu'au bout sur une question qui n'a pas été cadrée, l'instinct ne peut pas le tenir. C'est le travail d'un autre genre de modèle. L'instinct est rapide, et il est bon marché. Quand le programme a besoin de demander, il demande une fois, et le temps et l'argent peuvent le porter. Si souvent qu'il demande, les questions sont encore celles que l'instinct peut tenir. Alors il reste dans un programme qui continue de tourner.

Les grands labos peuvent le construire. Les personnes et le calcul sont là. Refermer la sortie, d'une chaîne vers une question fermée, c'est quelque chose que l'ingénierie peut traverser, et ce n'est pas la même chose que de reproduire la recherche de TypeSafe en un demi-mois. Ce qu'un demi-mois produit, c'est une forme utilisable. L'implémentation de TypeSafe est encore dans leurs propres mains.

Cette colonne encaisse encore. Une fois le jugement changé en question fermée, et la sortie rendue gratuite, la colonne perd un tronçon. La partie perdue se voit dans un rapport trimestriel. La place plus en avant est laissée aux projets qui écrivent encore la sortie longue. Le contexte continue de grandir, les Agents courent quelques boucles de plus, et ce qui sort en plus est exactement le token que cette grille de prix reconnaît.

Ils peuvent le construire. Il ne sera pas planifié devant.

Sources

Série