Les deux démos que j'ai lancées
Le même état métier a traversé deux démos : des questions fermées posées en une passe, puis une question de risque dont la confiance ne montait pas a été arrêtée. Le côte à côte officiel avec GPT-5.6 Terra ne servait qu'à voir quelle question divergeait.
Co-auteur : folkbench.com (Folkbench est une plateforme vérifiable d’évaluation et de sélection pour les API d’IA, les services de modèles et les sites associés. Elle s’appuie sur les informations publiées sur le service, les prix, la disponibilité, la latence et les fenêtres de preuve pour aider les utilisateurs à comparer des voies et à en choisir une.)
Dix textes dans cette série :
- JEV - Une articulation n'a pas besoin d'un cerveau
- JEV - Pourquoi un Jev qui ne sait pas discuter convient à un Agent
- JEV - Jusqu'où va vraiment « ne peut pas halluciner »
- JEV - Le oui-non, le choix et le niveau suffisent-ils comme langage ?
- JEV - Un labo pourrait le construire. Pourquoi il ne le ferait peut-être pas.
- JEV - Les deux démos que j'ai lancées
- JEV - Les personnes passent du milieu de la boucle au bord
- JEV - Passé cette ligne, je ne sais plus qui est le plus intelligent
- JEV - Certaines questions ne sont pas pour lui
- JEV - Un modèle dépouillé, une suite, et un qui ne parle pas
Aujourd'hui j'ai lancé deux démos, en essayant Jev. Aucune des deux ne lui a demandé de discuter. J'ai mis un morceau d'état métier, j'ai posé des questions fermées, et j'ai regardé ce qui revenait.
L'état est une tranche du métier, assez pour juger. Je ne l'ai pas tourné en histoire. Un modèle de chat, avec ce genre d'entrée, commence souvent par un paragraphe de compréhension, puis un conseil. Je ne voulais pas de conseil. Je voulais voir s'il pouvait rester au milieu d'un flux comme une articulation, émettre des nombres, et laisser le code continuer.
La première démo
J'ai mis cet état, et j'ai posé les questions fermées en une passe. J'ai cliqué. C'est revenu tout de suite.
L'intervalle officiel est de 70 à 500 millisecondes. Je n'ai pas chronométré, donc je ne peux pas dire où je suis tombé dans l'intervalle. Ce que j'ai senti, c'est que je n'ai jamais été jusqu'à l'impatience. Avec les modèles qui écrivent de longues réponses, j'ai l'habitude de laisser la fenêtre et de faire autre chose. Cette fois je n'ai jamais eu le temps de laisser la fenêtre. Le résultat était déjà sur la page avant que je change d'écran.
J'ai compté l'argent à part. La sortie n'est pas facturée. L'entrée est à $0.042 par million de tokens. Quand l'état est court, le coût d'entrée d'un appel est quelque chose que je dois aller chercher sur le compte avant de pouvoir le voir. Comme articulation, c'est bon marché. Un nœud comme celui-ci est parcouru beaucoup de fois. Un grand modèle qui facture aussi la sortie, je commence à économiser dès la seconde phrase. Ici, poser une question de plus ne porte pas ce poids.
Les questions étaient ces trois-là.
Pour le oui-non j'ai utilisé Noul. J'ai demandé si cette commande devait être sortie du flux automatique et donnée d'abord à une personne. Il ne répond pas par un « oui » ou un « non » nu. Il répond par la probabilité de « oui », entre 0 et 1. Je regarde à quel bout il se colle. S'il se colle à un bout, je traite la question comme réglée. S'il vacille au milieu, la question est encore ouverte.
Pour la classification j'ai utilisé Choice, un choix unique. Les options et le sens de chacune, c'est moi qui les ai écrits. Je ne les ai pas empilés vers 255. Le plafond officiel est 255, et cette question n'en avait pas besoin. Trop d'éléments, et je ne peux plus les voir moi-même. Avec peu d'éléments, je peux juger. Le poids clairement empilé sur une option, et les autres très minces : seule cette sorte de première place, je la laisse entrer dans une branche. Si les deux premières se mordent de près, je ne l'accepterai pas seulement parce qu'il y a une première place. Une première place qui n'est qu'un peu plus haute ne s'est pas encore séparée.
Pour le risque j'ai utilisé Score, pour voir sur quel niveau il tombait. L'échelle de Score va de 2 à 10 niveaux. J'ai coupé cette question dans cet intervalle, du léger au lourd. Je n'ai pas inventé une autre échelle. Il renvoie la probabilité de chaque niveau, et une position pondérée par ces probabilités. Je n'ose pas me servir de cette position seule. Si la probabilité est empilée sur un niveau, la position est ce niveau. Si la probabilité est partagée sur deux niveaux voisins, la position tombe au milieu. La position a l'air plus fine, et les deux niveaux sont encore là. Je n'écrirai pas ce genre de position dans une condition ultérieure.
Il n'écrit pas d'explication. Regardez la probabilité, pas une explication. Quand je me servais d'un modèle de chat pour le même genre de jugement, la conclusion était enveloppée dans un paragraphe. Je devais décoller les mots avant d'oser remplir un champ, et j'avais peur de prendre la politesse pour une position. Aujourd'hui il n'y a pas cette couche de mots. Dedans, c'est le type et la probabilité. Ce que cette démo m'a confirmé, c'est qu'elle convient comme articulation. Je n'ai pas à finir de lire un court essai avant de brancher le code.
J'ai pris l'arbitrage dans la distribution, pas dans une sensation du moment. Un oui-non collé à un bord, je le laisse passer automatiquement. Le poids de catégorie empilé sur un élément, je laisse le code se brancher. La distribution de la question de risque ne s'est pas rassemblée, et je ne l'ai pas figée dans cette démo. Je l'ai laissée pour la suivante.
La seconde découpe la même chose
La seconde démo a utilisé le même état. Je ne suis pas allé en chercher un nouveau. J'ai découpé les questions, pour vérifier la phrase selon laquelle une personne n'a pas à se tenir au milieu de chaque boucle.
Confiance haute, j'étais prêt à donner au code. Confiance basse, je gardais pour regarder. Après l'essai, j'étais disposé à lâcher les hautes. Oui-non collé à un bord, et catégorie empilée d'un côté, je laisse le programme avancer tout seul. Les hautes vont droit dans une branche. La règle est écrite dans le code. La confiance suffit, et le programme continue. La confiance ne suffit pas, et le programme s'arrête devant moi. Quand j'ai lu le journal, ces boucles hautes n'avaient pas attendu mon signe de tête. Je ne les ai pas confirmées une par une.
La basse, c'était la question de risque. Je ne l'avais pas demandée assez serrée, et l'état manquait aussi de matériau qui puisse séparer deux niveaux voisins. La distribution était étalée, et la confiance ne montait pas. Pendant que je regardais, j'avais en fait envie de lui choisir un niveau, pour que tout le flux puisse finir. Cette pensée ne peut pas être suivie. Une fois que c'est étalé, je ne veux pas le refermer à sa place. Si je choisis un niveau au hasard et que je l'écris, les pas d'après traiteront ce niveau comme un fait. C'est moi qui fournis une décision qu'il n'a pas prise, et qui l'habille en réponse déjà finie.
Donc la question s'est arrêtée. Elle est restée pour que je la regarde, et elle n'est pas entrée dans une branche automatique. Je ne l'ai pas relancée pour tenter ma chance. Le matériau était encore le même, et la distribution serait très probablement encore étalée. Cette question ne devrait pas être forcée. Plus tard je peux épaissir l'état, ou écrire les niveaux en formulations qui se tiennent vraiment à part. Si je lui force un niveau maintenant, ce qui revient est une moyenne. Si je mets ce nombre dans une branche, la suite le traitera comme un risque déjà tranché.
Je n'ai pas écrit « je le sens plus grave » à côté. Mon sentiment ne peut pas passer par-dessus une distribution étalée, puis être envoyé s'exécuter automatiquement. Si la distribution penchait vraiment, le poids s'empilerait tout seul d'un côté. S'il ne peut pas s'empiler jusque-là, je n'ai pas qualité pour l'empiler à sa place. J'ai arrêté la seconde démo là.
Le côte à côte officiel
Ce n'est qu'après les deux démos que j'ai ouvert l'exemple côte à côte dans le playground officiel. Un côté est Jev. L'autre est GPT-5.6 Terra. Terra a utilisé le raisonnement par défaut. Je n'étais pas là pour juger qui est le plus intelligent. Je regardais seulement sur quelle question le désaccord tombait.
Je les ai vérifiés jusqu'au bout. Seul « Churn likelihood level » différait des deux côtés. Les autres questions s'alignaient. La question elle-même est vague. À quel point l'attrition peut être haute, cela ne se referme pas facilement en un niveau net. Quand c'est vague, ce qu'il donne est une distribution. L'autre côté, pour finir une réponse, doit émettre un mot. Je n'ai pas noté le désaccord comme une victoire ou une défaite. Donner une distribution est plus honnête que forcer un mot. Ce mot peut se tenir dans une phrase qu'une personne dit. Il n'a pas sa place dans une branche qui s'exécutera toute seule.
J'ai regardé en arrière ma propre question de risque basse. La mienne et ce côte à côte sont du même genre. Il n'y a pas de second modèle à côté, et je ne devrais quand même pas pincer une probabilité étalée en un seul niveau.
Ne pas savoir discuter, je l'ai d'abord pris comme un défaut. Après usage, je ne le vois plus ainsi. Il n'y a pas de phrase d'ouverture dans le retour. Je n'ai pas à effacer une phrase d'ouverture. Quand je creusais un jugement hors d'une interface de chat, je devais d'abord sauter la politesse, et aussi me garder qu'il change d'avis ensuite. Aujourd'hui il n'y a pas de texte à nettoyer. Pour moi, c'est un soulagement. C'est une chose de moins, facile à mal faire.
Ce que j'ai lancé aujourd'hui, ce sont ces deux démos. Le côte à côte dans le playground, je l'ai seulement ouvert et regardé. Cela ne compte pas comme une troisième que j'aurais faite. La première a réglé, pour moi, qu'il peut se poser sur une articulation, et que la confiance haute peut être donnée au code. Dans la seconde, j'ai arrêté la question dont la distribution était étalée, et je ne l'ai pas habillée en déjà répondue. C'est rapide, et à ce prix je trouve aussi les appels répétés bon marché. Ce qui revient n'est pas un article. C'est une distribution.
Sources
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://console.typesafe.ai/playground?share=shr_13a74b495fb786c4bd7964f11597301e7c9