Jusqu'où va vraiment « ne peut pas halluciner »

TypeSafe dit que Jev ne peut pas halluciner. La phrase ne tient que pour le type : une réponse ne peut pas quitter la table fixée d'avance. La calibration et la justesse sont à part, et l'évaluation de workflow s'aligne sur la moyenne d'Astra et de Fable.

Co-auteur : folkbench.com (Folkbench est une plateforme vérifiable d’évaluation et de sélection pour les API d’IA, les services de modèles et les sites associés. Elle s’appuie sur les informations publiées sur le service, les prix, la disponibilité, la latence et les fenêtres de preuve pour aider les utilisateurs à comparer des voies et à en choisir une.)

Dix textes dans cette série :

TypeSafe dit que Jev « ne peut pas halluciner ». La phrase sonne comme si l'hallucination avait été interdite d'un coup. Le même texte la resserre. Ce qu'ils ont écrit, c'est que l'appariement au schéma est une garantie, pas une statistique, donc les erreurs de type peuvent s'écrire 0%. Un seul contre-exemple suffirait à réfuter cela. Ils disent que c'est mathématiquement impossible.

La seule couche sur laquelle cette phrase peut tenir, c'est le type. Jev a renoncé à la génération de chaînes. Il rend une structure fixée d'avance, pas un passage de texte généré sur le moment. Savoir si la probabilité est juste, et savoir si le jugement est bon, ce sont deux autres affaires. Si un lecteur ne les sépare pas, « il n'a pas écrit de prose » s'entend comme « la réponse est correcte ».

Il ne peut pas quitter la table

Il n'y a que trois types de questions, et tous sont scellés. Noul demande si une chose tient, et ce qui revient est une probabilité de 0 à 1. Les options de Choice doivent être écrites d'avance par l'appelant, 255 au plus sur une table. Ce qui revient, c'est l'option choisie, avec une probabilité sur chaque option et une confiance. Les niveaux de Score doivent aussi être écrits d'avance, au moins deux et au plus dix. Le score peut se poser entre deux niveaux. La réponse porte en même temps la probabilité de chaque niveau et une confiance. Ce score est encore une position sur l'échelle, pas un paragraphe neuf.

Il ne peut pas quitter la table des options. Le modèle ne peut pas non plus, tout à coup, écrire un morceau de prose et parler la réponse jusqu'à lui donner forme. La doc le dit droit. Ce que le modèle rend, c'est une distribution sur les options ou les niveaux que l'appelant a soumis. Il ne rend pas une valeur hors de cette distribution. Le code peut utiliser ces valeurs directement, sans d'abord aller creuser des champs dans un paragraphe généré.

Les modèles de chat ne rendent d'habitude pas le travail de cette façon. Ils rendent des chaînes. Une chaîne peut être une réponse normale, et elle peut être une hallucination. Le logiciel doit encore l'analyser et la valider. Si la validation échoue, le programme ne peut pas s'en servir directement. TypeSafe met la sûreté de type et l'hallucination ensemble, et traite la sûreté de type comme la condition minimale de l'automatisation. Si le type est faux au fond d'une chaîne d'appels, les branches d'après se branchent au mauvais endroit. L'écrit officiel dit aussi que les modèles actuels, si intelligents soient-ils, hallucinent encore, et font encore des erreurs de type.

Rester dans le type n'empêche pas le jugement d'être faux. Choisir le mauvais élément sur une question fermée, c'est encore une erreur. Sur le flux public d'alerte de sécurité, le modèle doit choisir entre fermer, remettre à un analyste, et contenir tout de suite. Les trois options sont sur la table. Si le modèle choisit la mauvaise, le type est encore légal.

Le récit officiel n'appelle pas System One toujours correct. Ils ont écrit que la pensée System 1 donne l'impression d'être sujette à l'erreur. Ils croient que les modèles System One peuvent être rendus plus fiables que les alternatives. Ils laissent les raisons précises pour plus tard. C'est leur direction. Ce n'est pas « toujours correct ».

Choice a un autre bord dur. Une fois les options au-delà de 255, une table ne peut pas les tenir. Une course Wikipédia qui marche de lien en lien doit choisir, à un pas, parmi des centaines ou des milliers de liens. Ils passent à deux étapes : noter indépendamment, puis faire un choix. Cela ralentit parfois. Ce ralentissement est apparu dans la démo de la course Wikipédia. Une haute cardinalité n'est pas l'infini. « Pas d'hallucination », ici, veut encore seulement dire qu'il ne rendra pas un lien qui n'est pas sur la table. Les options ne peuvent pas s'ajouter sans limite.

La confiance est une autre question

La calibration est une affaire à part. Le récit officiel, c'est que les réponses portent une probabilité et une confiance. Quand la confiance est plus haute, l'exactitude est plus haute. Des entrées semblables renvoient des réponses semblables. De l'autre côté, ils écrivent sur les modèles de chat. Même si vous en invitez un à rapporter une confiance, il est souvent trop sûr de lui, et instable. Si une tâche peut être faite juste 95% du temps et que le modèle ne dit pas de quels 5% il n'est pas sûr, cette tâche ne peut pas s'automatiser.

La confiance sur Choice et Score n'est pas une phrase de certitude à part que le modèle rapporterait. Le nombre se calcule à partir de la forme de la distribution. La probabilité empilée sur une option ou un niveau, et le nombre est haut. La probabilité étalée sur plusieurs endroits, et le nombre est bas. L'appelant agit quand le nombre est haut, et remet le cas à une personne quand il est bas. Noul n'attache pas une confiance à part. La probabilité du oui ou du non est elle-même le signal. La table de comparaison officielle écrit la probabilité et la confiance ensemble. Appliqué aux trois questions, Choice et Score ont les deux, et Noul n'a que la probabilité.

Une confiance de 1.0 veut seulement dire que la distribution est pressée tout entière sur un seul résultat. Elle décrit la forme de cette réponse. Quand la distribution est pressée tout entière sur la mauvaise option, la confiance peut encore être haute. Un grand nombre ne veut pas dire que le résultat est juste.

Une erreur de type ne peut pas sortir. C'est mathématiquement impossible. La calibration n'a pas de garantie de ce genre. Ce que le récit officiel donne, c'est une correspondance : confiance plus haute, exactitude plus haute. Si cette correspondance casse, le type ne peut toujours pas s'échapper, et la confiance ne peut plus être un seuil. Donc cette couche a un mécanisme, et elle a une affirmation. Savoir si les erreurs sont moins nombreuses quand le nombre est plus haut, et savoir si des entrées semblables reviennent avec des distributions semblables, les deux doivent se regarder à part. Que le champ soit présent à chaque fois veut seulement dire que l'appelant peut lire le nombre.

Juste, ce n'est pas le monde

Le vrai et le faux doivent se séparer encore une fois. Le workflow eval mesure à quel point un modèle se rapproche d'une référence à l'intérieur du même flux. Cette référence n'est pas une réponse objective venue du monde. Ils supposent que le code du flux est juste, et ils ne débattent pas de savoir si les étiquettes sont justes. Les étiquettes de référence sont la moyenne de GPT-6 Astra et de Claude Fable 5.1. Les deux utilisent le high thinking, et chacun répond à chaque question du flux. Les autres modèles sont comparés au raisonnement par défaut de chaque fournisseur.

Que Jev se rapproche de cette moyenne veut dire qu'il se rapproche du consensus de ces deux modèles. Cela ne peut pas s'écrire comme plus vrai que les faits. Si le consensus penche, une réponse collée au consensus penche aussi. L'écrit officiel dit qu'utiliser la moyenne de ces deux-là comme référence biaise les réponses vers les modèles d'OpenAI et d'Anthropic.

Pendant la comparaison, les grands modèles sont enveloppés dans le System One LLM adapter, qui les force aussi à émettre des décisions structurées, pour qu'ils puissent être comparés dans les mêmes types de questions. Le récit officiel admet que demander avec des probabilités est d'habitude plus lent et plus cher que donner une décision sans probabilités. Leur conclusion, c'est que c'est la façon la plus exacte de prendre une décision à un grand modèle. Cette exactitude se compare à une décision qui ne porte pas de probabilités. Elle ne veut pas dire que la décision a coïncidé avec un fait extérieur.

Les nombres d'erreurs de type des grands modèles sur le graphique viennent d'OpenRouter, et ils sont biaisés. Des requêtes plus complexes peuvent être routées vers un modèle plus fort. Le 0% de Jev n'est pas le même genre de statistique. L'écrit officiel dit que leur nombre n'est pas un résultat empirique. L'appariement au schéma est garanti, donc le graphique peut être rempli avec 0%. Un côté est une observation après routage. L'autre côté est un nombre rempli à partir d'une garantie. Ce n'est pas le même taux d'erreur.

Le côte à côte avec GPT-5.6 Terra a utilisé le raisonnement par défaut. Le récit officiel a choisi ce modèle parce que, à leur lecture, son intelligence est en moyenne la plus proche de Jev. Dans l'exécution enregistrée, le seul désaccord est « Churn likelihood level ». La vue officielle, c'est que la question est ambiguë et que la réponse ne peut pas se dire nettement. Sur une question ambiguë, une distribution est plus honnête qu'une étiquette dure.

« Ne peut pas halluciner », au bout du compte, veut dire qu'il ne produit pas de sortie hors du type. C'est pour cela qu'ils écrivent les erreurs de type comme 0%. La calibration doit être acceptée pour elle-même, selon que la confiance peut servir de seuil. Savoir si le jugement est juste, cette évaluation de flux ne peut pas donner la réponse propre du monde. Ce sur quoi elle s'aligne, c'est la moyenne d'Astra et de Fable.

Sources

Série