Wie weit „kann nicht halluzinieren“ wirklich reicht
TypeSafe sagt, Jev könne nicht halluzinieren. Der Satz hält nur für den Typ: Eine Antwort kann die im Voraus festgelegte Tabelle nicht verlassen. Kalibrierung und Richtigkeit sind getrennt, und das Workflow-Eval deckt sich mit dem Durchschnitt von Astra und Fable.
Mitautor: folkbench.com (Folkbench ist eine überprüfbare Bewertungs- und Auswahlplattform für KI-APIs, Modelldienste und verwandte Sites. Sie nutzt veröffentlichte Angaben zu Diensten, Preisen, Verfügbarkeit, Latenz und Evidenzfenstern, damit Nutzer Wege vergleichen und einen davon wählen können.)
Zehn Texte in dieser Reihe:
- JEV - Ein Gelenk braucht kein Gehirn
- JEV - Warum ein Jev, das nicht chatten kann, zu einem Agent passt
- JEV - Wie weit „kann nicht halluzinieren“ wirklich reicht
- JEV - Reichen Ja-Nein, Auswahl und Stufe als Sprache?
- JEV - Ein Labor könnte das bauen. Warum es das vielleicht trotzdem nicht tut.
- JEV - Die zwei Demos, die ich laufen ließ
- JEV - Menschen treten aus der Mitte der Schleife an den Rand
- JEV - Jenseits dieser Linie kann ich nicht mehr sagen, wer klüger ist
- JEV - Manche Fragen gehören nicht zu ihm
- JEV - Ein reduziertes Modell, eine Suite und eines, das nicht spricht
TypeSafe sagt, Jev „kann nicht halluzinieren“. Der Satz klingt, als sei die Halluzination mit einem Schlag verboten. Derselbe Text engt ihn ein. Was sie geschrieben haben, ist, dass Schema-Matching eine Garantie ist, keine Statistik, sodass Typfehler als 0% geschrieben werden können. Ein Gegenbeispiel würde reichen, das zu widerlegen. Sie sagen, es sei mathematisch unmöglich.
Die einzige Schicht, auf der dieser Satz stehen kann, ist der Typ. Jev hat die String-Erzeugung aufgegeben. Es gibt eine Struktur zurück, die im Voraus festliegt, nicht eine Textpassage, die an Ort und Stelle erzeugt wird. Ob die Wahrscheinlichkeit genau ist und ob das Urteil stimmt, sind zwei andere Dinge. Wenn ein Leser sie nicht trennt, wird „es hat keine Prosa geschrieben“ als „die Antwort ist richtig“ gehört.
Es kann die Tabelle nicht verlassen
Es gibt nur drei Fragetypen, und alle sind versiegelt. Noul fragt, ob eine Sache gilt, und zurück kommt eine Wahrscheinlichkeit von 0 bis 1. Die Optionen von Choice muss der Aufrufer im Voraus schreiben, höchstens 255 auf einer Tabelle. Zurück kommt die gewählte Option, mit einer Wahrscheinlichkeit auf jeder Option und einer Konfidenz. Die Stufen von Score müssen ebenfalls im Voraus geschrieben werden, mindestens zwei und höchstens zehn. Die Punktzahl kann zwischen zwei Stufen landen. Die Antwort trägt zugleich die Wahrscheinlichkeit jeder Stufe und eine Konfidenz. Diese Punktzahl ist immer noch eine Position auf der Skala, kein neuer Absatz.
Es kann die Optionstabelle nicht verlassen. Das Modell kann auch nicht plötzlich ein Stück Prosa schreiben und die Antwort zurechtreden. Die Dokumentation sagt das geradeaus. Was das Modell zurückgibt, ist eine Verteilung über die Optionen oder Stufen, die der Aufrufer eingereicht hat. Es gibt keinen Wert außerhalb dieser Verteilung zurück. Der Code kann diese Werte direkt benutzen, ohne zuerst Felder aus einem erzeugten Absatz zu graben.
Chat-Modelle geben Arbeit gewöhnlich nicht so ab. Sie geben Strings ab. Ein String kann eine normale Antwort sein, und er kann eine Halluzination sein. Software muss ihn trotzdem zerlegen und prüfen. Schlägt die Prüfung fehl, kann das Programm ihn nicht direkt benutzen. TypeSafe stellt Typsicherheit und Halluzination zusammen und behandelt Typsicherheit als die Mindestbedingung für Automatisierung. Ist der Typ tief in einer Aufrufkette falsch, schließen spätere Zweige an der falschen Stelle an. Der offizielle Text sagt auch, dass aktuelle Modelle, wie klug auch immer, immer noch halluzinieren und immer noch Typfehler machen.
Im Typ zu bleiben, hindert das Urteil nicht daran, falsch zu sein. Die falsche Position bei einer geschlossenen Frage zu wählen, ist immer noch falsch. Im öffentlichen Ablauf für Sicherheitsalarme muss das Modell wählen zwischen schließen, an eine Analystin oder einen Analysten geben und es jetzt eindämmen. Alle drei Optionen stehen auf der Tabelle. Wählt das Modell die falsche, ist der Typ immer noch zulässig.
Die offizielle Darstellung nennt System One nicht immer richtig. Sie haben geschrieben, dass Denken nach System 1 den Eindruck erweckt, fehleranfällig zu sein. Sie glauben, System-One-Modelle ließen sich verlässlicher machen als die Alternativen. Die konkreten Gründe lassen sie für später. Das ist ihre Richtung. Es ist nicht „immer richtig“.
Choice hat noch eine harte Kante. Sobald die Optionen 255 überschreiten, kann eine Tabelle sie nicht halten. Ein Wikipedia-Rennen, das Links abläuft, muss bei einem Schritt unter Hunderten oder Tausenden von Links wählen. Sie wechseln auf zwei Stufen: unabhängig bewerten, dann eine Wahl treffen. Es wird gelegentlich langsamer. Diese Verlangsamung zeigte sich in der Demo zum Wikipedia-Rennen. Hohe Kardinalität ist nicht unendlich. „Keine Halluzination“ heißt hier immer noch nur, dass es keinen Link zurückgibt, der nicht auf der Tabelle steht. Optionen lassen sich nicht ohne Grenze hinzufügen.
Konfidenz ist eine eigene Frage
Kalibrierung ist eine eigene Sache. Die offizielle Darstellung ist, dass Antworten Wahrscheinlichkeit und Konfidenz tragen. Ist die Konfidenz höher, ist die Genauigkeit höher. Ähnliche Eingaben geben ähnliche Antworten zurück. Auf der anderen Seite schreiben sie über Chat-Modelle. Selbst wenn Sie eines auffordern, eine Konfidenz zu melden, ist es oft überkonfident und instabil. Kann eine Aufgabe in 95% der Fälle richtig erledigt werden und sagt das Modell nicht, bei welchen 5% es unsicher ist, lässt sich diese Aufgabe nicht automatisieren.
Die Konfidenz bei Choice und Score ist kein eigener Satz von Gewissheit, den das Modell meldet. Die Zahl wird aus der Form der Verteilung berechnet. Wahrscheinlichkeit auf eine Option oder eine Stufe gehäuft, und die Zahl ist hoch. Wahrscheinlichkeit über mehrere Stellen verteilt, und die Zahl ist niedrig. Der Aufrufer handelt, wenn die Zahl hoch ist, und gibt den Fall einem Menschen, wenn sie niedrig ist. Noul hängt keine eigene Konfidenz an. Die Ja-oder-Nein-Wahrscheinlichkeit ist selbst das Signal. Die offizielle Vergleichstabelle schreibt Wahrscheinlichkeit und Konfidenz zusammen. Auf die drei Fragen angewandt haben Choice und Score beides, und Noul hat nur die Wahrscheinlichkeit.
Eine Konfidenz von 1.0 heißt nur, dass die Verteilung ganz auf ein Ergebnis gedrückt ist. Sie beschreibt die Form dieser Antwort. Wenn die Verteilung ganz auf die falsche Option gedrückt ist, kann die Konfidenz trotzdem hoch sein. Eine große Zahl heißt nicht, dass das Ergebnis stimmt.
Ein Typfehler kann nicht herauskommen. Das ist mathematisch unmöglich. Die Kalibrierung hat keine Garantie dieser Art. Was die offizielle Darstellung gibt, ist eine Entsprechung: höhere Konfidenz, höhere Genauigkeit. Bricht diese Entsprechung, kann der Typ immer noch nicht entkommen, und die Konfidenz kann keine Schwelle mehr sein. Diese Schicht hat also einen Mechanismus, und sie hat eine Behauptung. Ob es weniger Fehler gibt, wenn die Zahl höher ist, und ob ähnliche Eingaben mit ähnlichen Verteilungen zurückkommen, beides muss getrennt angesehen werden. Dass das Feld jedes Mal da ist, heißt nur, dass der Aufrufer die Zahl lesen kann.
Richtig ist nicht die Welt
Richtig und falsch müssen noch einmal geteilt werden. Das Workflow-Eval misst, wie nah ein Modell innerhalb desselben Ablaufs an eine Referenz kommt. Diese Referenz ist keine objektive Antwort aus der Welt. Sie nehmen an, dass der Code des Ablaufs stimmt, und sie streiten nicht darüber, ob die Labels stimmen. Die Referenzlabels sind der Durchschnitt von GPT-6 Astra und Claude Fable 5.1. Beide nutzen high thinking, und jedes beantwortet jede Frage im Ablauf. Die anderen Modelle werden beim voreingestellten Reasoning des jeweiligen Anbieters verglichen.
Dass Jev diesem Durchschnitt nahekommt, heißt, dass es dem Konsens dieser zwei Modelle nahekommt. Das lässt sich nicht als wahrer als die Fakten schreiben. Neigt sich der Konsens, neigt sich auch eine Antwort, die am Konsens klebt. Der offizielle Text sagt, dass der Durchschnitt dieser zwei als Referenz die Antworten zu den Modellen von OpenAI und Anthropic hin verzerrt.
Beim Vergleich werden die großen Modelle in den System One LLM Adapter gepackt, der sie zwingt, ebenfalls strukturierte Entscheidungen auszugeben, damit sie innerhalb derselben Fragetypen verglichen werden können. Die offizielle Darstellung gibt zu, dass Fragen mit Wahrscheinlichkeiten gewöhnlich langsamer und teurer sind als eine Entscheidung ohne Wahrscheinlichkeiten. Ihr Schluss ist, dass dies der genaueste Weg ist, einem großen Modell eine Entscheidung zu entnehmen. Diese Genauigkeit wird mit einer Entscheidung verglichen, die keine Wahrscheinlichkeiten trägt. Sie heißt nicht, dass die Entscheidung zu einer äußeren Tatsache gepasst hat.
Die Typfehler-Zahlen für große Modelle in der Grafik kommen von OpenRouter, und sie sind verzerrt. Komplexere Abfragen können an ein stärkeres Modell geleitet werden. Die 0% von Jev sind nicht dieselbe Art Statistik. Der offizielle Text sagt, ihre Zahl sei kein empirisches Ergebnis. Schema-Matching ist garantiert, also kann die Grafik mit 0% gefüllt werden. Eine Seite ist eine Beobachtung nach dem Routing. Die andere Seite ist eine Zahl, die aus einer Garantie eingesetzt wird. Das ist nicht dieselbe Fehlerrate.
Die Gegenüberstellung mit GPT-5.6 Terra nutzte voreingestelltes Reasoning. Die offizielle Darstellung wählte dieses Modell, weil seine Intelligenz, so wie sie es lesen, im Durchschnitt Jev am nächsten ist. Im aufgezeichneten Lauf ist die einzige Abweichung „Churn likelihood level“. Die offizielle Sicht ist, dass die Frage mehrdeutig ist und sich die Antwort nicht sauber sagen lässt. Bei einer mehrdeutigen Frage ist eine Verteilung ehrlicher als ein hartes Label.
„Kann nicht halluzinieren“ heißt am Ende, dass es keine Ausgabe außerhalb des Typs erzeugt. Deshalb schreiben sie Typfehler als 0%. Die Kalibrierung muss für sich angenommen werden, daran, ob sich die Konfidenz als Schwelle benutzen lässt. Ob das Urteil stimmt, kann dieses Ablauf-Eval nicht die eigene Antwort der Welt geben. Womit es sich deckt, ist der Durchschnitt von Astra und Fable.
Quellen
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://github.com/typesafe-ai/system-one-adapter-python
- https://docs.typesafe.ai/primitives/choice
- https://docs.typesafe.ai/primitives/score
- https://docs.typesafe.ai/confidence