Die zwei Demos, die ich laufen ließ
Derselbe Geschäftszustand lief durch zwei Demos: geschlossene Fragen in einem Durchgang, dann eine Risikofrage angehalten, deren Konfidenz nicht steigen wollte. Die offizielle Gegenüberstellung mit GPT-5.6 Terra diente nur dazu zu sehen, welche Frage abwich.
Mitautor: folkbench.com (Folkbench ist eine überprüfbare Bewertungs- und Auswahlplattform für KI-APIs, Modelldienste und verwandte Sites. Sie nutzt veröffentlichte Angaben zu Diensten, Preisen, Verfügbarkeit, Latenz und Evidenzfenstern, damit Nutzer Wege vergleichen und einen davon wählen können.)
Zehn Texte in dieser Reihe:
- JEV - Ein Gelenk braucht kein Gehirn
- JEV - Warum ein Jev, das nicht chatten kann, zu einem Agent passt
- JEV - Wie weit „kann nicht halluzinieren“ wirklich reicht
- JEV - Reichen Ja-Nein, Auswahl und Stufe als Sprache?
- JEV - Ein Labor könnte das bauen. Warum es das vielleicht trotzdem nicht tut.
- JEV - Die zwei Demos, die ich laufen ließ
- JEV - Menschen treten aus der Mitte der Schleife an den Rand
- JEV - Jenseits dieser Linie kann ich nicht mehr sagen, wer klüger ist
- JEV - Manche Fragen gehören nicht zu ihm
- JEV - Ein reduziertes Modell, eine Suite und eines, das nicht spricht
Heute habe ich zwei Demos laufen lassen und Jev ausprobiert. Keine von beiden hat es zum Chatten aufgefordert. Ich habe ein Stück Geschäftszustand hineingelegt, geschlossene Fragen gestellt und angesehen, was zurückkam.
Zustand ist eine Scheibe des Geschäfts, genug, um danach zu urteilen. Ich habe ihn nicht zu einer Geschichte gemacht. Ein Chat-Modell, das diese Art Eingabe bekommt, fängt oft mit einem Absatz Verständnis an, dann kommt Rat. Ich wollte keinen Rat. Ich wollte sehen, ob es in der Mitte eines Ablaufs als Gelenk bleiben, Zahlen ausgeben und den Code weiterlaufen lassen kann.
Die erste Demo
Ich habe diesen Zustand hineingelegt und die geschlossenen Fragen in einem Durchgang gestellt. Ich habe geklickt. Es kam sofort zurück.
Der offizielle Bereich ist 70 bis 500 Millisekunden. Ich habe nicht die Uhr gestoppt, also kann ich nicht sagen, wo ich im Bereich gelandet bin. Was ich gespürt habe, war, dass ich nie bis zur Ungeduld kam. Bei Modellen, die lange Antworten schreiben, bin ich es gewohnt, das Fenster stehen zu lassen und etwas anderes zu tun. Diesmal habe ich das Fenster nie stehen gelassen. Das Ergebnis war schon auf der Seite, bevor ich wegschaltete.
Das Geld habe ich getrennt gezählt. Die Ausgabe wird nicht berechnet. Die Eingabe kostet $0.042 pro Million Token. Wenn der Zustand kurz ist, sind die Eingabekosten eines Aufrufs etwas, das ich auf dem Konto suchen muss, bevor ich es sehe. Als Gelenk ist es billig. Ein Knoten wie dieser wird viele Male durchlaufen. Ein großes Modell, das die Ausgabe auch berechnet, da fange ich beim zweiten Satz an zu sparen. Hier trägt eine Frage mehr nicht diese Last.
Die Fragen waren diese drei.
Für Ja-Nein habe ich Noul benutzt. Ich habe gefragt, ob diese Bestellung zuerst aus dem automatischen Ablauf gehoben und einem Menschen gegeben werden soll. Es antwortet nicht mit einem blanken „Ja“ oder „Nein“. Es antwortet mit der Wahrscheinlichkeit von „Ja“, zwischen 0 und 1. Ich sehe, an welchem Ende es klebt. Klebt es an einem Ende, behandle ich die Frage als erledigt. Schwankt es in der Mitte, ist die Frage noch offen.
Für die Einordnung habe ich Choice benutzt, eine Einfachauswahl. Die Optionen und die Bedeutung jeder einzelnen habe ich geschrieben. Ich habe sie nicht in Richtung 255 aufgehäuft. Die offizielle Obergrenze ist 255, und diese Frage brauchte sie nicht. Zu viele Elemente, und ich kann sie selbst nicht sehen. Mit wenigen Elementen kann ich urteilen. Gewicht klar auf eine Option gehäuft und die anderen sehr dünn: Nur diese Art ersten Platz lasse ich in einen Zweig. Beißen die ersten zwei eng zusammen, nehme ich es nicht an, nur weil es einen ersten Platz gibt. Ein erster Platz, der nur ein wenig höher liegt, hat sich noch nicht getrennt.
Für das Risiko habe ich Score benutzt, um zu sehen, auf welcher Stufe es gelandet ist. Die Skala von Score ist 2 bis 10 Stufen. Ich habe diese Frage innerhalb dieses Bereichs geschnitten, von leicht nach schwer. Ich habe keine andere Skala erfunden. Es gibt die Wahrscheinlichkeit jeder Stufe zurück und eine Position, die nach diesen Wahrscheinlichkeiten gewichtet ist. Ich wage es nicht, diese Position allein zu benutzen. Ist die Wahrscheinlichkeit auf eine Stufe gehäuft, ist die Position diese Stufe. Ist die Wahrscheinlichkeit über zwei benachbarte Stufen geteilt, fällt die Position in die Mitte. Die Position sieht feiner aus, und beide Stufen sind noch da. Diese Art Position schreibe ich nicht in eine spätere Bedingung.
Es schreibt keine Erklärung. Die Wahrscheinlichkeit ansehen, nicht eine Erklärung. Als ich ein Chat-Modell für dieselbe Art Urteil benutzt habe, war der Schluss in einen Absatz gewickelt. Ich musste die Wörter abschälen, bevor ich ein Feld zu füllen wagte, und ich hatte Angst, Höflichkeit für eine Haltung zu nehmen. Heute gibt es keine solche Schicht Wörter. Drinnen sind Typ und Wahrscheinlichkeit. Was diese Demo für mich bestätigt hat, ist, dass es als Gelenk passt. Ich muss keinen kurzen Aufsatz zu Ende lesen, bevor ich den Code anschließe.
Den Tausch habe ich aus der Verteilung genommen, nicht aus einem Gefühl des Augenblicks. Ein Ja-Nein, das an einem Ende klebte, habe ich automatisch durchgelassen. Kategoriegewicht auf ein Element gehäuft, habe ich den Code anschließen lassen. Die Verteilung der Risikofrage hat sich nicht gesammelt, und ich habe sie in dieser Demo nicht eingefroren. Ich habe sie für die nächste gelassen.
Die zweite teilt dasselbe
Die zweite Demo hat denselben Zustand benutzt. Ich bin keinen neuen suchen gegangen. Ich habe die Fragen geteilt, um den Satz zu prüfen, dass ein Mensch nicht in der Mitte jeder Schleife stehen muss.
Hohe Konfidenz war ich bereit, dem Code zu geben. Niedrige Konfidenz habe ich behalten, um hinzusehen. Nach dem Ausprobieren war ich bereit, die hohen loszulassen. Ja-Nein am Ende klebend und Kategorie auf eine Seite gehäuft, habe ich das Programm von selbst weitergehen lassen. Die hohen gehen direkt in einen Zweig. Die Regel steht im Code. Die Konfidenz reicht, und das Programm läuft weiter. Die Konfidenz reicht nicht, und das Programm hält vor mir an. Als ich das Log las, hatten diese hohen Schleifen nicht auf mein Nicken gewartet. Ich habe sie nicht eine nach der anderen bestätigt.
Die niedrige war die Risikofrage. Ich hatte sie nicht eng genug gefragt, und dem Zustand fehlte auch Material, das zwei benachbarte Stufen trennen konnte. Die Verteilung lag auseinander, und die Konfidenz wollte nicht steigen. Während ich hinsah, wollte ich eigentlich eine Stufe für sie wählen, damit der ganze Ablauf zu Ende kommen konnte. Diesem Gedanken darf man nicht folgen. Sobald sie auseinanderliegt, will ich sie nicht für es schließen. Wenn ich beiläufig eine Stufe wähle und sie hineinschreibe, werden spätere Schritte diese Stufe als Tatsache behandeln. Das bin ich, der eine Entscheidung nachliefert, die es nicht getroffen hat, und sie als eine schon fertige Antwort verkleidet.
Also hat die Frage angehalten. Sie blieb für mich zum Ansehen, und sie ging nicht in einen automatischen Zweig. Ich habe sie nicht noch einmal laufen lassen, um mein Glück zu versuchen. Das Material war immer noch dasselbe, und die Verteilung würde sehr wahrscheinlich immer noch auseinanderliegen. Diese Frage sollte nicht erzwungen werden. Später kann ich den Zustand dicker machen oder die Stufen als Formulierungen schreiben, die wirklich auseinanderstehen. Wenn ich jetzt eine Stufe aus ihm erzwinge, kommt ein Durchschnitt zurück. Wenn ich diese Zahl in einen Zweig setze, wird das Folgende sie als ein schon entschiedenes Risiko behandeln.
Ich habe nicht „ich finde es ernster“ daneben geschrieben. Mein Gefühl kann eine auseinanderliegende Verteilung nicht überstimmen und dann zum automatischen Laufen geschickt werden. Wenn die Verteilung wirklich neigte, würde sich das Gewicht von selbst auf eine Seite häufen. Wenn es nicht hinüber kann, habe ich kein Recht, es für es zu häufen. Die zweite Demo habe ich dort angehalten.
Die offizielle Gegenüberstellung
Erst nach den zwei Demos habe ich das Beispiel der Gegenüberstellung im offiziellen Playground geöffnet. Eine Seite ist Jev. Die andere ist GPT-5.6 Terra. Terra nutzte voreingestelltes Reasoning. Ich war nicht da, um zu urteilen, wer klüger ist. Ich habe nur angesehen, auf welcher Frage die Abweichung gelandet ist.
Ich habe sie durchgeprüft. Nur „Churn likelihood level“ war auf den zwei Seiten verschieden. Die anderen Fragen lagen auf einer Linie. Die Frage selbst ist vage. Wie hoch die Abwanderung sein könnte, lässt sich nicht leicht zu einer sauberen Stufe schließen. Wenn es vage ist, gibt es eine Verteilung. Die andere Seite muss, um eine Antwort zu Ende zu bringen, ein Wort ausgeben. Ich habe die Abweichung nicht als Sieg oder Niederlage notiert. Eine Verteilung zu geben ist ehrlicher, als ein Wort zu erzwingen. Dieses Wort kann in einem Satz sitzen, den ein Mensch sagt. Es gehört nicht in einen Zweig, der von selbst ausführt.
Ich habe auf meine eigene niedrige Risikofrage zurückgesehen. Meine und diese Gegenüberstellung sind dieselbe Art. Daneben steht kein zweites Modell, und ich sollte eine auseinanderliegende Wahrscheinlichkeit trotzdem nicht zu einer Stufe zusammendrücken.
Nicht chatten zu können, habe ich zuerst als Mangel genommen. Nach dem Benutzen sehe ich es nicht so. In der Rückgabe steht keine Eröffnung. Ich muss keine Eröffnung löschen. Als ich früher ein Urteil aus einer Chat-Schnittstelle gegraben habe, musste ich zuerst die Höflichkeit überspringen und auch dagegen sichern, dass es später seine Meinung ändert. Heute gibt es keinen Text aufzuräumen. Für mich ist das eine Erleichterung. Es ist eine Sache weniger, die sich leicht falsch machen lässt.
Was ich heute habe laufen lassen, sind diese zwei Demos. Die Gegenüberstellung im Playground habe ich nur geöffnet und angesehen. Sie zählt nicht als eine dritte, die ich gemacht habe. Die erste hat für mich festgelegt, dass es auf einem Gelenk sitzen kann und dass hohe Konfidenz dem Code gegeben werden kann. In der zweiten habe ich die Frage angehalten, deren Verteilung auseinanderlag, und ich habe sie nicht als schon beantwortet verkleidet. Es ist schnell, und zu diesem Preis finde ich wiederholte Aufrufe auch billig. Was zurückkommt, ist kein Artikel. Es ist eine Verteilung.
Quellen
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://console.typesafe.ai/playground?share=shr_13a74b495fb786c4bd7964f11597301e7c9