Ein Gelenk braucht kein Gehirn
Jev ist das System-One-Modell von TypeSafe. Es schreibt keinen freien Text. Für jede geschlossene Frage gibt es eine Wahrscheinlichkeit zurück, an den Knoten, an denen die Regeln ausgehen und ein Chat-Modell Verschwendung wäre.
Mitautor: folkbench.com (Folkbench ist eine überprüfbare Bewertungs- und Auswahlplattform für KI-APIs, Modelldienste und verwandte Sites. Sie nutzt veröffentlichte Angaben zu Diensten, Preisen, Verfügbarkeit, Latenz und Evidenzfenstern, damit Nutzer Wege vergleichen und einen davon wählen können.)
Zehn Texte in dieser Reihe:
- JEV - Ein Gelenk braucht kein Gehirn
- JEV - Warum ein Jev, das nicht chatten kann, zu einem Agent passt
- JEV - Wie weit „kann nicht halluzinieren“ wirklich reicht
- JEV - Reichen Ja-Nein, Auswahl und Stufe als Sprache?
- JEV - Ein Labor könnte das bauen. Warum es das vielleicht trotzdem nicht tut.
- JEV - Die zwei Demos, die ich laufen ließ
- JEV - Menschen treten aus der Mitte der Schleife an den Rand
- JEV - Jenseits dieser Linie kann ich nicht mehr sagen, wer klüger ist
- JEV - Manche Fragen gehören nicht zu ihm
- JEV - Ein reduziertes Modell, eine Suite und eines, das nicht spricht
Grundmodelle haben die Linie überschritten. Die meisten Menschen können keine Aufgabe mehr stellen, die jenseits davon liegt. Die Fragen, die Sie sich ausdenken können, nehmen die aktuellen Modelle meist an. Zu vergleichen, wer ein wenig besser chattet, trägt kein neues Produkt. Der Unterschied ist in die Produktdefinition gewandert. Jev ist für diese Stufe definiert.
Es ist das System-One-Modell von TypeSafe AI. Es erzeugt keinen freien Text. Sie geben ihm ein Stück Zustand, Text oder Programmzustand, dazu eine Menge geschlossener Fragen. Jede Frage kommt als Wahrscheinlichkeitsverteilung zurück.
Es verkauft keinen Chat. Es verkauft die Gelenke in einem System.
Knoten gibt es in Arten. Manche lassen sich als Regeln festschreiben, und dann sind sie fertig. Manche müssen offen durchdacht und einem Menschen zu Ende gesprochen werden. Das ist Arbeit für ein Gehirn. Ein Schwung bleibt in der Mitte. Regeln erschöpfen ihn nicht. Ein Gehirn dafür zu rufen, ist Verschwendung. Das Gelenk sitzt auf diesem Schwung.
Eine Beuge reicht
Wenn Sie gehen, fragt das Knie das Gehirn nicht. Harter Boden, dann beugt es sich ein wenig. Eine steile Steigung, dann hält es. Keine Erklärung, und kein Entwurf.
Ein Gelenk braucht keine Intelligenz. Ein Gelenk braucht Instinkt. Der Instinkt sitzt über den Regeln. Was sich erschöpfen lässt, geht an die Regeln: Der Zustand passt, diesen Zweig nehmen; er passt nicht, anhalten. Was die Regeln noch immer nicht entscheiden können, wozu ein geübter Mensch aber auf einen Blick neigt, geht an den Instinkt. Muss der Grund ausgebreitet werden und muss jemand angesprochen werden, holen Sie die Intelligenz dazu. Erwarten Sie nicht, dass eine Frage die Arbeit von Regeln und Gehirn zugleich tut.
Jev bleibt in dieser mittleren Schicht. Die Frage ist geschlossen, und die Form der Antwort ist geschlossen. Die Wahrscheinlichkeit darf sich verteilen. Verteilt heißt, es ist unsicher. Es vergibt Wahrscheinlichkeit nur innerhalb der Antworten, die Sie ihm gegeben haben. Die offizielle Linie für eine passende Frage ist eng: ein Urteil, das eine fachkundige Person in einer Sekunde fällen kann, während sie den Kontext ansieht. Was eine lange Analyse braucht, gehört nicht als eine Frage hierher. Teilen Sie es.
Das ist dieselbe Art Arbeit wie ein allgemeiner Klassifikator aus der Zeit vor GPT. Das semantische Verstehen ist besser, und es ist schneller. Es kann einen Satz lesen, der einen Umweg nimmt, und es kann eine Absicht lesen, die im Programmzustand steckt. Nehmen Sie es nicht zum Chatten mit.
Der offizielle Name der Position ist System One. Es leiht sich Kahnemans System 1: schnell, intuitiv. Das langsame Denken, das seine Schritte für einen Menschen zum Lesen ausschreibt, liegt nicht in dieser Position.
Der Name kommt von William Stanley Jevons. Nachdem Kohle und Dampfmaschinen effizienter wurden, fiel die Nachfrage nicht. Sie stieg. Die offizielle Verwendung des Namens sagt, dass ein Urteil, sobald es billig ist, die Zahl der Knoten in einem System wachsen lässt, die ein Urteil brauchen.
Nur diese drei Fragen
Es gibt nur drei Fragetypen.
Ja-Nein, genannt Noul. Ein Satz, der sich mit wahr oder falsch schließen lässt. Zurück kommt die Wahrscheinlichkeit von „Ja“, von 0 bis 1. Der Code legt an diese Zahl eine Schwelle. Jenseits der Linie läuft es. Diesseits der Linie hält es an, oder es gibt den Fall an einen Menschen.
Einfachauswahl, genannt Choice. Die Optionen stehen im Voraus fest, höchstens 255. Auf jede Option kann ein Satz folgen, der sagt, was sie meint. Zurück kommt die ganze Verteilung, dazu die Option mit der höchsten Wahrscheinlichkeit. Es fügt nichts hinzu, das nicht auf der Liste steht.
Geordnete Stufen, genannt Score. Von 2 bis 10 Stufen. Von niedrig nach hoch geordnet, jede Stufe als konkrete Lage geschrieben. Geben Sie ihm nicht nur eine Zahl. Der Landepunkt darf zwischen zwei Stufen sitzen, und die Wahrscheinlichkeit jeder Stufe ist noch da. Braucht das Geschäft eine ganze Zahl, holt der Code sie ein.
Alle drei lassen sich in derselben Anfrage stellen. Derselbe Zustand, jede Frage für sich. Ein Ja-Nein entwirft nicht die Einfachauswahl. Welche Frage benutzt wird und welche wegfällt, entscheidet der Code. Fragen hinzuzufügen, fügt kaum Zeit hinzu. Was Sie hinzufügen, sind die eigenen Token der Frage. Die Eingabe wird nach Token berechnet. Die Mehrkosten sind dieses kleine Stück.
Das Sampling ist nicht die Art vom Chat. Die offizielle Angabe ist eine neue Architektur, paralleles Sampling. Ein Durchgang holt jede Ausgabe. Nicht Token für Token. Chat-Modelle sind langsam, weil ein Wort auf das nächste wartet und die Ausgabe unterwegs teuer wird. Jev wächst nicht ein Wort nach dem anderen.
Die Trainingsmethode heißt RLCD, Reinforcement Learning for Calibrated Decisions. Das Ziel ist die Kalibrierung: Die Konfidenz, die es meldet, muss dazu passen, wie oft es tatsächlich richtig liegt. „Liest sich wie ein Mensch“ ist nicht das Ziel.
Die Eingabe kostet $0.042 pro Million Token. Die Ausgabe ist kostenlos. Ende zu Ende sind es etwa 70ms bis 500ms. Siebzig Millisekunden kommen vor, und fünfhundert Millisekunden kommen vor. Das offizielle Urteil zur Intelligenz steht daneben: bei Aufgaben von System One ungefähr wie die aktuellen großen Modelle, und ein bis zwei Größenordnungen schneller. Dieses „ungefähr gleich“ gilt nur für geschlossene Urteile. Es zu benutzen, um einen Artikel zu schreiben oder eine nicht geschlossene Frage ganz durchzusprechen, liegt nicht in dieser Behauptung.
Wo die Regeln aufhören
Knoten dieser Form sind nicht selten. Klassifikation, Routing, Bewertung, Prüfung, Risikokontrolle, dazu die Urteilsknoten in einem Agent, alle haben sie. In welche Warteschlange ein Ticket geht, welchen Codeabschnitt der nächste Hop nimmt, wie heiß eine Beschwerde ist, ob ein Satz durchgelassen wird, ob eine Operation nach der Ausnahme aussieht, die gestoppt werden soll, ob ein Werkzeug an einer Verzweigung übergeben wird. All das lässt sich schnell fragen, und all das lässt sich schließen.
Regeln können die Strecke fressen, die sich leicht schreiben lässt. Sobald sich Ausnahmen stapeln, verheddern sich Bedingungen. Eine ändern, und die daneben können mit ausfallen, sodass später niemand sie anzufassen wagt.
Manche werfen den ganzen Zustand einem Modell zu, das chatten kann, und verlangen einen Satz Rat. Ein Chat-Modell kann das. Der Knoten braucht nur eine Neigung. Sie müssen den Satz trotzdem in einen Zweig zerlegen und es erneut versuchen, wenn das scheitert. Die Zeit geht für die Form des Textes drauf.
Ein Gehirn ist erlaubt. Dieser Knoten verdient es nicht, zuerst eines zu bekommen. Jev nimmt diese Strecke. Eine geschlossene Frage geht hinein, eine Verteilung kommt heraus. Ob die Linie überschritten wird und ob eskaliert wird, steht im Code daneben. Wie der Ablauf sich bewegt, bleibt Sache des Codes.
Eine Erstattung teilt sich in drei Fragen: ob eine Erstattung verlangt wird, ob das Verlangen eine Erstattung ist, eine Umbuchung oder nur eine Frage zu den Regeln, und auf welcher Stufe der Ärger landet. Noul, Choice und Score sehen denselben Zustand. Sätze, die in die Richtlinie geschrieben sind, bleiben bei den Regeln. Was die Regeln nicht treffen, liest man aus der Verteilung. Die Antwort an den Kunden zu schreiben, ist nicht seine Aufgabe.
Ein Agent teilt sich ebenso. Der Satz, den ein Mensch am Ende liest, bleibt bei einem Modell, das sprechen kann. Die Urteile in der Mitte sollen nicht bei jedem Schritt ein Gehirn wecken. Einmal wecken, und dieser Schritt läuft zu den Kosten eines Chats. Das Urteil gegen ein Gelenk tauschen, und die Antwort, die hinausgeht, kann bleiben, wie sie ist.
Zum Schreiben braucht es ein anderes Modell
Einen Artikel kann es nicht schreiben. Es erzeugt keinen Text. Legen Sie Thema und Ton in den Zustand, es beantwortet trotzdem nur die geschlossenen Fragen, die Sie geschrieben haben. Ob etwas am Thema vorbeigeht, das kann es beurteilen. Die Sätze müssen von einem anderen Modell kommen.
Drücken Sie eine offene Frage nicht in eine Einfachauswahl. „Was sollen wir als Nächstes tun“ hat keine Zelle in Choice, bis Sie die Wege zu Ende aufgeführt haben. Teilen Sie zuerst. Was sich erschöpfen lässt, bleibt bei den Regeln. Was der Instinkt beantworten kann, schreiben Sie als diese drei Fragen. Was ausgebreitetes Denken braucht und einen Menschen, dem die Worte zu Ende gesprochen werden, dann kommt die Intelligenz. Lässt es sich nicht teilen, ist es noch kein Gelenk.
Manche hören System One als Herabstufung. Tiefer liegen die Regeln. System One ist der Instinkt über den Regeln. Es ist schnell, und es schreibt keine Erklärung. Die Bedeutung muss es trotzdem verstehen, sonst hätten die Regeln gereicht. Darüber liegt die Intelligenz. Die offizielle Behauptung zur Intelligenz lautet „ungefähr gleich“ bei geschlossenen Aufgaben, und die zur Geschwindigkeit lautet ein bis zwei Größenordnungen schneller. Mit dieser Geschwindigkeit kann ein Aufruf in einer Schleife sitzen, statt einen Chat auszuwarten.
Sobald Grundmodelle die Aufgaben eingeebnet haben, die die meisten Menschen stellen können, muss ein Produkt sich zu einer bestimmten Schnittstelle schließen. Jev schließt sich zu einem Gelenk. Chat steht nicht zum Verkauf. Die Knoten, an denen die Regeln nicht zu Ende kommen und an denen ein Gehirn zu rufen Verschwendung wäre, sind sein Platz.
Quellen
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://docs.typesafe.ai/primitives