Ein Labor könnte das bauen. Warum es das vielleicht trotzdem nicht tut.
Am 15. September 2026 hat TypeSafe Jev veröffentlicht, damals noch im Early Access. Der Text stellt den offiziellen Preis und die Darstellung des Trainings neben eine Preisliste der Etablierten und erklärt, warum ein Urteilsmodell mit kostenloser Ausgabe mit dem Verkauf langer Ausgabe nach Token zusammenstößt.
Mitautor: folkbench.com (Folkbench ist eine überprüfbare Bewertungs- und Auswahlplattform für KI-APIs, Modelldienste und verwandte Sites. Sie nutzt veröffentlichte Angaben zu Diensten, Preisen, Verfügbarkeit, Latenz und Evidenzfenstern, damit Nutzer Wege vergleichen und einen davon wählen können.)
Zehn Texte in dieser Reihe:
- JEV - Ein Gelenk braucht kein Gehirn
- JEV - Warum ein Jev, das nicht chatten kann, zu einem Agent passt
- JEV - Wie weit „kann nicht halluzinieren“ wirklich reicht
- JEV - Reichen Ja-Nein, Auswahl und Stufe als Sprache?
- JEV - Ein Labor könnte das bauen. Warum es das vielleicht trotzdem nicht tut.
- JEV - Die zwei Demos, die ich laufen ließ
- JEV - Menschen treten aus der Mitte der Schleife an den Rand
- JEV - Jenseits dieser Linie kann ich nicht mehr sagen, wer klüger ist
- JEV - Manche Fragen gehören nicht zu ihm
- JEV - Ein reduziertes Modell, eine Suite und eines, das nicht spricht
Am 15. September 2026 hat TypeSafe Jev veröffentlicht, und es war noch im Early Access. Das ist ihr erstes System-One-Modell. Es fällt nur Urteile. Es verlässt sich nicht auf Smalltalk. Der Gründer, Diogo Almeida, hat früher bei OpenAI an der Befolgung von Anweisungen gearbeitet, an der Forschung, aus der ChatGPT wurde.
Jev selbst hat keinen technischen Graben. Jedes Modelllabor könnte mit einem kleinen Team in einem halben Monat eine eigene Version machen. Technisch sperrt nichts dagegen.
Die offizielle Arbeit hat wirklich etwas Neues gemacht. Sie haben eine neue Architektur gebaut. Der Sampler ist parallel: Eine Abfrage schließt das Urteil ab, ohne ein Token nach dem anderen zu erzeugen. Sie haben eine eigene Trainingsmethode gebaut, genannt RLCD, Verstärkungslernen an kalibrierten Entscheidungen. Die Konfidenz, die das Modell meldet, muss zu dem Anteil späterer Entscheidungen passen, die richtig sind. Das ist ihre Umsetzung. Was jemand anders nachahmen würde, ist die Produktform: keine Strings erzeugen und kalibrierte Wahrscheinlichkeiten nur bei geschlossenen Fragen ausgeben. Die Frage liegt im Voraus fest, das Modell gibt ein Urteil mit einer Wahrscheinlichkeit zurück, und der Code verzweigt an dieser Zahl. Ein halber Monat ahmt diese Form nach. Er kopiert die Forschung von TypeSafe nicht, wie sie steht. Wer sie nachahmt, muss diese Forschung nicht zuerst auseinandernehmen.
Ein Graben lässt sich schwer beanspruchen. Sobald die Form festliegt, kann die Umsetzung als Ganzes ausgetauscht werden. Nach dem Tausch empfängt das System, in das sie gesteckt wird, immer noch dasselbe: vorn der Zustand, hinten ein Urteil.
Das Produkt eines Chat-Modells ist ein String. Ein String kann sehr lang geschrieben werden, und Software, die diesen String wirklich braucht, muss ihn noch einmal zerlegen. Jev erzeugt keine Strings. Ohne diese Strecke Text, die sich verlängern lässt, hat die Ausgabe keine Rechnung, die mit der Länge steigt.
Die Preisliste der Etablierten
Am Preis wird es deutlich. Die Eingabe von Jev kostet $0.042 pro Million Token, nahe an kostenlos, und die Ausgabe ist kostenlos. Die offizielle Darstellung sagt, die Ausgabe sei zu billig, um sie zu messen. Sie geben auch zu, dass sie nicht beweisen können, dieser Preis sei nicht subventioniert. Auf lange Sicht erwarten sie, dass der Preis sinkt, nicht steigt.
Die Preisliste der Etablierten ist das andere Ende. Die Eingabe läuft von $0.20 bis $10 pro Million Token, und die Ausgabe ist noch einmal etwa fünfmal so teuer. Das Geld eines Chat-Modells sitzt auf langer Ausgabe. Eine Antwort, die ein Mensch lesen soll, und die Schritte, die ein Agent weiter ausführt, müssen beide als Text geschrieben werden. Sobald der Text lang ist, landet das Geld auf der Ausgabeseite. Selbst wenn die Eingabe sehr tief gedrückt wird, ist ein langes Schreiben immer noch der Großteil des Aufrufs.
Die zwei Seiten treffen sich nicht. Die Etablierten verkaufen Token. Ein Modell, dessen Ausgabe kostenlos ist und dessen Eingabe nahe an kostenlos liegt, frisst das Token-Geschäft.
Der Konflikt ist strukturell. Je weiter ein Urteilsmodell mit kostenloser Ausgabe benutzt wird, desto weniger Menschen kaufen die Token, die früher hießen: ein großes Modell klassifizieren, routen und bewerten lassen. Eine Spesenabrechnung wird gegen einen Beleg geprüft, und jemand muss urteilen, ob die Beschreibung zum Beleg passt. Ein Sicherheitsalarm geht los, und jemand muss urteilen, ob diese Maschine jetzt isoliert wird. Gelenke dieser Art wurden früher im Ganzen an ein Chat-Modell gegeben, das einen Grund schrieb, worauf der Schluss aus dem Text gegraben wurde. Der ausgegrabene Text wird als Ausgabe bepreist, auf der teureren Stufe. Eine geschlossene Frage gibt das Urteil direkt ab. Zurück kommt eine Menge Wahrscheinlichkeiten, die Länge liegt im Voraus fest, und es gibt keinen Text, der weiter nach unten geschrieben werden kann. Der Grund kann ungeschrieben bleiben, und diese Stufe der Gebühren hat keinen Ort, an dem sie landen kann.
Was der Etablierte beschädigt, ist der eigene Bericht. Je weiter das Modell benutzt wird, desto schneller fällt die alte Spalte. Das ist ein Geschäft, das von unten eintritt. Billiges Urteil reist mit dem Ablauf und ersetzt die kleinen Entscheidungen, die früher ein großes Modell gerufen haben. Was ersetzt wird, ist nicht der Aufruf darüber, der ein langes Stück schreibt. Es ist die kleine Entscheidung, die auf halbem Weg durch den Ablauf getroffen werden muss. Aufrufe, die immer noch langsam ausgeschrieben werden müssen, lassen sich immer noch verkaufen. Die offizielle Erwartung, dass der eigene Preis weiter sinkt, füllt die Spalte nicht, die der Etablierte verloren hat.
Der Name Jev kommt von William Stanley Jevons. Die offizielle Analogie ist Kohle und die Dampfmaschine. Nachdem die Dampfmaschine die Effizienz des Kohleverbrennens erhöht hatte, wurde nicht weniger Kohle verbrannt. Es wurde mehr verbrannt. Die Effizienz steigt, und der Gebrauch schrumpft nicht. Er wächst. Billiges Urteil ruft Gebrauch ins Dasein. Ein Modell einmal zu fragen, war früher nicht billig, also gaben Menschen ihm nur die wenigen wertvollsten Schritte und schrieben den Rest als tote Regeln oder sahen selbst hin. Sobald ein Urteil billig genug ist, um innerhalb von Code wieder und wieder gefragt zu werden, kommen Fragen, die das Fragen nicht wert waren, alle zusammen an. Was steigt, ist die Zahl.
Der Gebrauch, der ins Dasein gerufen wird, ist nicht die Art Token, welche die Etablierten heute am liebsten verkaufen. Die Länge, die bei einem einzelnen Aufruf geschrieben wird, fällt, und die Ausgabe wird nicht berechnet. Wie hoch sich die Zahl auch stapelt, sie tritt nicht in die Tabelle ein, die sie heute benutzen, die an langer Ausgabe Geld verdient.
Die Person, die diese Art Modell definiert
Das Schwere ist die Person.
Nur jemand, der eine Geschäftssicht und eine Modellsicht zugleich hält, sieht Gelenke durch ein ganzes System. Was ein Gelenk braucht, ist nicht, was ein Gehirn braucht. Ein Gehirn braucht eine Strecke Wörter, die weitergehen kann. Ein Gelenk will keine Wörter. Es will ein Ergebnis, an dem sich verzweigen lässt. Ist die Wahrscheinlichkeit tragfähig, läuft das Programm weiter. Ist die Wahrscheinlichkeit unsicher, bleibt sie einem Menschen. Wer nur Modelle baut, sieht das leicht als ein Ausgabeformat. Wer nur das Geschäft macht, spürt leicht, dass es reicht, das große Modell noch einmal zu rufen. Die zwei Sichten müssen auf einer Person sitzen, bevor diese Person diese Art Modell definiert. Solche Menschen sind wenige. Der Posten erscheint nicht von selbst auf einem Plan.
Diese Art Modell gut zu benutzen, daran stößt eine Person auf dieselbe Schwierigkeit. Instinkt kann nur Fragen beantworten, die Instinkt beantworten kann. Ob etwas so ist und welches von wenigen festgelegten Elementen zu wählen ist, das kann Instinkt beantworten. Eine Strecke Inhalt zu schreiben, die nicht da war, oder die Schritte an einer Frage durchzudenken, die noch nicht gefasst ist, das kann Instinkt nicht halten. Das ist die Arbeit einer anderen Art Modell. Instinkt ist schnell, und er ist billig. Wenn das Programm fragen muss, fragt es einmal, und Zeit und Geld können es tragen. Wie oft es auch fragt, die Fragen sind immer noch die, die Instinkt halten kann. Also bleibt es in einem Programm, das weiterläuft.
Die großen Labore können es bauen. Die Menschen und die Rechenleistung sind da. Die Ausgabe von einem String zu einer geschlossenen Frage zu schließen, das kann Technik durchkommen, und das ist nicht dasselbe, wie die Forschung von TypeSafe in einem halben Monat nachzubauen. Was ein halber Monat hervorbringt, ist eine brauchbare Form. Die Umsetzung von TypeSafe liegt immer noch in ihren eigenen Händen.
Diese Spalte nimmt immer noch Geld ein. Sobald das Urteil zu einer geschlossenen Frage geändert wird und die Ausgabe kostenlos gemacht wird, verliert die Spalte eine Strecke. Der verlorene Teil ist in einem Quartalsbericht sichtbar. Der Ort weiter vorn bleibt Projekten, die die Ausgabe immer noch lang schreiben. Der Kontext wächst weiter, Agents laufen noch ein paar Schleifen, und was extra herauskommt, ist genau das Token, das diese Preisliste erkennt.
Bauen können sie. Vorn wird es nicht eingeplant.