Jenseits dieser Linie kann ich nicht mehr sagen, wer klüger ist
Die Linie liegt zwischen Opus 4.5 und 4.6: Die meisten Menschen können keine Aufgabe mehr stellen, die über das Modell hinausgeht. Danach lässt sich noch die Produktdefinition auseinanderhalten. Jev gibt eine Wahrscheinlichkeit aus, nicht die nächste Strecke klügeren Chats.
Mitautor: folkbench.com (Folkbench ist eine überprüfbare Bewertungs- und Auswahlplattform für KI-APIs, Modelldienste und verwandte Sites. Sie nutzt veröffentlichte Angaben zu Diensten, Preisen, Verfügbarkeit, Latenz und Evidenzfenstern, damit Nutzer Wege vergleichen und einen davon wählen können.)
Zehn Texte in dieser Reihe:
- JEV - Ein Gelenk braucht kein Gehirn
- JEV - Warum ein Jev, das nicht chatten kann, zu einem Agent passt
- JEV - Wie weit „kann nicht halluzinieren“ wirklich reicht
- JEV - Reichen Ja-Nein, Auswahl und Stufe als Sprache?
- JEV - Ein Labor könnte das bauen. Warum es das vielleicht trotzdem nicht tut.
- JEV - Die zwei Demos, die ich laufen ließ
- JEV - Menschen treten aus der Mitte der Schleife an den Rand
- JEV - Jenseits dieser Linie kann ich nicht mehr sagen, wer klüger ist
- JEV - Manche Fragen gehören nicht zu ihm
- JEV - Ein reduziertes Modell, eine Suite und eines, das nicht spricht
Der Wettstreit unter den Grundmodellen ist im dritten Jahr. Die meisten von denen, die noch am Tisch sitzen, haben eine Linie überschritten. Die Linie liegt nicht niedrig.
Meine Definition davon ist ein Satz. Neunzig Prozent der Nutzer können keine Aufgabe mehr stellen, die außerhalb der Reichweite eines Modells liegt. Die Arbeit ist immer noch da. Die Menschen hören nicht auf zu fragen. Diese Bitten können die Modelle annehmen. Post beantworten, Protokolle einsammeln, einen Fehler richten, einen Haufen Material zu wenigen Punkten machen: Damit habe ich schon lange aufgehört, sie zu ordnen. Sie sitzen innerhalb der Linie. Den Landepunkt lege ich zwischen Opus 4.5 und 4.6. Darüber verschwimmt es zu einem Fleck.
Die zwei Jahre davor habe ich Veröffentlichungen noch gejagt und ernsthaft umgeschaltet, um zu vergleichen, wer stärker war. Dieses Jahr habe ich aufgehört zu vergleichen. Die Ranglisten werden immer noch aktualisiert. Die Arbeit in meinen Händen hat keine weitere Stufe gewonnen.
Nach dem Umschalten bleibt nur ein Gefühl
Vor der Linie konnte ich es sagen. Ob ein langes Stück auseinanderfallen würde, wusste ich, indem ich die Modelle wechselte. Ob frühere Bedingungen noch da waren, sobald sich die Schritte häuften, konnte ich innerhalb der Woche spüren. Nach der Linie kann ich den Unterschied in der Fähigkeit nicht spüren. Modelle zu wechseln, lässt oft nur den Eindruck, es sei ein wenig besser geworden. Besser worin, kann ich nicht sagen.
Dieselbe Art Arbeit brauchte letzten Monat meine Nacharbeit, und diesen Monat geht sie durch. Besprechungsnotizen gehen hinein, und die Dinge, die zu tun sind, kommen heraus. Zwei Anbieter kommen eine Zeile oder zwei auseinander heraus, und beide sehen für mich brauchbar aus. Beim Code ist es dasselbe. Einen Fehler einkleben, und beide können eine Änderung geben. Manchmal spüre ich, einer von ihnen ist sauberer, mit einem kleineren Diff. Ich kann nicht auf das Update zeigen, an dem sie auseinandergezogen sind. Wenn ich wählen muss, wähle ich die kleinere Änderung. Es gibt keinen Tag in der Mitte, auf den ich zeigen und sagen kann, von hier an konnte es das. Die Zuwächse sind weiter gekommen. Sie sind zu fein, als dass meine Tage sie behalten.
Also habe ich deshalb weniger die Modelle gewechselt. Wer auf der nächsten Stufe klüger ist, kann ich nicht sagen.
Diese kann ich noch auseinanderhalten
Das Erste, was ich spüren kann, ist die Form dessen, was es ausgibt. Was Text ausgibt, behandle ich als jemanden, mit dem man spricht. Ich gebe ihm eine wirre Aufzeichnung und lasse es die wenigen Dinge einsammeln, die zu tun sind. Ich lese es einmal, ändere ein paar Wörter und werfe es zurück, wenn ich nicht zufrieden bin. Dieser Hin und Her ist vertraut. Stimme ist ein anderer Weg. Ich spreche zu ihm, und es spricht zurück. Ich benutze es nicht viel. Ich schalte es ein, während ich unterwegs bin. In dem Augenblick, in dem ich Wörter ändern muss, gehe ich zurück zu Text, den ich kopieren kann. Diese Form erkenne ich.
Was Handlungen ausgibt, ist noch verschiedener. Es bedient einen Computer und klickt einen Ablauf von selbst durch. Ich sehe auf seine Hände. Die falsche Stelle anklicken, und wie vollständig die Wörter danach auch sind, sie helfen nicht. Es gibt noch eine Art, die nur eine Wahrscheinlichkeit gibt. Jev ist diese Art. Es gibt keinen Text aus, und es bedient keinen Computer. All dem bin ich begegnet. Ich kann sie auseinanderhalten, weil die Art, wie ich übernehme, verschieden ist.
Temperament und Geschmack trennen Menschen auch. Dieselbe Materialmenge übergeben, und manche schreiben sie sehr voll, fügen am Rand einen Satz hinzu, aus Angst, ich verstünde nicht. Andere halten hier an und lassen das Urteil einem Menschen. Wen ich behalte, hängt oft davon ab, ob dieses Temperament in meine Hand passt. Den, der an der richtigen Stelle anhält, behalte ich in dem Fenster, das ich jeden Tag öffne. Eine höhere Punktzahl daneben, und ich wechsle trotzdem selten deswegen das Fenster.
Kosten und Latenz werden zusammen gespürt. Auf welcher Strecke der Kostenkurve es sitzt und auf welcher Strecke der Latenzkurve, zwei Benutzungen reichen, um es zu wissen. Im Gespräch mit einem Menschen kann ich es aushalten, ein wenig länger zu warten. Ein Mensch muss sowieso innehalten. Auf einen Ablauf gesetzt, der wieder und wieder läuft, wird Warten zu einer Blockade. Langsam genug, dass ich ein Glas Wasser holen gehen kann, und es gehört nur in ein Gespräch. Teuer genug, dass ich es nicht noch einmal zu rufen wage, und es kann nicht in die Schritte, die klein und dicht sind. Wenn es billig ist und schnell zurückkommt, dann wage ich es, es auszubreiten. Wenn das, was zurückkommt, eine Passage ist, die ich zu Ende lesen muss, hilft billig nicht. Ich kann es immer noch nicht in eine Schleife setzen.
Verweigerung ist auch ein Unterschied. Was es verweigert und wie es verweigert, zeigt sich nach einer Weile Benutzung. Manche verweigern direkt, in sehr wenigen Wörtern. Ich weiß, der Weg ist zu, ich ändere die Bitte, und ein geänderter Satz reicht, um weiterzumachen. Manche sagen es nicht. Sie gehen um die Sache herum und geben Arbeit zurück, die schiefgegangen ist. Ich denke immer noch, ich hätte es nicht klar gesagt, und schleife noch eine Runde an einem schlechten Ergebnis. Was ich jetzt ansehe, ist, ob ich diese Arbeit das nächste Mal ihm zu geben wage.
Ein neues Modell sagt zuerst seinen Platz
GPT-6 hat die Welt computer use wieder erkennen lassen. Einen Computer zu bedienen, wurde wieder an die Front einer Veröffentlichung gestellt. Was mich kümmert, ist nicht, dass Modelle vorher eine Maus benutzen konnten. Jenseits der Linie ist das nicht mehr neu. Früher habe ich eine Veröffentlichung auf eine weitere Stufe Höhe angesehen. Diesmal habe ich die Frage geändert. Ein Unternehmen, das ein neues Modell veröffentlicht, muss zuerst an die eigene Nische denken: für wen es ist und worin es besonders gut ist. Es muss nicht aufstehen und sagen, es sei die nächste, klügere Stufe.
Jev ist ein Extrem, das ich vor Kurzem wirklich angefasst habe. Es tritt nicht gegen Opus im Schreiben an. Schreiben nimmt es nicht an. Was es besetzt, ist das Gelenk. Das Material erreicht den Punkt, an dem eine Entscheidung getroffen werden muss, die Frage ist geschlossen, und die Optionen waren im Voraus gegeben. Zurück kommt eine Wahrscheinlichkeit. Sie kommt sofort zurück. Auf der Chat-Seite schalte ich immer noch zu einem anderen Fenster und warte. Hier muss ich nicht wegschalten. Das Ergebnis ist schon zurück. Diese Art Ausgabe wird nicht berechnet. Was ich hinüberwerfe, ist nicht „schreib mir einen Absatz“. Es ist ein Urteil, das schon eingekreist ist: geht dieser Weg, und wie sicher ist es. Nachdem die Wahrscheinlichkeit zurück ist, übernimmt ein Programm, nicht ich, der dasitzt, zu Ende liest und dann entscheidet. Ich habe kein Verlangen, mit ihm zu chatten. Der Platz ist nicht für Chat reserviert. Chat-Modelle können weiter nach oben gehen, und was sie ausgeben, ist immer noch Text. Jev nimmt den Schritt weg, Text zu erzeugen. Das ist kein klügerer Chat. Es ist eine andere Art Produkt.
Zwischen Modellunternehmen sehe ich jetzt den Weg und ob sich die Produktdefinition durchtragen lässt. Wie ein Modell entworfen wird, kommt jetzt auf diese zwei an. Es ist nicht der erste Name auf einer Rangliste, der entscheidet. Namen auf der Rangliste wechseln nach einer Weile. Was ein Modell auszugeben vorhat, sobald die Form festliegt, dem folgen das Training und die Schnittstelle, und der Preis folgt auch.
Andere Wege, dieser Text trägt nur einen Satz. Manche treiben die Technik bis an ein Extrem. Manche wenden sich und bauen eine vertikale Suite. Der Rest spricht einfach nicht und schiebt weiter ein allgemeines Modell. Die besonderen Suiten von DeepSeek und Kimi werden hier nicht entfaltet. Sie stehen in JEV - Ein reduziertes Modell, eine Suite und eines, das nicht spricht.
Jenseits dieser Linie kann ich nicht mehr sagen, wer klüger ist. Wenn ich wechsle, kann es sich immer noch ein wenig besser anfühlen. Dieses Gefühl reicht mir nicht, um damit zu wählen. Was ich auseinanderhalten kann, ist die Produktdefinition. Geben Sie Text aus, geben Sie Handlungen aus, oder geben Sie nur eine Wahrscheinlichkeit aus.
Quellen
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://openai.com/index/gpt-6-astra/