Ein reduziertes Modell, eine Suite und eines, das nicht spricht

DeepSeek, Kimi und Jev sind keine Ränge auf einer Gesamtrangliste. Eines dient zum Stapeln von Durchsatz, eines ist eine Vorderseite, die schon gebaut ist, und Jev sitzt in einem Ablauf, gibt eine Wahrscheinlichkeit aus und spricht nicht.

Mitautor: folkbench.com (Folkbench ist eine überprüfbare Bewertungs- und Auswahlplattform für KI-APIs, Modelldienste und verwandte Sites. Sie nutzt veröffentlichte Angaben zu Diensten, Preisen, Verfügbarkeit, Latenz und Evidenzfenstern, damit Nutzer Wege vergleichen und einen davon wählen können.)

Zehn Texte in dieser Reihe:

Die Klassengruppe reicht wieder Ranglisten herum. Jemand wirft die Punktzahl von DeepSeek. Jemand wirft die Punktzahl von Kimi. Darunter zieht jemand Jev hinein und fragt, welches der drei stärker ist. Ich habe einmal hingesehen und bin gegangen. Ich habe nicht geantwortet. Was die Gruppe will, ist ein Name, und diese Art Name habe ich nicht zur Hand. Diese drei sind keine Ränge auf derselben Rangliste. Eine Rangfolge erzwingen, und der Lärm bleibt in der Gruppe. Mit der Art, wie ich diese Woche arbeite, hat er wenig zu tun.

Ich benutze sie jetzt nach Nische, nicht nach einer Gesamtrangliste. Der Erfolg, den ich anerkenne, ist so eng: Ein Modell führt in der eigenen Nische, und es muss nicht in allem Erster sein. Jenseits der Linie von Opus 4.5 nach 4.6 ist diese Gewohnheit fest. Ich denke, 90% der Nutzer können keine Aufgabe mehr stellen, die jenseits des Modells liegt. Die allgemeine Intelligenz noch eine Stufe heben, und meine Tage bewegen sich kaum. Die allgemeine Intelligenz noch einmal vergleichen, und ich kann es nicht spüren. Ob etwas spricht oder nicht, das wähle ich jeden Tag. Die Oberfläche wirkt auch darauf, ob ich es weiter benutzen kann. Der Preis ist direkter. Es muss billig genug sein, dass ich es in eine Schleife zu schreiben wage, bevor ich das Modell in den Code setze.

Die, die sprechen, benutze ich getrennt

DeepSeek ist für mich der Weg, der bis zur äußersten Einfachheit getrieben ist. Technik so weit genommen, wie sie geht, die Rate gefüllt, der Preis halbiert. Ich öffne es, und auf der Seite ist nicht viel, worin man herumwandern könnte, und keine Branchenwerkbank wartet. DeepSeek legt seine Mühe darein, schnell zu laufen und den Preis zu schneiden. Ich wage es, dieselbe Sache noch ein paar Runden laufen zu lassen. Auf ein teureres wechseln, und ich fange an zu rechnen, ob ich sparen soll. Arbeit im Stapel über Nacht werfe ich auch dorthin. Die Menschen schlafen, die Aufrufe laufen noch, und bei einem teuren Modell ist mir unwohl.

Ich benutze es für Arbeit, die Durchsatz will. Ich schiebe einen Stapel Logs zum Abtasten durch, und ich drücke Schnittstellenentwürfe hin und her, viele Runden derselben Art Frage. Ich sehe auf zwei Dinge: nicht stocken und nicht teuer werden. Der Cursor dreht zu lange, oder eine Runde fängt an, beim Geld wehzutun, und die Pipeline bricht von selbst. Sätze kann es auch schreiben. Ich ändere sie gewöhnlich im Vorbeigehen und benutze sie. Ich halte selten an, um sie zu kosten. Über Geschmack rede ich mit ihm bei dieser Arbeit auch nicht. Geschmack muss Wort für Wort geschliffen werden. Es wurde nicht so bepreist, damit ein Mensch Sätze schleift.

Kimi setze ich auf die andere Seite. Nicht um zu beweisen, wer klüger ist. Die Fähigkeit der Vorderseite ist gefüllt. Ein langes Stück Material geht hinein, ein Inhaltsverzeichnis erscheint, die Zitate sind noch da, und die Quelle lässt sich aufschlagen und dagegen lesen. Wenn ich das selbst zusammensetzte, wäre ein Nachmittag weg. Es hat auch Suiten eigens für Finanzen und Recht gebaut. Die Datenquellen sind drinnen angeschlossen, die Skills, die zu benutzen sind, sitzen da, und es gibt eine fertige Fläche, wenn die Arbeit übergeben wird. Vorschriften und Finanzberichte blättere ich auf dieser Fläche durch. Ich öffne keinen Haufen anderer Seiten. Wenn Finanzen oder Recht als langes Material ausgebreitet sind, will ich die Umgebung nicht zuerst selbst bauen. Was ich will, ist mich hinzusetzen und es durchzublättern, nicht die halbe Zeit als meine eigene Vorderseite zu verbringen. Ich öffne es, wenn ich lange Dokumente lesen muss und wenn ich eine Werkbank brauche, die schon da ist.

Was ich nach dem Benutzen annehme, ist eine Sache. Das ist ein Produkt. Es ist nicht ein Modell, das klüger wird und deshalb nebenbei eine Website wachsen lässt. Aus welchem Haus die Daten anschließen und zu welcher Klausel einer Vorschrift geblättert wird, das wächst nicht von selbst, weil ein Modell klüger ist. Wie ein Bericht aussieht, wenn er übergeben wird, das muss jemand zuerst den Ablauf zu einer Oberfläche machen. Wenn Rede schnell und billig ist, staple ich Aufrufe, und was ich benutze, ist DeepSeek. Wenn ich wirklich Material lesen und Arbeit übergeben muss, öffne ich die Vorderseite von Kimi. Beide können sprechen. Ich setze eines nicht an die Stelle des anderen.

Das, das nicht spricht, setze ich in den Ablauf

Jev nehme ich nicht zum Chatten. Zustand geht hinein, die geschlossenen Fragen werden gestellt, und zurück kommt Wahrscheinlichkeit. Welches Element zu wählen ist oder auf welcher Stufe es landet, einschließlich eines schlichten Ja oder Nein, der Typ muss im Voraus zugeschrieben sein. Wenn die Frage noch nicht geschlossen wurde, rufe ich es nicht. Die Ausgabe ist kostenlos. Die Eingabe kostet $0.042 pro Million Token. Die Geschwindigkeit ist die schnelle Art, 70 bis 500 Millisekunden. Zu diesem Preis wage ich es, innerhalb eines Ablaufs wieder und wieder zu fragen, ohne bei jeder Frage die Rechnung im Kopf zu rechnen. Ich behandle es als einen Aufruf innerhalb des Ablaufs. Ich frage, und ich gehe.

In den eigenen Ablauf gesetzt, als Gelenk. Der Code räumt den Zustand zuerst auf, dann wirft er eine geschlossene Frage hinüber. Die Wahrscheinlichkeit kommt zurück, und den Zweig geht das Programm danach. Für mich erledigt es Klassifikation und Routing, es erledigt Stufen, und es erledigt, ob dieser Schritt einen Menschen herbeirufen soll. Nach der Klassifikation frage ich weiter, auf welcher Stufe es landet, und nachdem die Stufe heraus ist, frage ich, ob ein Mensch gerufen wird. Alles geschlossene Fragen, alles dieselbe Art Aufruf. Gründe und Erklärungen, die für jemand anderen zum Lesen geschrieben sind, sind nicht seine Aufgabe. Text, den ein Mensch wirklich sehen muss, daran schließe ich ein Modell, das sprechen kann. Wenn diese Art Urteil einem Modell gegeben wird, das chatten kann, kommt es oft als ein ganzer Absatz zurück, mit einer Haltung und mit Rat. Dann muss ich noch eine Schicht schreiben und den Absatz zu einem Zweig graben. Noch eine Schicht auf dem Gelenk, und ich finde es das nicht wert.

Die Eval habe ich nur einmal geöffnet. Innerhalb des Workflow werden seine Urteile mit Astra und Fable 5.1 verglichen. Verglichen wird Nähe und Kosten, nicht ein Sieg oder eine Niederlage im Chat. Das ist ein anderes Koordinatensystem. Sobald ich das verstanden hatte, habe ich die Seite geschlossen.

Eine Veröffentlichung sollte sagen, für wen sie ist

Die Welle von GPT-6 hat computer use zu etwas gemacht, das Menschen wieder erkennen. Das Modell geht hin und klickt selbst den Bildschirm, öffnet Software und macht eine Sache auf dem Schreibtisch fertig. Menschen haben das vorher getan. Nachdem Astra herauskam, wurde das Bedienen eines Computers wieder etwas, worauf Menschen zeigen können, nicht mehr nur ein Extra außerhalb des Chat-Fensters. Neben diese drei gesetzt, ist das noch fester. In dem Augenblick, in dem ein Modell veröffentlicht wird, müssen die Menschen, die es veröffentlichen, klar sagen, für wen es ist.

Menschen, die bereit sind, die ganze Maschine zu übergeben, können computer use benutzen. Eine andere Gruppe sitzt vor einem Chat-Fenster und will, dass das Sprechen zu Ende gebracht wird. DeepSeek und Kimi sprechen beide, aber eines ist zum Stapeln von Durchsatz und eines für eine Vorderseite, die schon gebaut ist, und das ist schon nicht derselbe Gebrauch. Jev ist nicht auf der Seite des Sprechens. Der Code ist meiner. Es ist nur dafür verantwortlich, eine Wahrscheinlichkeit auszugeben, damit das Programm danach gehen kann. Wenn ich eine Chat-Seite dafür machte, würde ich es falsch benutzen. In dem Augenblick, in dem es ein Chat-Fenster gibt, will ich, dass es den Grund ausschreibt.

Ich werde keinen Text schreiben, der „wer ist 2026 der Stärkste“ heißt. Dieser Satz hilft dieses Jahr nicht. Die zwei innerhalb des Chat-Fensters und dieses, das nicht spricht, habe ich im Gebrauch schon vor langer Zeit getrennt. Ich bereite mich auch nicht darauf vor, diese Art Text zu schreiben.

So nehme ich sie. Arbeit, die Durchsatz will, gebe ich DeepSeek. Ich verbrauche mich nicht an einem Ziehen um den Stil, und ich will nicht auf ein teures hinaufwechseln. Langes Material, wenn es auch mit einer Werkbank kommt, die schon gebaut ist, öffne ich Kimi. Wenn der Code den Schritt erreicht, der ein Urteil fällen muss, Klassifikation und Routing, eine Stufe und ob ein Mensch gerufen wird, setze ich Jev dorthin und lasse es den Mund nicht öffnen. Die Gesamtrangliste kann aktualisieren, wenn sie mag. Ich nehme sie nach Nische. Den Rang sehe ich nicht mehr an.

Quellen

Reihe