Manche Fragen gehören nicht zu ihm
Nach dem Benutzen gehören Erklärungen nicht dazu, Antworten zum Lesen für einen Menschen, ein Name in einer offenen Menge und eine Reasoning-Spur, die bleiben muss. Was dazugehört, bleibt ein geschlossenes Ja-Nein, eine Kategorie, eine Stufe und ob eskaliert wird.
Mitautor: folkbench.com (Folkbench ist eine überprüfbare Bewertungs- und Auswahlplattform für KI-APIs, Modelldienste und verwandte Sites. Sie nutzt veröffentlichte Angaben zu Diensten, Preisen, Verfügbarkeit, Latenz und Evidenzfenstern, damit Nutzer Wege vergleichen und einen davon wählen können.)
Zehn Texte in dieser Reihe:
- JEV - Ein Gelenk braucht kein Gehirn
- JEV - Warum ein Jev, das nicht chatten kann, zu einem Agent passt
- JEV - Wie weit „kann nicht halluzinieren“ wirklich reicht
- JEV - Reichen Ja-Nein, Auswahl und Stufe als Sprache?
- JEV - Ein Labor könnte das bauen. Warum es das vielleicht trotzdem nicht tut.
- JEV - Die zwei Demos, die ich laufen ließ
- JEV - Menschen treten aus der Mitte der Schleife an den Rand
- JEV - Jenseits dieser Linie kann ich nicht mehr sagen, wer klüger ist
- JEV - Manche Fragen gehören nicht zu ihm
- JEV - Ein reduziertes Modell, eine Suite und eines, das nicht spricht
Nach dem Benutzen ist mir am klarsten nicht, was Jev kann. Es ist, welche Arten von Rede ich ihm nicht stellen sollte.
Ich nehme es als Gelenk, nicht als Mund. Instinkt kann nur Fragen beantworten, die Instinkt beantworten kann. Was entfaltet werden muss oder was das Denken für einen Menschen zum Sehen auslegen muss, ist das falsche Objekt, wenn Sie Jev fragen. Einem Menschen etwas zu Ende zu sprechen, ist auch die falsche Bitte. Es hat keine Strings. Fragen Sie, und es gibt keinen Ort, die Antwort hinzulegen.
Was ich nicht fragen sollte
Wenn Sie auch von einem Chat-Modell herüberkommen, sind die leichtesten Dinge, die sich falsch fragen lassen, die Arten unten.
Ich sollte es nicht fragen, warum zu erklären. Die Gewohnheit, die ich vom Chat mitgebracht habe, ist, damit zu öffnen, dass es erklären soll. Diese Gewohnheit funktioniert an ihm nicht. Wenn ich es bitte zu erklären, kommt nur ein Urteil an. Ein Grund muss als Sätze geschrieben werden. Es kann sie nicht schreiben. In der Rückgabe steht kein „weil“. Wenn jemand sehen muss, wie die Ursache angekommen ist, kann es das nicht geben. Wenn ich wirklich eine Strecke Gründe brauche, schreibe ich sie selbst, oder ich frage ein Modell, das sprechen kann, und lasse es aus dem schon gefällten Urteil schreiben.
Ich habe es falsch gebeten, eine Antwort zu schreiben, die ein Mensch lesen soll. Was geschickt werden muss, ist eine Passage. Welcher Satz zuerst kommt und wie schwer der Ton ist, lebt in den Wörtern. Was es gibt, sind Optionen und Wahrscheinlichkeiten. Die passen nicht zu der Passage, die geschickt werden muss. Wie hoch die Wahrscheinlichkeit auch ist, zurück kommt eines der Elemente, die ich im Voraus gegeben habe, nicht eine Passage, die es jetzt schreibt. Später habe ich die Reihenfolge umgedreht. Es urteilt nur, zu welcher Art diese Sache gehört und ob dieser Schritt eskalieren soll. Die Sätze gehen an ein Chat-Modell, oder ich schreibe sie selbst.
Ich habe es gebeten, sich innerhalb einer offenen Menge selbst einen Namen auszudenken. Brauchbare Namen sind viele, und nur eine kleine Scheibe ist in die Frage geschrieben. Es kann nur unter den Elementen wählen, die ich gegeben habe. Was nicht unter den Elementen ist, kann es nicht hervorbringen. Wenn ich die Kandidaten nicht selbst benennen kann, ist es noch nicht an der Reihe. Ich enge zuerst mit Regeln ein, oder ich ziehe mit einem Abruf eine kleine Handvoll heraus, und dann schließe ich die Frage. Später habe ich das Benennen so geändert: Ich lege selbst ein paar Kandidaten fest, dann lasse ich es wählen. Einen ganz neuen außerhalb der Liste lasse ich bei dem Schritt, der sprechen kann.
Es gibt noch eine Art, die nach schwerer Arbeit aussieht, die einem Modell gegeben werden sollte. Die Belege müssen hin und her gewendet werden, und das Denken muss behalten werden. Materialien drücken gegeneinander. Für Sie soll es eine Seite wählen und auch behalten, wie die Übereinstimmung gemacht wurde. Dieses Hin und Her hat es nicht. Eine Anfrage ist ein schnelles Urteil aus dem, was ich in den Zustand gelegt habe. Der Vorgang wird nicht zu Text, den man durchblättern kann. Das Hin und Her, das ich meine, ist oft ein Schluss, der von der nächsten Seite abhängt, und diese Seite ist noch nicht im Zustand. Diese Abhängigkeit lege ich in den Code. Zuerst ein geschlossenes Urteil fragen, dann hole ich den Beleg, und wenn er zurückkommt, ändere ich den Zustand und frage wieder. Die Folge, welche Seite zuerst angesehen wurde und was ausgeschlossen wurde, kann es nicht schreiben. Wenn eine Spur behalten werden muss, gebe ich sie einem Modell, das sprechen kann.
Was ich fragen sollte
Was ich fragen sollte, erkenne ich jetzt nur in wenigen Formen. Ob es diese Art ist, frage ich direkt. Die Kategorien müssen die sein, die ich im Voraus festgelegt habe, und es muss nur auf eine zeigen. Den Schweregrad lasse ich es nicht als feine Zahl melden. Ich zeichne die Stufen, und ich lasse es sagen, auf welcher Stufe es landet. Eskalation, ob dieser Schritt einem Menschen gegeben werden soll, ist auch eine geschlossene Frage, und ich frage sie im selben Durchgang. Eine Form außerhalb dieser stopfe ich nicht hinein.
Ich behalte auch ein grobes Lineal. Wenn eine Person, die die Sache versteht, auf diesen Zustand sieht und aus Instinkt zeigen kann, dann sieht es nach seiner Frage aus. Wenn das Zeigen immer noch eine lange Herleitung braucht, gebe ich es direkt einem Modell, das sprechen kann.
Den Zustand bereite ich vor. Die Frage schließe ich. Die Felder, die in den Kontext eingehen, wähle ich, und was für diese Frage belanglos ist, bringe ich nicht mit. Die Grenzen von Optionen und Stufen stehen in der Frage, nicht an einem Ort, an dem ich hoffe, es werde improvisieren. Es ist nicht dafür verantwortlich, eine offene Frage rund zu machen, und es blättert die nächste Seite Material nicht für mich um. Eine Seite umblättern, und der Zustand hat sich geändert. Das ist die nächste Anfrage, und ich muss sie immer noch vorbereiten.
Ich bin auf eine Frage getreten, die nicht gut geschlossen war. Die Verteilung flacht ab. Mehrere Optionen drängen sich zusammen, und keine steht einen Kopf darüber. Zuerst habe ich das genommen, als sei es langsam. Das war es nicht. Ich hatte einem Gelenk den Kolben eines Mundes gegeben. Optionen überlappen sich, oder eine Lage, die wirklich vorkommen wird, war nicht in die Liste geschrieben, und die Wahrscheinlichkeit kann sich nur ausbreiten. Dann die Frage ändern oder den Schritt an ein Modell zurückgeben, das sprechen kann. Die Frage zu ändern heißt, die überlappenden Elemente zusammenzulegen und dem nicht gedeckten Fall ein „keines davon“ zu geben. Es zurückzugeben heißt, das Modell, das sprechen kann, die Lage zuerst klar sagen zu lassen, und dann entscheide ich, ob ich sie wieder schließe. Drehen Sie nicht weiter daran. Solange die Frage noch offen ist, liegt die Verteilung immer noch auseinander.
Choice und Score
Ich versuche, Choice nicht bis 255 zu füllen. Die offizielle Obergrenze ist 255. Darüber müssen sie selbst zuerst bewerten und dann wählen, und es wird auch langsamer. 255 ist keine Zahl, die ich hier füllen soll. Je mehr Randfälle ich als Optionen aufführe, desto mehr sieht die Frage nach einer Liste aus, die nie geschlossen wurde. Wenn meine Frage von Natur aus Hunderte von Ausgängen hat, frage ich zuerst, ob Regeln die Kandidaten schneiden können und ob ein Abruf sie schneiden kann. Eine kleine Handvoll hat keine feste Zahl. Ich kann auf einen Blick immer noch sagen, worin sich diese Elemente unterscheiden, und erst dann ist der Schnitt weit genug. Wenn ein Blick sie nicht auseinanderhalten kann, schicke ich die Anfrage zu früh. Auf eine kleine Handvoll schneiden, und dann nehme ich sie zum Wählen.
Score behandle ich als geordnete Stufen, nicht als eine durchgehende genaue Dezimalzahl. Wenn ich die Frage schreibe, zeichne ich die Stufen gewöhnlich von 2 bis 10. Was ich will, ist eine Stufe, nicht eine falsche Genauigkeit wie 7.63. Die Stufen schreibe ich in einfachen Wörtern. Ob diese Stufe und die nächste anders behandelt würden, denke ich zuerst durch. Wenn ja, teile ich sie. Wenn beide Stufen am Ende denselben Code auslösen, lege ich sie zu einer Stufe zusammen. Kein Zweig im Code wartet auf zwei Stellen nach dem Komma. Manchmal landet es eine Zahl zwischen zwei Stufen, und ich lese sie immer noch als eine Stufe, mit der Schwelle im Code geschrieben. Wenn sich die Bedeutung einer Stufe nicht klar schreiben lässt, ändere ich die Beschreibung der Stufe. Ich pulle nicht an der Dezimalzahl.
Beim Zuschauen bei den Demos
Ich habe die offizielle Doom-Demo und das Wikipedia-Rennen angesehen, und ich habe sie nicht benutzt, um meine eigenen Fragen zu schließen. Beim Zuschauen bei Doom werde ich leicht vom Bildschirm mitgenommen. Der Bildschirm sieht aus wie ein Spiel, das gespielt wird. Was hineingeht, ist strukturierter Zustand, nicht das Bild. Auf der Doom-Seite liegt die Größenordnung bei etwa 10 Abfragen pro Sekunde, etwa $7 die Stunde. Diese Größenordnung zeigt nur, dass ein Echtzeit-Gelenk hält und dass eine Schleife in dieser Dichte drehen kann. Sie zeigt nicht, dass es das Spiel spielen kann. Das Bild wurde nicht gegessen. Der nächste Schritt ist Code draußen, der mit dem Zustand fragt.
Das Wikipedia-Rennen zeigt, dass das Wählen von Links bei hoher Kardinalität nützlich ist. Es zeigt nicht, dass es das Web besser durchstöbert als ein Modell, das denken kann. Unter dem Vergleich ohne Reasoning braucht es weniger Schritte. Das liegt daran, dass die andere Seite das Reasoning nicht eingeschaltet hat, also sieht die Vorführung besser aus. Reasoning einschalten, und die Vorführung sieht weniger gut aus. Die Schrittzahl ändert sich, und wer schneller ist, ändert sich. Ich werde „weniger Schritte“ nicht zu meiner eigenen Aufgabe mitnehmen und es als besser im Finden eines Weges behandeln. Ob der Weg weitergeht und wo er anhält, entscheidet immer noch das Programm draußen. Ich nehme das so: Nicht alles nach einem Spielzeug urteilen. Ob eine Vorführung angenehm anzusehen ist, entscheidet für mich nicht, welchen Satz ich als Nächstes fragen sollte.
Wenn ich es selbst benutze, ist die Teilung ziemlich hart. Was sich erschöpfen lässt und dessen Bedingungen stabil sind, schreibe ich immer noch als Regeln. Ich gehe nicht hin und frage es. Was Instinkt in einem Punkt beantworten kann, dann frage ich es. Bevor ich frage, muss die Frage geschlossen sein, und ich muss den Zustand vorbereiten können. Wenn es Zeit ist, aufzumachen und den Inhalt zu sagen, gebe ich es einem Chat-Modell. Das Falsche fragen, und die Langsamkeit und die Kosten sind mein Problem.
Quellen
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://docs.typesafe.ai/primitives