Menschen treten aus der Mitte der Schleife an den Rand
Auffangen und das Ansehen jeder Frage werden getrennt. Ja-Nein und Einfachauswahl mit hoher Konfidenz gehen direkt in einen Zweig. Ein Mensch behandelt nur die Scheibe, die zurückprallt, und die Konfidenz muss wirklich als Schwelle funktionieren.
Mitautor: folkbench.com (Folkbench ist eine überprüfbare Bewertungs- und Auswahlplattform für KI-APIs, Modelldienste und verwandte Sites. Sie nutzt veröffentlichte Angaben zu Diensten, Preisen, Verfügbarkeit, Latenz und Evidenzfenstern, damit Nutzer Wege vergleichen und einen davon wählen können.)
Zehn Texte in dieser Reihe:
- JEV - Ein Gelenk braucht kein Gehirn
- JEV - Warum ein Jev, das nicht chatten kann, zu einem Agent passt
- JEV - Wie weit „kann nicht halluzinieren“ wirklich reicht
- JEV - Reichen Ja-Nein, Auswahl und Stufe als Sprache?
- JEV - Ein Labor könnte das bauen. Warum es das vielleicht trotzdem nicht tut.
- JEV - Die zwei Demos, die ich laufen ließ
- JEV - Menschen treten aus der Mitte der Schleife an den Rand
- JEV - Jenseits dieser Linie kann ich nicht mehr sagen, wer klüger ist
- JEV - Manche Fragen gehören nicht zu ihm
- JEV - Ein reduziertes Modell, eine Suite und eines, das nicht spricht
In den vergangenen zwei Jahren hat fast jedes ernsthafte KI-System, das ich gesehen habe, einen Menschen in der Schleife angenommen, das, was man human in the loop nennt. Auf die Ausgabe ist kein Verlass. Das System schreibt eine Passage zu Ende und weiß selbst nicht, ob die Passage sich direkt benutzen lässt, also muss ein Mensch sie auffangen.
Hält man das Auffangen durch, wird daraus, dass ein Mensch jedes Urteil ansieht. Darauf bin ich gestoßen. Einen Menschen nur zu rufen, wenn etwas schiefgegangen ist, ist selten. Ein Mensch, der die ganze Zeit in der Schleife sitzt, ist häufig. Wenn es wenige Fragen gibt, sieht dieser Blick noch nach Verantwortung aus. Wenn es viele gibt, lässt der Mensch sie nur durch die Hände gehen, und nach dem Durchgang läuft die Arbeit trotzdem weiter. Diese zwei Jahre habe ich das als Standardausrüstung eines ernsthaften Systems genommen. Ausgabe von dieser Form, und ein Mensch muss in der Mitte sitzen. Ich lese das nicht als Faulheit.
Später habe ich zwei Dinge getrennt. Auffangen heißt, ein Mensch steht an der Seite und wartet auf den Augenblick, der unsicher ist. Ein Mensch in jeder Schleife heißt, jede Frage muss durch seine Hände. Früher habe ich das als eine Sache behandelt, und dann konnte ich den Menschen aus den meisten Schleifen nicht herausnehmen. Wenn ich nicht einmal weiß, welche Frage unsicher ist, kann ich nur alle selbst ansehen.
Was das Modell mir gab, war eine Passage. Die Passage kann sehr vollständig geschrieben sein, und sie kann einem Schluss sehr ähnlich sehen, aber sie kann nicht in den Kontrollfluss eingehen. Ich muss zuerst lesen, lesen, zu welcher Seite sie die Sache bringen will, und dann den Zweig selbst setzen. Diesen Schritt kann ich nicht entfernen. Der Code will einen Wert, und die Passage ist noch kein Wert. Der Mensch bleibt in der Mitte der Schleife, weil der Zweig warten muss, bis ich zu Ende gelesen habe.
Was ich geprüft habe, war nicht die gelegentliche Ausnahme. Freigeben oder eskalieren, ich musste zuerst einen Grund zu Ende lesen, ein Stück nach dem anderen. Nach genug Lesen behandle ich ein vollständiges Stück Schrift als Denken, das schon fertig ist. Der Mensch saß immer noch in der Mitte der Schleife, und das Urteil war der Passage gefolgt.
Ein Urteil, klein genug für den Code
Jev dreht das um. Das Urteil wird klein genug und geschlossen genug gedrückt, um direkt in den Kontrollfluss des Codes einzugehen. Die Frage wird zugeschrieben, bevor sie gestellt wird: Ja-Nein oder Einfachauswahl, oder sonst ein Score. Das Modell beantwortet nur die Frage, die schon geschlossen wurde. Es erzählt die ganze Sache nicht als Passage. Die Antwort geht in einen Zweig. Ein Mensch ist nicht mehr in der Mitte.
Die Kleinheit, die ich meine, ist die Frage. Das Geschäft selbst ist nicht kleiner geworden. Das Geschäft bleibt so groß, wie es sein soll. Was kleiner wird, ist der Satz, der dem Modell gestellt wird. Dieser Satz muss in einen Zweig im Code eingehen können. Was nicht in einen Zweig eingehen kann, ist immer noch eine Notiz, die ein Mensch lesen muss, und der Mensch ist wieder in der Mitte der Schleife.
Daran halte ich mich, wenn ich die Frage schreibe. Wenn sich die Optionen schreiben lassen und die Grenzen sich nicht streiten, kann die Frage gestellt werden. Wenn ich nur „entscheiden Sie nach Augenmaß“ schreibe, ist das keine geschlossene Frage. Entweder urteile ich sie immer noch selbst, oder sie wird eine längere Passage. Die behalte ich. Ich frage das Modell nicht.
Genauer gesagt dreht es nicht den Menschen um. Es dreht um, dass „jedes Urteil einen Blick eines Menschen braucht“. Jede Frage trägt eine Konfidenz. Wenn der Konfidenz zu trauen ist, schickt das System nur die am wenigsten sichere Scheibe an einen Menschen. Der Mensch tritt aus der Mitte der Schleife an den Rand. Auf dem Teil, der sicher ist, erscheint der Mensch nicht mehr.
Ich behalte vier flache Bilder im Kopf: ob ein Alarm geschlossen wird, ob eine Rechnung bezahlt wird, ob der nächste Satz im Kundendienst eskaliert und ob ein Lauf eines Agent einen Menschen zum Hinsehen braucht. Es ist dieselbe Art Sache. Das Geschäft wird zuerst in geschlossene kleine Fragen geteilt, und der Code geht vom Ergebnis aus. Der Mensch stand früher in der Mitte dieser Schleifen. Nach der Teilung müssen die meisten Zweige keinen Menschen rufen.
Ich behandle nur, was zurückprallt
So benutze ich es. Ja-Nein und Einfachauswahl mit hoher Konfidenz gehen direkt in einen Zweig. Ich öffne den Inhalt nicht. Ein Score, der auf einer mittleren Stufe landet, mit einer flachen Verteilung, ist das, was zu mir zurückprallt. Einer, der nur auf einer mittleren Stufe landet, mit einer Verteilung, die nicht flach ist, den sehe ich auch nicht an. Der Code läuft weiter. Es gibt keinen dritten Weg. Ich lasse es nicht zuerst einen Grund schreiben und entscheide dann danach, ob ich hinsehe. So gemacht, geht ein Mensch immer noch jede Frage durch. Was zurückprallt, ist nur eine kleine Scheibe, und die kann ich nehmen. Als ich früher jede Frage durchgehen ließ, konnte ich zu Ende sehen und immer noch nicht sagen, was ich geurteilt hatte.
Wenn es herüberprallt, die Verteilung ansehen, nicht ein langes Stück. Ein langes Stück entführt einen Menschen. Sobald der Grund ausgebreitet ist, ist der Schluss gewöhnlich schon gewählt, und die Wörter schreiben an diesem Schluss entlang nach unten. Ich habe vielleicht ein anderes Urteil, und ich muss die Passage trotzdem zuerst auseinandernehmen. Ich kann nicht auf den Satz zeigen, den es falsch hat. Ich bin nur weniger sicher als es, und es ist mir unangenehm, zurückzudrücken, und am Ende des Auseinandernehmens nicke ich oft mit. Eine Verteilung streitet nicht mit mir. Wie schwer jede Stufe ist, liegt da. Die flache Stelle sehe ich auf einen Blick. Wenn ich die Entscheidung ändere, ändere ich sie, ohne zuerst eine sehr voll geschriebene Passage schlagen zu müssen.
Ich bin immer noch in diesem System, und ich fehle in den meisten Schleifen. Die Zeit, in der es zurückprallt, ist die Zeit, die mir gehört. Was ich in der Hand habe, ist eine Verteilung, die sich nicht getrennt hat. Ich wähle selbst eine Seite. Der Code geht nach dem, was ich gewählt habe. Was sich schon getrennt hat, endet im Code, und ich bin nicht an der Reihe hinzusehen. Ich schreibe keine Passage mehr, um mit dem Modell zu verhandeln, und ich warte nicht, dass es mir eine Erklärung schickt.
Die Konfidenz muss als Schwelle funktionieren
Ich wage es, es so zu benutzen, unter einer Bedingung. Die Konfidenz muss wirklich als Schwelle funktionieren. Wenn das Modell die Fragen kann, aber nicht sagen kann, welches Mal es unsicher ist, kann ein Mensch die Mitte der Schleife immer noch nicht verlassen. Die offizielle Darstellung sagt, was sie mit RLCD trainieren, sei Kalibrierung: höhere Konfidenz ist genauer, und ähnliche Eingaben geben ähnliche Antworten. Dieser Richtung traue ich. Der erste Satz macht eine Schwelle sinnvoll. Den zweiten Satz kümmert mich mehr. Wenn ähnliche Fragen heute so und morgen anders sind, bleibt die Schwelle, die ich setze, nicht fest. Deshalb wage ich es, den Menschen aus der Mitte der Schleife zu bewegen.
Wenn die Konfidenz Schmuck ist, kehrt sich die Sache um. Der Mensch ist nicht an den Rand getreten. Der Mensch ist durch eine Maschine ersetzt worden, die besser darin ist, Sicherheit vorzuführen. Sie gibt jeder Frage eine sehr volle Zahl, und die Zahl hat nichts damit zu tun, ob sie genau ist. Wenn ich sie als Bedingung benutze, etwas durchzulassen, lasse ich los, wenn ich nicht sollte. In der Art, wie ich es jetzt benutze, tut es das nicht. Hohe Konfidenz gebe ich dem Code. Was zurückprallt, dessen Verteilung ist flach, ohne einen höflichen Satz der Unsicherheit daran.
Es gibt auch Zeiten, in denen ein Mensch zurücktreten muss. Was nicht gut geschlossen wurde, sollte nicht automatisiert werden. Einer Option fehlt ein Stück, oder zwei Grenzen sind verheddert, und die Konfidenz füllt nur eine Zahl auf einer schlechten Frage. Ich gehe zuerst zurück und ändere die Frage. Ich stütze die Lücke nicht mit dem Modell ab. Folgen, die zu groß sind, um sie mit einer Wahrscheinlichkeitsschwelle zu kaufen, lasse ich in der Schleife. Alle vier Bilder haben eine Schleife dieser Art, und wie hoch die Konfidenz auch ist, ich gebe sie keiner Schwelle. Das ist nicht das Modell, das versagt. Diese Schleife sollte nicht automatisiert werden.
Nachdem der Mensch an den Rand getreten ist, sind die Fragen, die ich ansehe, weit weniger. Die, bei denen ich sicher bin, sehe ich nicht mehr an. Die am wenigsten sichere Scheibe ist immer noch in meinen Händen. Schleifen, die keiner Schwelle gegeben werden sollten, in denen bleibt ein Mensch.