Les personnes passent du milieu de la boucle au bord

Rattraper un échec et regarder chaque question sont séparés. Le oui-non et le choix unique à haute confiance entrent directement dans une branche. Une personne ne traite que la tranche qui rebondit, et la confiance doit vraiment servir de seuil.

Co-auteur : folkbench.com (Folkbench est une plateforme vérifiable d’évaluation et de sélection pour les API d’IA, les services de modèles et les sites associés. Elle s’appuie sur les informations publiées sur le service, les prix, la disponibilité, la latence et les fenêtres de preuve pour aider les utilisateurs à comparer des voies et à en choisir une.)

Dix textes dans cette série :

Depuis deux ans, presque chaque système d'IA sérieux que j'ai vu suppose une personne dans la boucle, ce qu'on appelle human in the loop. La sortie ne peut pas se compter dessus. Le système finit un passage et ne sait pas lui-même si le passage peut servir directement, alors une personne doit le rattraper.

Le rattraper, tenu dans la durée, devient une personne qui regarde chaque jugement. C'est ce sur quoi je suis tombé. Appeler une personne seulement quand quelque chose a mal tourné est rare. Une personne assise dans la boucle tout le temps est courant. Quand il y a peu de questions, ce coup d'œil a encore l'air d'une responsabilité. Quand il y en a beaucoup, la personne ne fait que les faire passer, et après le passage le travail continue quand même. Ces deux années, j'ai pris cela comme l'équipement standard d'un système sérieux. Une sortie de cette forme, et une personne doit s'asseoir au milieu. Je ne lis pas cela comme de la paresse.

Plus tard j'ai séparé deux choses. Rattraper, c'est une personne debout sur le côté, qui attend le moment où l'on n'est pas sûr. Une personne dans chaque boucle veut dire que chaque question doit passer entre ses mains. Je traitais cela comme une seule chose, et alors je ne pouvais pas sortir la personne de la plupart des boucles. Si je ne sais même pas quelle question n'est pas sûre, je ne peux que toutes les regarder moi-même.

Ce que le modèle me remettait était un passage. Le passage peut être écrit très complet, et il peut beaucoup ressembler à une conclusion, mais il ne peut pas entrer dans le flux de contrôle. Je dois d'abord lire, lire de quel côté il veut emmener l'affaire, puis poser la branche moi-même. Je ne peux pas retirer ce pas. Le code veut une valeur, et le passage n'est pas encore une valeur. La personne reste au milieu de la boucle parce que la branche doit attendre que j'aie fini de lire.

Ce que je relisais n'était pas l'exception de temps en temps. Laisser passer ou escalader, je devais d'abord finir une raison, un morceau après l'autre. Après assez de lecture, je traite un écrit complet comme une pensée déjà finie. La personne était encore assise au milieu de la boucle, et le jugement avait suivi le passage.

Un jugement assez petit pour entrer dans le code

Jev renverse cela. Le jugement est pressé assez petit, et assez fermé, pour entrer directement dans le flux de contrôle du code. La question est écrite fermée avant d'être posée : oui-non, ou choix unique, ou bien un Score. Le modèle ne répond qu'à la question déjà fermée. Il ne raconte pas toute l'affaire comme un passage. La réponse entre dans une branche. Une personne n'est plus au milieu.

La petitesse dont je parle est celle de la question. Le métier lui-même n'a pas rapetissé. Le métier reste aussi grand qu'il doit l'être. Ce qui rapetisse, c'est la phrase demandée au modèle. Cette phrase doit pouvoir entrer dans une branche du code. Ce qui ne peut pas entrer dans une branche est encore une note qu'une personne doit lire, et la personne est de retour au milieu de la boucle.

Je tiens à cela quand j'écris la question. Si les options peuvent s'écrire, et que les bords ne se battent pas, la question peut être posée. Si je n'écris que « à votre jugement », ce n'est pas une question fermée. Soit je la juge encore moi-même, soit elle devient un passage plus long. Je garde celles-là. Je ne les demande pas au modèle.

Plus précisément, ce qu'il renverse, ce n'est pas la personne. C'est « chaque jugement a besoin qu'une personne y jette un œil ». Chaque question porte une confiance. Quand la confiance peut être crue, le système n'envoie à une personne que la tranche la moins sûre. La personne passe du milieu de la boucle au bord. Sur la partie qui est sûre, la personne n'apparaît plus.

Je garde quatre images peu profondes en tête : si une alerte est fermée, si une facture est payée, si la phrase suivante du service client escalade, et si une course d'Agent a besoin qu'une personne regarde. C'est le même genre de chose. Le métier est d'abord découpé en petites questions fermées, et le code avance à partir du résultat. La personne se tenait au milieu de ces boucles. Après le découpage, la plupart des branches n'ont pas à appeler une personne.

Je ne traite que ce qui rebondit

C'est ainsi que je m'en sers. Le oui-non et le choix unique à haute confiance vont droit à une branche. Je n'ouvre pas le contenu. Un Score qui tombe sur un niveau du milieu, avec une distribution plate, c'est cela qui me rebondit. Un qui ne tombe que sur un niveau du milieu, avec une distribution qui n'est pas plate, je ne le regarde pas non plus. Le code continue. Il n'y a pas de troisième façon. Je ne le laisse pas écrire une raison d'abord, puis décider, à partir de cela, si je regarde. Fait ainsi, une personne passe encore chaque question. Ce qui rebondit n'est qu'une petite tranche, et je peux la prendre. Quand je faisais passer chaque question, je pouvais finir de regarder et ne toujours pas dire ce que j'avais jugé.

Quand cela rebondit, regardez la distribution, pas un long morceau. Un long morceau kidnappe une personne. Une fois la raison étalée, la conclusion a d'habitude déjà été choisie, et les mots écrivent vers le bas le long de cette conclusion. Je peux avoir un autre jugement, et je dois quand même d'abord démonter le passage. Je ne peux pas montrer la phrase qu'il a mal écrite. Je suis seulement moins sûr que lui, et je me sens mal à l'aise de le contredire, et à la fin du démontage je hoche souvent la tête avec lui. Une distribution ne discute pas avec moi. Le poids de chaque niveau est étalé là. L'endroit plat, je le vois d'un regard. Si je change la décision, je la change, sans d'abord devoir battre un passage écrit très plein.

Je suis encore dans ce système, et je suis absent de la plupart des boucles. Le moment où cela rebondit est le moment qui m'appartient. Ce que j'ai en main est une distribution qui ne s'est pas séparée. Je choisis un côté moi-même. Le code avance selon ce que j'ai choisi. Ce qui s'est déjà séparé finit dans le code, et ce n'est pas mon tour de regarder. Je n'écris plus un passage pour négocier avec le modèle, et je n'attends pas qu'il m'envoie une explication.

La confiance doit vraiment servir de seuil

J'ose m'en servir ainsi à une condition. La confiance doit vraiment servir de seuil. Si le modèle peut faire les questions mais ne peut pas dire quelle fois il n'est pas sûr, une personne ne peut toujours pas quitter le milieu de la boucle. Le récit officiel dit que ce qu'ils entraînent avec RLCD, c'est la calibration : une confiance plus haute est plus exacte, et des entrées semblables donnent des réponses semblables. Je fais confiance à cette direction. La première phrase rend un seuil signifiant. La seconde phrase, j'y tiens davantage. Si des questions semblables sont d'une façon aujourd'hui et d'une autre demain, le seuil que je pose ne restera pas fixe. C'est pour cela que j'ose sortir la personne du milieu de la boucle.

Si la confiance est une décoration, la chose se retourne. La personne n'est pas passée au bord. La personne a été remplacée par une machine plus habile à jouer la certitude. Elle donne à chaque question un nombre très plein, et le nombre n'a rien à voir avec le fait d'être exact. Si je m'en sers comme condition pour laisser passer, je lâche quand je ne devrais pas. Dans la façon dont je m'en sers maintenant, il ne fait pas cela. Confiance haute, je la donne au code. Ce qui rebondit, la distribution est plate, sans phrase polie d'incertitude attachée.

Il y a aussi des moments où une personne doit revenir dedans. Ce qui n'a pas été bien fermé ne devrait pas être automatisé. Une option manque un morceau, ou deux bords sont emmêlés, et la confiance ne fait que remplir un nombre sur une mauvaise question. Je retourne d'abord changer la question. Je ne bouche pas le trou avec le modèle. Les conséquences trop grandes pour s'acheter avec un seuil de probabilité, je les laisse dans la boucle. Les quatre images ont toutes une boucle de ce genre, et si haute que soit la confiance, je ne la donne pas à un seuil. Ce n'est pas le modèle qui échoue. Cette boucle ne devrait pas être automatisée.

Après que la personne est passée au bord, les questions que je regarde sont bien moins nombreuses. Celles dont je suis sûr, je ne les regarde plus. La tranche la moins sûre est encore dans mes mains. Les boucles qui ne devraient pas être données à un seuil, une personne y reste.

Sources

Série