人はループの真ん中から、縁へ退く

受け止めることと、すべての問いを人が見ることとは分けます。確信度の高い真偽と単一選択は、直接分岐へ入ります。人が扱うのは弾き返った一切れだけで、確信度は実際にしきい値として働かなければなりません。

共著者:folkbench.com (Folkbench は、AI API、モデルサービス、関連サイト向けの、検証できる評価・選定プラットフォームです。公開されたサービス情報、価格、可用性、レイテンシ、証拠の期間をもとに、利用者が経路を比較して選べるようにします。)

この一連は、十篇です。

この二年、私が見たほとんどすべての真剣な AI システムは、ループの内側に人がいると仮定していました。人々が human in the loop と呼ぶものです。出力は当てにできません。システムは一節を終えても、その一節を直接使えるか自分では知らないので、人が受け止めなければなりません。

受け止め続けると、それは、すべての判断を人が見ることに変わります。私が行き当たったのは、それです。何かが誤ってから人を呼ぶのは、稀です。人がずっとループに座っているのは、よくあります。問いが少ないとき、その一瞥はなお責任のように見えます。多いとき、人はただ通しているだけで、通したあとも仕事はとにかく進みます。あの二年、私はこれを、真剣なシステムの標準装備として取りました。出力があの形なら、人は真ん中に座らなければなりません。私はこれを、怠惰としては読みません。

あとで、私は二つのことを分けました。受け止めるとは、人が脇に立ち、確信のない瞬間を待つことです。すべてのループに人がいるとは、すべての問いが手を通らなければならない、ということです。以前、私はこれらを一つのこととして扱い、それからほとんどのループから人を出せませんでした。どの問いに確信がないかさえ知らなければ、私は全部を自分で見るしかありません。

モデルが私に渡したのは、一節でした。一節はとても完全に書け、結論によく似ても見えますが、制御フローには入れません。私は先に読み、事をどの方へ持っていきたいかを読み、それから自分で分岐を置かなければなりません。その一歩は外せません。コードが欲しいのは値であり、一節はまだ値ではありません。人がループの真ん中に留まるのは、分岐が、私が読み終えるまで待たなければならないからです。

私が見直していたのは、時折の例外ではありません。出すか、上げるか、私は先に理由を終えていなければならず、一篇のあと一篇です。十分読んだあと、私は完全な一篇の文章を、すでに終わった思考として扱います。人はなおループの真ん中に座っていて、判断は一節に従っていました。

コードへ入れるほど小さい判断

Jev は、それをひっくり返します。判断は、コードの制御フローへ直接入れるほど、小さく、閉じられて押されます。問いは、問われる前に閉じて書かれます。真偽か、単一選択か、さもなければ Score です。モデルが答えるのは、すでに閉じられた問いだけです。事の全体を一節としては話しません。答えは分岐へ入ります。人は、もう真ん中にいません。

私の言う小ささは、問いです。業務そのものは小さくなっていません。業務は、あるべき大きさのままです。小さくなるのは、モデルへ問う文です。その文は、コードのなかの分岐へ入れなければなりません。分岐へ入れないものは、なお人が読まなければならない注であり、人はループの真ん中へ戻ります。

私は問いを書くとき、これに固執します。選択肢が書け、境界が争わなければ、その問いは問えます。「判断して」とだけ書けば、それは閉じた問いではありません。なお自分で判断するか、より長い一節になるか、です。私はそれらを残します。モデルには問いません。

より正確に言えば、それがひっくり返すのは人ではありません。「すべての判断に、人の一瞥が要る」です。すべての問いは確信度を運びます。確信度を信頼できるとき、システムは最も確信の薄い一切れだけを人へ送ります。人は、ループの真ん中から縁へ退きます。確かな部分では、人はもう現れません。

私は、四つの浅い絵を心に置いています。警報を閉じるか。請求書を払うか。次のカスタマーサービスの文を上げるか。Agent の実行に、人が見る必要があるか。それらは同じ種類のものです。業務は先に閉じた小さな問いに分けられ、コードが結果から歩きます。人は、以前これらのループの真ん中に立っていました。分けたあと、ほとんどの分岐は人を呼ばなくて済みます。

私は、弾き返されたものだけを扱います

私は、こう使います。確信度の高い真偽と単一選択は、まっすぐ分岐へ行きます。私は内容を開きません。中間の段階に着地し、分布が平らな Score が、私へ弾きます。中間の段階に着地するだけで、分布が平らでないものは、私も見ません。コードが続きます。第三のやり方はありません。私は、先に理由を書かせ、それから見るかを決める、ということはさせません。そのやり方では、人はなおすべての問いを通ります。弾き返るのは小さい一切れだけで、私は受け取れます。以前すべての問いを通していたとき、私は見終えても、自分が何を判断したかを言えませんでした。

弾いてくるとき、見るのは分布であり、長い一篇ではありません。長い一篇は人を誘拐します。理由が広げられると、結論は通常すでに選ばれていて、言葉はその結論に沿って下へ書きます。私には別の判断があっても、先にその一節を分解しなければなりません。誤った文を指せません。それより確信が薄いだけで、押し返すのが気まずいです。分解の終わりには、しばしば一緒にうなずきます。分布は、私と争いません。各段階がどれほど重いかは、置いてあります。平らな場所は、一目で見えます。決定を変えるなら、変えます。とても満ちた一節に、先に勝たなくて済みます。

私はなおこのシステムのなかにいて、ほとんどのループからは不在です。弾き返るときが、私に属するときです。手のなかにあるのは、分かれなかった分布です。私は自分で側を選びます。コードは、私が選んだものによって歩きます。すでに分かれたものは、コードの内側で終わり、私が見る番ではありません。私はもう、モデルと交渉するために一節を書かず、説明が送られてくるのを待ちません。

確信度は、しきい値として働かなければなりません

私がこの使い方をする勇気があるのは、一つの条件によります。確信度は、実際にしきい値として働かなければなりません。モデルが問いをできても、どの回に確信がないかを言えなければ、人はなおループの真ん中を離れられません。公式の説明は、彼らが RLCD で訓練するのはキャリブレーションだ、と言います。確信度が高いほど正確で、似た入力は似た答えを与えます。私はその方向を信頼します。最初の文が、しきい値を意味あるものにします。二番目の文の方を、私はより気にします。似た問いが今日は一方、明日は他方なら、私が置いたしきい値は固定されません。私が人をループの真ん中から動かす勇気があるのは、そのためです。

確信度が飾りなら、事は反転します。人は縁へ退いていません。人は、確実さを演じるのがより上手い機械に置き換えられたのです。それはすべての問いにとても満ちた数を与え、その数は正確かと関係がありません。私がそれを通す条件として使えば、通すべきでないときに手放します。今の私の使い方では、それはそうしません。確信度が高いものは、コードへ渡します。弾き返るものは、分布が平らで、不確かさの丁寧な文は付いていません。

人が踏み戻らなければならないときもあります。よく閉じられていないものは、自動化すべきではありません。選択肢に一片が欠けているか、二つの境界が絡んでいると、確信度は悪い問いの上に数を埋めるだけです。私は先に戻って、問いを変えます。隙間をモデルで支えません。確率のしきい値では買えないほど大きい結果は、ループの内側に残します。四つの絵のどれにも、その種のループがあり、確信度がどれほど高くても、私はそれをしきい値へ渡しません。それはモデルの失敗ではありません。そのループは、自動化すべきではありません。

人が縁へ退いたあと、私が見る問いははるかに少なくなります。確かなものは、もう見ません。最も確信の薄い一切れは、なお私の手のなかにあります。しきい値へ渡すべきでないループには、人が内側に留まります。

出典

シリーズ