私が走らせた二つのデモ

同じ業務の状態で、二つのデモを走らせました。閉じた問いは一回で問い、確信度が上がらないリスクの問いは止めました。公式の GPT-5.6 Terra との並びは、不一致がどの問いに落ちるかを見るためだけです。

共著者:folkbench.com (Folkbench は、AI API、モデルサービス、関連サイト向けの、検証できる評価・選定プラットフォームです。公開されたサービス情報、価格、可用性、レイテンシ、証拠の期間をもとに、利用者が経路を比較して選べるようにします。)

この一連は、十篇です。

今日、私は二つのデモを走らせ、Jev を試しました。どちらも、チャットを求めませんでした。私は一段の業務の状態を入れ、閉じた問いを問い、戻ったものを見ました。

状態は、業務の一切れで、そこから判断するに足ります。私はそれを物語にしませんでした。チャットモデルは、この種の入力を与えられると、しばしば理解の一段から始め、それから助言です。私は助言が欲しくありませんでした。私が見たかったのは、流れの真ん中に関節として留まり、数を出し、コードを続けられるか、です。

最初のデモ

私はその状態を入れ、閉じた問いを一回で問いました。私はクリックしました。すぐに戻ってきました。

公式の範囲は、70 から 500 ミリ秒です。私は計らなかったので、範囲のどこに着地したかは言えません。私が感じたのは、不機嫌になるところまで行かなかった、ということです。長い返信を書くモデルでは、私は窓を離して別のことをするのに慣れています。今回、私は窓を離すところまで行きませんでした。私が切り替える前に、結果はすでにページの上にありました。

金は、別に数えました。出力は課金されません。入力は、100万トークンあたり $0.042 です。状態が短いとき、一回の呼び出しの入力費用は、口座へ探しに行ってからでないと見えません。関節としては、安いです。このようなノードは、何度も歩かれます。出力も課金する大規模モデルでは、私は二文目から節約を始めます。ここでは、もう一つ問うことに、その負担がありません。

問いは、あの三つでした。

真偽には Noul を使いました。私が問うたのは、この注文を自動の流れから持ち上げ、先に人へ渡すべきか、です。それは素の「はい」や「いいえ」では返信しません。「はい」の確率で返信し、0 と 1 のあいだです。私は、どの端に張り付くかを見ます。一つの端に張り付けば、その問いを定まったものとして扱います。真ん中で揺れれば、その問いはなお開いています。

分類には Choice を使いました。単一選択です。選択肢と、それぞれの意味は、私が書きました。255 へ積みませんでした。公式の上限は 255 で、この問いにはそれが要りませんでした。項目が多すぎると、私自身が見られません。項目が少なければ、私は判断できます。重みが一つの選択肢へ明らかに積もり、他がとても薄い。その種の一位だけを、私は分岐へ入れます。上位二つが近くで噛み合えば、一位があるというだけでは受け取りません。少しだけ高い一位は、まだ分かれていません。

リスクには Score を使い、どの段階に着地するかを見ました。Score の尺度は、2 から 10 段階です。私はこの問いをその範囲の内側で切り、軽い方から重い方へ並べました。別の尺度は作りませんでした。それは各段階の確率と、それらの確率で重み付けされた位置を返します。私はその位置を、単独では使う勇気はありません。確率が一つの段階に積もれば、位置はその段階です。確率が隣り合う二段階に割れれば、位置は真ん中に落ちます。位置はより細かく見え、両方の段階はなおそこにあります。その種の位置を、私はあとの条件へ書きません。

それは説明を書きません。見るのは確率であり、説明ではありません。私がチャットモデルで同じ種の判断をしていたとき、結論は一段に包まれていました。フィールドへ埋める勇気の前に、私は語を剥がなければならず、丁寧さを位置と取り違えるのを恐れていました。今日、そのような語の層はありません。内側は、型と確率です。このデモが私に確認したのは、それが関節として合う、ということです。私は短いエッセイを読み終えてから、コードを繋がなくて済みます。

私は取捨を、その場の感覚からではなく、分布から取りました。端に張り付いた真偽は、自動で通しました。分類の重みが一つの項目に積もったものは、コードに繋がせました。リスクの問いの分布は集まらず、私はこのデモではそれを凍結しませんでした。次のものへ残しました。

二つ目は、同じものを分けます

二つ目のデモは、同じ状態を使いました。私は新しいものを探しに行きませんでした。私は問いを分け、人がすべてのループの真ん中に立たなくてよい、という文を確かめました。

確信度が高いものは、コードへ渡す用意がありました。低いものは、見るために残しました。試したあと、高いものは手放す気になりました。端に張り付いた真偽と、一方へ積もった分類は、プログラムに自分で歩かせました。高いものは、まっすぐ分岐へ入ります。規則はコードに書いてあります。確信度が足りれば、プログラムは続きます。確信度が足りなければ、プログラムは私の前で止まります。ログを読んだとき、あの高いループは私のうなずきを待っていませんでした。私は一つずつ確認しませんでした。

低いものは、リスクの問いでした。私はそれを十分きつく問わず、状態には、隣り合う二段階を分けられる材料も欠けていました。分布は広がり、確信度は上がりませんでした。見ているあいだ、私は実際には、それに段階を選んであげて、流れの全体が終わるようにしたくなりました。その考えには、従えません。いったん広がれば、私はそれに代わって閉じたくありません。気軽に段階を選んで書き込めば、あとの手順はその段階を事実として扱います。それは、それがしなかった決定を私が補い、すでに答え終えたものとして装うことです。

ですから、その問いは止まりました。私が見るために留まり、自動の分岐には入りませんでした。私は運を試すために、もう一度走らせませんでした。材料はなお同じで、分布はおそらくなお広がったままです。この問いは、強いるべきではありません。あとで私は状態を厚くでき、あるいは段階を、実際に隔たる言い方として書けます。今それに段階を強いて出せば、戻るのは平均です。その数を分岐へ入れれば、続くものはそれを、すでに決まったリスクとして扱います。

私はそばに、「私はより深刻だと感じる」とは書きませんでした。私の感覚は、広がった分布を上書きして、自動で走らせるために送れません。分布が本当に傾いていれば、重みは自分で一方へ積もります。積もり越えられなければ、私にはそれに代わって積む立場がありません。二つ目のデモは、そこで止めました。

公式の並び

二つのデモのあとでだけ、私は公式の playground のなかの並びの例を開きました。一方は Jev です。他方は GPT-5.6 Terra です。Terra は既定の推論を使っていました。私は、誰がより賢いかを判定しに行ったのではありません。不一致がどの問いに着地したかだけを見ました。

私は通して確かめました。両側で違ったのは、「Churn likelihood level」だけです。他の問いは揃っていました。問いそのものが曖昧です。離脱がどれほど高いかは、きれいな段階へ閉じにくいです。曖昧なとき、それが与えるのは分布です。他方は、答えを終えるために、語を出さなければなりません。私はその不一致を、勝ち負けとして記録しませんでした。分布を与える方が、語を強いて出すより正直です。その語は、人が言う文の内側に座れます。自分で実行する分岐には、属しません。

私は、自分の低いリスクの問いを振り返りました。私のものとこの並びは、同じ種類です。そばに二つ目のモデルはなく、私はなお、広がった確率を一つの段階へ摘まむべきではありません。

チャットできないことを、私は最初、欠陥として取りました。使ったあと、そのようには見ません。戻りに、開きの挨拶はありません。私は開きの挨拶を消さなくて済みます。以前、チャットのインターフェースから判断を掘っていたとき、私は先に儀礼を飛ばし、あとで考えを変えることも防がなければなりませんでした。今日、片付けるテキストはありません。私にとって、それは荷が下りることです。誤りやすいものが、一つ減ります。

今日私が走らせたのは、この二つのデモです。playground のなかの並びは、開いて見ただけです。私が作った三つ目には数えません。最初のものは、私にとって、それが関節の上に座れること、高い確信度はコードへ渡せることを、定めました。二つ目では、分布が広がった問いを止め、すでに答え終えたものとしては装いませんでした。それは速いです。この価格では、繰り返す呼び出しも安いと感じます。戻るのは記事ではありません。分布です。

出典

シリーズ