チャットできない Jev が、なぜ Agent に合うのか

Agent に欠けているのは、しばしば分岐へ直接入れる判断であり、もう一段の長いテキストではありません。三つの問い、workflow 評価が比べているもの、ホットパスがチャットを待てない理由を説明します。

共著者:folkbench.com (Folkbench は、AI API、モデルサービス、関連サイト向けの、検証できる評価・選定プラットフォームです。公開されたサービス情報、価格、可用性、レイテンシ、証拠の期間をもとに、利用者が経路を比較して選べるようにします。)

この一連は、十篇です。

Agent に欠けているのは、しばしば、もう一段の長いテキストではありません。制御フローへ直接入れる判断です。いつものものは、この警報を閉じたままにするか、この請求書を払うか、この trace に人が要るか、次のカスタマーサービスの文を上げるべきか、です。これらのノードは、モデルに分析を書かせるためではありません。コードが要るのは、比べられて、分岐できる値です。Jev がするのは、それです。

TypeSafe の定式は、最前線の知能の、一回の関数呼び出しを意味します。入るのは状態です。出るのは、型の付いた確率的な決定です。文字列は生成しません。人のための文と、プログラムのための判断は、同じ出口ではありません。

先に、出口を固定する

今の大規模モデルの出力は、文字列です。続きが要るソフトウェアは、まだ解析し、検証し、ずれを防がなければなりません。余分なフィールドが現れます。段落は完全に見え、列挙は一致しません。チャット箱の人は気づいて、もう一度問います。コードは気づかず、誤りを連れたまま歩きます。呼び出しの何段も深く埋もれると、より賢いモデルでも戻せません。

Jev は、出力の空間を事前に固定します。何を返してよいかを言い、その空間の内側にしか確率を割り当てません。型エラーは、数学的に起きません。定義していない形は、返せません。それは、判断が正しいことと同じではありません。確率は誤った方へ傾き得ます。選択肢も、誤ったものであり得ます。型安全が閉じるのは形であり、正誤ではありません。形が固定されれば、そのあとの分岐は書けます。先に段落から値を掬わなくて済みます。

問いは、三つだけです。

Noul は真偽です。モデルは、0 から 1 の確率を与えます。1 に近ければ、はいです。0 に近ければ、いいえです。0.5 の近くは、確信がありません。別の確信度は付けません。確率そのものが信号です。Choice は単一選択です。選択肢を先に並べ、上限は 255 です。戻るのは、選ばれた選択肢、すべての選択肢の上の分布、そして確信度です。コードはその分布を使い、自分で動くか、人へ渡すかを決めます。Score は段階です。段階は 2 から 10 までで、各段階が何を意味するかはこちらが書きます。戻るのは、スコア、段階の上の分布、そして確信度です。スコアは二段階のあいだに着地でき、尺度の上の位置になります。

真偽は、条件として書きます。単一選択と段階は違います。前者は、どの選択肢に着いたかを見ます。後者は、スコアにしきい値をかけます。良い問いは、なお狭いです。領域を知る人が、材料を読んだあと一秒でできる判断。渡すのは、その種類です。顧客が返金を求めているかは、その種類の問いです。手紙の全体を読んでから、最善の行動を決めるのは、そうではありません。後の文が欲しいのは、遅い推論です。分けてから、問ってください。分けた問いは同じ状態に向き、互いに独立で、一回のリクエストで一緒に戻ります。重みはコードに残します。方針が変わったら、数を変えます。プロンプトの全体は、書き直しません。

人を止めるのは、分岐点です

人を実際に止めるのは、しばしばこの形のノードです。警報は、機械がすでに持っている記録と一緒に届き、結論は、閉じるか、アナリストへ送るか、今すぐ隔離するか、です。請求書は注文と配送記録に掛かっていて、誰かが、払うか、留めるか、戻すかを決めなければなりません。カスタマーサービスの Agent は終わり、ツール呼び出しはすべて trace のなかにあり、誰かが、この trace を見るか、どれほど早く見るかを決めなければなりません。顧客がまた書き、スレッドと口座の状態がどちらもあります。次の文をどう続けるか、上げるべきか。同じ形の問いです。

ルールが凍結できる部分は、コードです。脆いのは、書き切れない例外です。領収は一致し、理由は曖昧で、trace のなかの一歩が奇妙に見えます。手書きの論理は、ここで砕けます。方針の全体を一つのプロンプトへ詰め、モデルに一度考え抜かせると、条件文は少なく書けます。出口は、また一段のテキストへ戻ります。テキストが制御フローへ入るには、もう一層の解析を書きます。その層は、それ自身が誤り得ます。

TypeSafe の workflow 評価が測るのは、この繋ぎ方です。評価は、課題を多くの狭い問いに分けます。コードが決められるものは、コードが決めます。モデルが答えるのは、コードが定められない判断だけです。公開されている四つの流れは、セキュリティインシデント、Agent の trace の可観測性、請求書の処理、カスタマーサービスです。同じ流れの下では、workflow に乗ったモデルの方が、方針の全体を一つのプロンプトへ詰めるより正確で、費用も時間も少なくなります。四つの課題を平均すると、試されたモデルはその方向へ動きます。

そのあとの動作は、確率に従います。叩き閉じたラベルには従いません。システムを出る結果は、なお一つの離散的な動作です。真ん中のエンジニアリングは、毎回同じようにしなければなりません。

評価が測るのは、近さです

この評価は、流れそのものが誤って書かれたかについて、争いません。ハーネスは正しいと仮定します。参照の答えは、問いごとに人手で付けたゴールドラベルではありません。GPT-6 Astra と Claude Fable 5.1 が、high thinking の下で各問いへ答え、二つの答えが平均されます。他のモデルは、ベンダーの既定の推論を使います。流れが固定されてからでなければ、比べられません。評価が比べるのは、その二つの大規模モデルの判断へどれほど近いか、それに速度と費用です。

ですからこの図は、Jev が Astra より業務を理解していることを証明しません。ここで物差しなのは、Astra と Fable です。Jev は、その判断へ近づかなければなりません。遅延と費用でも、差を開けなければなりません。問いの分け方が誤っていれば、より近い物差しも助けません。問いを分けるのは、流れを書く人の仕事です。

Jev は、「速くて安い」のフロンティアの、かなり外側に座ります。公式サイトの、より高い倍数、およそ 193.6 倍速く、444.6 倍安い、は、この評価の高い端です。その倍数は、毎回の呼び出しではありません。ここでの呼び出しは、実際に出す自動化の負荷に、より近いです。

近づくのは、分けたあとの、あの狭い問いの上の確率です。長い分析の書き方ではありません。Jev は、その長い分析を書きません。

ホットパスは待てません

遅延は、Agent にとって硬いです。人は、三秒ならまだ待てます。層が層を包むと、待てません。同じ鎖には検索も、データベースへの書き込みも、次の呼び出しもあり、各ホップが同じ時間を使います。70 から 500 ミリ秒の内側なら、判断はホットパスに座れます。その範囲の外では、呼び出しスタックがそれをブロッキングとして扱います。

人と話すとき、今のフロンティアモデルは、端から端まで 3 秒から 300 秒超がよくあります。その速度は、コパイロットには筋が通ります。人が見ているコーディング Agent にも、筋が通ります。ホットパスの上の条件としては、その速度は筋が通りません。Jev は、文をトークンごとに出しません。戻るべき確率は、一緒に届きます。速度は、そこから来ます。

TypeSafe は、Jev を検査にも使います。他のモデルのプロンプト、推論の痕跡、出力を、Jev が採点し、ガードレールにもなり、ジェイルブレイクも探します。生成は、チャットモデルに残ります。この関門を通すかは、文字列を生成しないモデルが決めます。それは Agent のなかの関節であり、チャットではありません。うなずきと見直しがまだ長いテキストの上にあるなら、それを読む別のプログラムを探さなければなりません。Jev は結果を確率と段階へ閉じ、見直しはコードとして書けます。

ユーザーのために書かれる文は、なおチャットモデルの仕事です。Jev はその文を受けません。受けるのは、前の振り分けと、後ろの検査です。ここで Agent に欠けているのは、もう一つ、より長い説明ではありません。型がすでに固定され、コードがそれを持って歩ける判断です。

出典

シリーズ