「ハルシネーションできない」は、どこまで届くか
TypeSafe は Jev がハルシネーションできないと言います。その文が立つのは型だけです。答えは事前に与えた表から出られません。キャリブレーションと正誤は分けて見てください。workflow 評価が揃うのは Astra と Fable の平均です。
共著者:folkbench.com (Folkbench は、AI API、モデルサービス、関連サイト向けの、検証できる評価・選定プラットフォームです。公開されたサービス情報、価格、可用性、レイテンシ、証拠の期間をもとに、利用者が経路を比較して選べるようにします。)
この一連は、十篇です。
- JEV - 関節に脳は要りません
- JEV - チャットできない Jev が、なぜ Agent に合うのか
- JEV - 「ハルシネーションできない」は、どこまで届くか
- JEV - 真偽、選択、段階は、言語として足りるか
- JEV - ラボには作れる。それでも、出さないかもしれない
- JEV - 私が走らせた二つのデモ
- JEV - 人はループの真ん中から、縁へ退く
- JEV - あの線を越えると、私にはもう誰が賢いか分からない
- JEV - それに問うてはいけない問いがある
- JEV - 削いだモデル、スイート、そして話さない一つ
TypeSafe は、Jev は「ハルシネーションできない」と言います。その文は、ハルシネーションが一撃で禁じられたように聞こえます。同じ篇は、それを狭めています。彼らが書いたのは、スキーマの一致は保証であり、統計ではない、だから型エラーは 0% と書ける、ということです。反例が一つあれば、反駁には足ります。彼らは、それは数学的に不可能だと言います。
その文が立てる層は、型だけです。Jev は文字列の生成を捨てました。事前に固定された構造を返し、その場で生成された一節のテキストは返しません。確率が正確か、判断が正しいかは、別の二つの事です。読む人が分けなければ、「散文を書かなかった」が、「答えは正しい」と聞こえます。
表から出られません
問いの型は三つだけで、どれも封じてあります。Noul は、一つのことが成り立つかを問い、戻るのは 0 から 1 の確率です。Choice の選択肢は、呼び出し側が事前に書かなければならず、一つの表で最大 255 です。戻るのは選ばれた選択肢で、各選択肢の確率と、一つの確信度が付きます。Score の段階も事前に書かなければならず、少なくとも二つ、多くても十です。スコアは、二段階のあいだに着地できます。答えは、各段階の確率と確信度を同時に運びます。そのスコアは、なお尺度の上の位置であり、新しい段落ではありません。
選択肢の表から出られません。モデルが急に散文を書き、答えを言葉で形にすることもできません。文書は、これをまっすぐ言います。モデルが返すのは、呼び出し側が提出した選択肢か段階の上の分布です。その分布の外の値は返しません。コードはこれらの値を直接使え、生成された段落からフィールドを先に掘らなくて済みます。
チャットモデルは、通常このやり方で仕事を渡しません。渡すのは文字列です。文字列は普通の返信かもしれず、ハルシネーションかもしれません。ソフトウェアは、なお解析し、検証しなければなりません。検証が失敗すれば、プログラムはそれを直接使えません。TypeSafe は型安全とハルシネーションを一緒に置き、型安全を自動化の最小条件として扱います。型が呼び出し鎖の深いところで誤っていれば、あとの分岐は誤った場所へ繋がります。公式の文章は、今のモデルはどれほど賢くてもなおハルシネーションし、なお型エラーを出す、とも書いています。
型の内側に留まることは、判断が誤ることを止めません。閉じた問いで誤った項目を選ぶのは、なお誤りです。公開されているセキュリティ警報の流れでは、モデルは、閉じる、アナリストへ渡す、今すぐ封じる、のあいだで選ばなければなりません。三つの選択肢は、どれも表の上にあります。モデルが誤ったものを選べば、型はなお合法です。
公式の説明は、System One を常に正しいとは呼びません。彼らは、System 1 の思考は誤りやすい印象を与える、と書きました。彼らは、System One モデルは代替より信頼できるようにできる、と信じています。具体的な理由は、あとへ残しています。それは彼らの方向です。「常に正しい」ではありません。
Choice には、もう一つの硬い縁があります。選択肢が 255 を越えると、一つの表には入りません。リンクを歩いて進む Wikipedia race は、一歩で数百から数千のリンクのなかから選ばなければなりません。彼らは二段に切り替えます。独立に採点し、それから選択します。ときどき遅くなります。その遅れは、Wikipedia race のデモに現れました。高い基数は、無限ではありません。ここでの「ハルシネーションしない」は、なお、表にないリンクは返さない、という意味だけです。選択肢は、上限なく足せません。
確信度は、別の問いです
キャリブレーションは、別の事です。公式の説明は、答えは確率と確信度を運ぶ、というものです。確信度が高いとき、精度も高いです。似た入力は、似た答えを返します。対照の側で、彼らはチャットモデルについて書きます。確信度を報告するよう促しても、しばしば自信過剰で、不安定です。課題が 95% の時間で正しくでき、モデルがどの 5% に確信がないかを言わなければ、その課題は自動化できません。
Choice と Score の確信度は、モデルが別に報告する確実さの文ではありません。その数は、分布の形から計算されます。確率が一つの選択肢か一つの段階に積もれば、数は高いです。確率が幾つかの場所へ広がれば、数は低いです。呼び出し側は、数が高いときに動き、低いときに人へ渡します。Noul は、別の確信度を付けません。はいなかの確率そのものが、信号です。公式の対照表は、確率と確信度を一緒に書いています。三つの問いに当てると、Choice と Score は両方を持ち、Noul は確率だけです。
確信度 1.0 は、分布が一つの結果へ完全に押し潰されている、という意味だけです。それが記述するのは、この答えの形です。分布が誤った選択肢へ完全に押し潰されていても、確信度はなお高くなり得ます。大きい数は、結果が正しいことを意味しません。
型エラーは出られません。それは数学的に不可能です。キャリブレーションには、その種の保証がありません。公式の説明が与えるのは、対応です。確信度が高いほど、精度が高い。その対応が切れれば、型はなお逃げられず、確信度はもうしきい値になれません。ですからこの層には仕組みがあり、主張があります。数が高いときに誤りが少ないか、似た入力が似た分布で戻るか、どちらも別に見なければなりません。フィールドが毎回あることは、呼び出し側がその数を読める、という意味だけです。
正しいのは、世界ではありません
正誤は、もう一度分けなければなりません。workflow 評価が測るのは、同じ流れの内側で、モデルが参照へどれほど近づくかです。その参照は、世界からの客観的な答えではありません。彼らは流れのコードは正しいと仮定し、ラベルが正しいかは論じません。参照ラベルは、GPT-6 Astra と Claude Fable 5.1 の平均です。どちらも high thinking を使い、流れのなかの各問いに答えます。他のモデルは、各ベンダーの既定の推論で比べられます。
Jev がその平均へ近づくことは、その二つのモデルの合意へ近づくことです。事実より真だとは書けません。合意が傾けば、合意に張り付いた答えも傾きます。公式の文章は、この二つを平均して参照にすると、答えは OpenAI と Anthropic のモデルへ偏る、と言っています。
比較のあいだ、大規模モデルは System One LLM adapter に包まれ、構造化された決定も出すよう強制されます。同じ問いの型の内側で比べるためです。公式の説明は認めています。確率を付けて問うのは、通常、確率なしで決定を与えるより遅く、高くなります。彼らの結論は、これが大規模モデルから決定を取る最も正確な方法だ、というものです。その正確さは、確率を運ばない決定と比べたものです。決定が外部の事実と一致した、という意味ではありません。
図の上の、大規模モデルの型エラーの数は OpenRouter から来ていて、偏っています。より複雑なクエリは、より強いモデルへ振り分けられるかもしれません。Jev の 0% は、同じ種類の統計ではありません。公式の文章は、彼らの数は経験的な結果ではない、と言います。スキーマの一致は保証されているので、図には 0% を埋められます。一方は、振り分けのあとの観測です。他方は、保証から埋められた数です。これらは同じ誤り率ではありません。
GPT-5.6 Terra との並びは、既定の推論を使いました。公式の説明がそのモデルを選んだのは、彼らの読みでは、その知能が平均して Jev に最も近いからです。記録された実行で、唯一の不一致は「Churn likelihood level」です。公式の見方は、その問いは曖昧で、答えはきれいに言えない、というものです。曖昧な問いでは、分布の方が、硬いラベルより正直です。
「ハルシネーションできない」は、結局、型の外の出力を出さない、という意味です。彼らが型エラーを 0% と書くのは、そのためです。キャリブレーションは、それ自身として受け入れなければなりません。確信度をしきい値として使えるか、によってです。判断が正しいかについて、この流れの評価は、世界自身の答えを与えられません。それが揃うのは、Astra と Fable の平均です。
出典
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://github.com/typesafe-ai/system-one-adapter-python
- https://docs.typesafe.ai/primitives/choice
- https://docs.typesafe.ai/primitives/score
- https://docs.typesafe.ai/confidence