“不能幻覺”說到哪一層
TypeSafe 說 Jev 不能幻覺。這句話站住的只有型別:答案出不了事先給定的表。校準和對錯要分開看,workflow 評測對上的是 Astra 和 Fable 的平均。
聯合作者:folkbench.com (Folkbench 是面向 AI API、模型服務及相關站點的可覆核評測與選擇平台,依據已發布的服務資料、價格、可用性、延遲與證據窗口,幫助用戶比較並選擇使用路徑。)
這一組共十篇:
- JEV - 關節不需要大腦
- JEV - 不會聊天的 Jev,為什麼反而適合 Agent
- JEV - “不能幻覺”說到哪一層
- JEV - 是非、單選、檔位,夠不夠當一門語言
- JEV - 大廠做得出,為什麼未必會做
- JEV - 我跑的兩個 demo
- JEV - 人從環的中間退到邊緣
- JEV - 過了那條線,我已經分不出誰更聰明
- JEV - 有些話不該問它
- JEV - 大道至簡、套件,還有一個不說話的
TypeSafe 說 Jev “can’t hallucinate”。這句話聽上去像把幻覺一次禁掉。同一篇裡收窄了。他們寫的是,schema 匹配是保證,不是統計出來的,所以型別錯誤可以寫成 0%。按說一個反例就能打臉。他們說這在數學上不可能。
這句話能站住的,只有型別。Jev 放棄了字串生成,只交事先定好的結構,不交臨時生成的一段文字。機率準不準,判斷對不對,是另外兩件事。讀者要是不拆開,就會把“沒寫成散文”聽成“答案是對的”。
出不去那張表
題型只有三種,都封死。Noul 問一件事成不成立,交回來的是 0 到 1 的機率。Choice 的選項得呼叫方事先寫好,一張表最多 255 個。回來的是選中的那一項,附帶每一項的機率和一個置信度。Score 的檔位也得事先寫好,最少兩檔,最多十檔。分數可以落在兩檔中間。答案裡同時有各檔機率和置信度。這個分數仍是刻度上的位置,不是另起的一段話。
出不去選項表。模型也不能突然寫一段散文,拿文字把答案圓過去。文件說得很直。模型交回的是呼叫方提交的選項或檔位上的分佈,不會交分佈外面的值。程式碼可以直接用這些值,不用先從生成的段落裡把欄位摳出來。
聊天模型通常不是這樣交卷的。它們交字串。一段字串裡可能是正常回話,也可能是幻覺。軟體還得自己解析,自己校驗。校驗不過,程式就沒法直接往下用。TypeSafe 把型別安全和幻覺放在一起講,認為型別安全是做自動化的最低條件。型別如果錯在呼叫鏈深處,後面的分支會接到錯的地方。官方還寫了,現有模型再聰明,也仍會幻覺,也仍會出型別錯誤。
型別沒越界,判斷照樣可以錯。封閉題裡選錯,仍然是錯。安全告警那條公開流程,模型要在關掉、交給分析師、現在就控制住這三項裡選一個。三個選項都在表裡。模型要是選錯,型別還是合法的。
官方沒有把 System One 說成永遠正確。他們寫了,System 1 思考給人的印象就是容易出錯。他們相信 System One 模型可以做得比替代方案更穩。他們把具體理由留到以後再講。這是他們的路線,不是永遠正確。
Choice 還有一條硬邊。選項一超過 255,一張表就裝不下。維基競速這種走連結的題目,一步要在幾百到幾千個連結裡挑。他們改用兩段式,先分別打分,再做選擇。偶爾變慢。這種變慢在維基競速的 demo 裡出現過。高基數不是無限的。這裡的“不幻覺”仍然只是不會交一個表裡沒有的連結。選項不能無限往上加。
信心還得另看
校準是分開的一件事。官方的說法是,答案帶著機率和置信度。置信度更高的時候,準確率也更高。相似的輸入會給出相似的答案。對照那邊,他們寫聊天模型。就算提示它報一個信心,它也常常過度自信,而且不穩定。一個任務 95% 能做對,模型卻不說出哪 5% 沒把握,這個任務就自動化不了。
Choice 和 Score 的置信度,不是模型另外報上來的一句把握。這個數從分佈的形狀算出來。機率堆在一個選項或一檔上,數就高。機率攤開到好幾處,數就低。呼叫方看見數高就自己做,看見數低就交給人。Noul 不另附置信度。是或否那個機率本身就是訊號。官方對照表把機率和置信度寫在一起。這個說法落到三種題上,Choice 和 Score 兩者都有,Noul 只有機率。
置信度到了 1.0,只說明分佈全壓在一個結果上。它描述的是模型這份答案的形狀。分佈全壓在錯誤選項上的時候,置信度也可以很高。這個數大,並不等於結果是對的。
型別錯誤本身出不來。數學上不可能。校準沒有這層保證。官方給的是一條對應:置信度更高,準確率也更高。這條對應要是斷了,型別照樣出不去,只是置信度不再能當門檻。所以這層有機制,也有說法。數更高時出錯會不會更少,相似輸入會不會交回相近的分佈,這兩件都得另看。欄位每次都在,只說明呼叫方拿得到這個數。
對的不是世界
對錯還要再拆一次。workflow eval 比的是,同一套流程裡,模型離一份參考有多近。這份參考不是客觀世界的標準答案。他們假定流程程式碼是對的,不去爭標籤對不對。參考標籤是 GPT-6 Astra 和 Claude Fable 5.1 的平均。兩邊都用 high thinking,把流程裡每個問題答一遍。其餘模型按各自廠商的預設推理來比。
Jev 接近這個平均,也就是接近那兩個模型的合議。不能寫成比事實更真。合議要是偏了,貼著合議的答案也偏。官方寫了,用這兩家的平均當參考,答案會偏向 OpenAI 和 Anthropic 的模型。
比的時候,大模型被套進 System One LLM adapter,強迫它們也輸出結構化決策,這樣才能放進同一套題型裡比。官方承認,這種帶機率的問法,通常比不帶機率、直接給一個決定更慢,也更貴。他們的結論是,這是從大模型裡拿決策最準的辦法。這個準,是和不帶機率的決定比。這並不說明決策對上了外部事實。
圖上大模型的型別錯誤數字來自 OpenRouter,有偏差。複雜查詢可能被路由到更強的模型。Jev 那個 0% 不是同一類統計。官方寫明了,他們的數字不是經驗結果。schema 匹配有保證,圖上就可以填 0%。一邊是路由之後的觀測,另一邊是按保證填進去的數。這兩邊不是同一種錯誤率。
跟 GPT-5.6 Terra 並排的那次,用的是預設推理。官方挑這個模型,是因為他們看下來,它的智力平均起來最接近 Jev。錄下來的執行裡,唯一的不一致:Churn likelihood level。官方覺得這題含糊,答案說不清。含糊的題,分佈比一個硬標籤誠實。
“不能幻覺”說到底,指的就是不產生型別之外的輸出。他們因此才把型別錯誤寫成 0%。校準得單獨驗收,看置信度能不能拿來當門檻。判斷對不對,這套流程評測給不了世界本身的答案。它對上的是 Astra 和 Fable 的平均。
參考資料
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://github.com/typesafe-ai/system-one-adapter-python
- https://docs.typesafe.ai/primitives/choice
- https://docs.typesafe.ai/primitives/score
- https://docs.typesafe.ai/confidence