不會聊天的 Jev,為什麼反而適合 Agent
Agent 缺的常常是能直接進分支的判斷,不是另一段長文字。這篇說明三種題、workflow 評測在比什麼,以及為什麼熱路徑等不了一次聊天。
聯合作者:folkbench.com (Folkbench 是面向 AI API、模型服務及相關站點的可覆核評測與選擇平台,依據已發布的服務資料、價格、可用性、延遲與證據窗口,幫助用戶比較並選擇使用路徑。)
這一組共十篇:
- JEV - 關節不需要大腦
- JEV - 不會聊天的 Jev,為什麼反而適合 Agent
- JEV - “不能幻覺”說到哪一層
- JEV - 是非、單選、檔位,夠不夠當一門語言
- JEV - 大廠做得出,為什麼未必會做
- JEV - 我跑的兩個 demo
- JEV - 人從環的中間退到邊緣
- JEV - 過了那條線,我已經分不出誰更聰明
- JEV - 有些話不該問它
- JEV - 大道至簡、套件,還有一個不說話的
Agent 缺的常常不是另一段長文字。缺一個能直接進控制流的判斷。常見的就是這封告警關不關,這張發票付不付,這條 trace 要不要人看,下一句客服該不該升級。這些節點不是讓模型寫一篇分析。程式碼要的是一個能拿去比較、拿去分支的值。Jev 做的就是這個。
TypeSafe 的說法,意思就是前沿智力的一次函式呼叫。進來的是 state,出去的是型別化的機率決策。它不生成字串。給人看的句子,和給程式走的判斷,不是同一個出口。
出口先定死
現有大模型的輸出是字串。軟體要接著用。還得解析、校驗,再防著跑偏。欄位會多冒一個。整段話看起來完整,列舉對不上。人在對話方塊裡發現了,就再問一句。程式碼發現不了,就帶著錯往下走。錯埋到好幾層呼叫裡,模型再聰明也補不回。
Jev 把輸出空間事先定死。你先規定能返回什麼,它就只在這個空間裡給機率。型別錯誤在數學上不會發生。它交不回一份你沒定義過的形狀。這和判斷一定正確不是一回事。機率會偏,選項也會選錯。型別安全封的是形狀,不是對錯。形狀定了,後面的分支才寫得下去。你不用先從一段話裡把值撈出來。
題只有三種。
Noul 負責是非。模型給一個 0 到 1 的機率。靠近 1 是肯定,靠近 0 是否定。0.5 附近就是拿不準。它不另給置信度,機率本身就是訊號。Choice 是單選。選項你先列好,上限是 255 項。回來的是選中的那一項、每一項上的分佈,還有置信度。程式碼按這個分佈決定自己做,還是交給人。Score 是檔位。檔位從 2 檔到 10 檔,每一檔什麼意思由你寫。回來的是分數、檔位上的分佈,還有置信度。分數可以落在兩檔之間,表示程度上的位置。
是否題寫成條件判斷。單選和檔位不一樣,前者看落在哪個選項,後者拿分數去卡閾值。好問題一樣要窄。一個懂行的人看完材料,一秒就能做的判斷,才適合丟給它。客戶有沒有在要退款,是這種題。把這封信分析完再決定最佳行動,就不是這種題。後一句要的是慢推理。得拆開再問。拆開的題對著同一份 state,彼此獨立,一次請求裡一起回來。權重留在程式碼裡。政策改了,你改數字,不用重寫整段提示。
卡人的是岔口
真正卡人的經常就是這種節點。告警帶著機器上已有的記錄來,結論是關、轉給分析師,或立刻隔離。發票掛著訂單和到貨記錄,要拍板的是付、押著,還是退回。客服 Agent 跑完了,工具呼叫全在軌跡裡,有人得決定這條 trace 看不看、多久看。客戶又寫一封,執行緒和賬戶狀態都在。下一句該怎麼接、該不該升級,是同一個形狀的問題。
規則能寫死的部分,程式碼。脆的是寫不完的例外。收據對得上,事由卻含糊,軌跡裡還有一步看著怪。手寫邏輯碰到這些就碎。你把整段政策塞進一個 prompt,讓模型一次想完,條件語句少寫了。出口又變回一段文字。文字要進控制流,你還得再寫一層解析。那一層自己也會錯。
TypeSafe 的 workflow eval 測的就是這個接法。評測裡把任務拆成很多窄問題。能用程式碼定的就用程式碼。模型只回答程式碼定不了的判斷。公開的四條流程是安全事件、Agent trace 可觀測、發票處理、客服。同一套流程下,模型走 workflow,比把整段政策塞進一個 prompt 更準,花費和耗時也更低。四條任務平均下來,被測的模型都是這個方向。
後面的動作跟著機率走,不跟著一個拍死的標籤走。最後對外的結果仍是一個離散動作。中間那截工程每次都得做得一樣。
測的是靠近,不是更懂
這套評測不跟你辯論流程本身寫沒寫錯。它假設 harness 是對的。參考答案不是人工逐題標出來的金標。GPT-6 Astra 和 Claude Fable 5.1 在 high thinking 下對每個問題作答,兩家的回答再取平均。別的模型用廠商預設推理。流程定死以後才比得了。評測比的是接近那兩個大模型判斷的程度,還有速度和費用。
所以這張圖證明不了 Jev 比 Astra 更懂業務。Astra 和 Fable 在這裡是尺子。Jev 要靠近它們的判斷,還得把延遲和費用拉開。題拆錯了,尺子再近也沒用。拆題是寫流程的人的事。
Jev 在這張“又快又便宜”的前沿上很靠外。官網那組更高的倍數,大約快 193.6 倍、便宜 444.6 倍,是這套評測裡偏高的一端。這個倍數不是每通電話都這樣。這裡的呼叫更接近真要上線的自動化負載。
它接近的是拆開之後那些窄問題上的機率,不是一篇長分析的寫法。Jev 不寫這種長分析。
熱路徑等不了
延遲對 Agent 是硬的。人對 3 秒還能等。一層套一層,就不能等了。同一條鏈路裡還有檢索、寫庫和下一次呼叫,每一跳吃的是同一份時間。70 毫秒到 500 毫秒這個區間,判斷才能放進熱路徑。出了這個區間,呼叫棧就把它當成阻塞。
現有的前沿模型和人說話,端到端從 3 秒到 300 多秒都很常見。這個速度拿去當副駕駛,或是給人盯著的程式設計代理用,說得通。放進熱路徑當條件判斷,這個速度就說不通。Jev 不逐 token 往外蹦句子,該返回的機率一次給齊。速度是從這裡來的。
TypeSafe 還拿 Jev 做校驗。別的模型的提示、推理痕跡和輸出,Jev 來打分,也做護欄和查越獄。生成還是聊天模型的事。過不過這一關,由一個不會生成字串的模型來定。這是 Agent 裡的關節,不是聊天。點頭和複查要是還停在長文字上,你就得再找程式去讀。Jev 把結果收成機率和檔位,複查就能寫成程式碼。
寫給使用者看的那一句,還是聊天模型的事。Jev 不接這一句。它接前面的分流,也接後面的檢查。Agent 在這裡缺的不是再來一段更長的解釋,是一個型別已經定好、程式碼拿來就能走的判斷。
參考資料
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://docs.typesafe.ai/primitives
系列
- 上一篇:JEV - 關節不需要大腦
- 下一篇:JEV - “不能幻覺”說到哪一層