關節不需要大腦

Jev 是 TypeSafe 的 System One 模型。它不寫自由文字,只對封閉問題返回機率,放在規則寫不盡、又不必先請一個聊天模型的節點上。

聯合作者:folkbench.com (Folkbench 是面向 AI API、模型服務及相關站點的可覆核評測與選擇平台,依據已發布的服務資料、價格、可用性、延遲與證據窗口,幫助用戶比較並選擇使用路徑。)

這一組共十篇:

基礎模型過了那條線。大多數人已經提不出超綱任務。你能想到的題,現有模型大體都能接住。再比誰更會聊,多出來的那一點撐不起一個新產品。差別開始在產品定義上。Jev 就是按這個階段定的。

它是 TypeSafe AI 的 System One 模型。不生成自由文字。你給它一段 state,文字或者程式狀態,再加一組封閉問題。每題返回一個機率分佈。

它賣的不是聊天能力。它賣的是系統裡的關節。

節點分幾種。有的能用規則寫死,寫死就完了。有的得展開著推理,還得對著人把話說完,那是大腦的活。中間剩一批。規則寫不盡。上一個大腦,浪費。關節安在這批節點上。

彎一下就行

走路的時候,膝蓋不請示大腦。地面硬了就彎一點。坡陡了就頂住。沒有說明,也沒有草稿。

關節不需要智慧。關節只需要本能。本能高於規則。能窮盡的交給規則,狀態對上了就走那條分支,對不上就停。規則寫盡了仍判不了、熟手卻一眼有傾向的,交給本能。要鋪開理由、要對人說話,再把智慧請上來。別指望一道題同時幹規則和大腦的活。

Jev 待在中間這一層。問題封閉,答案的形狀也封閉。機率可以散,散就是拿不準。它只在你給定的答案裡分配機率。官方把合適的問題卡得很死:懂行的人看著上下文,一秒裡能做的判斷。得分析半天的,整題扔進來就不對,要拆成幾問。

這很像前 GPT 時代的通用分類器,乾的還是同一類活。語義理解更好,速度更快。繞彎的話讀得懂,程式狀態裡夾著的意圖也讀得懂。別拿它去聊天。

官方定位叫 System One。借 Kahneman 的系統一,快,直覺。步驟攤開寫給人看的那種慢思考,不在這個定位裡。

名字來自 William Stanley Jevons。煤和蒸汽機效率提高之後,需求沒有下降,反而上升。官方用這個名字,是說判斷一便宜,系統裡要判斷的節點會跟著變多。

就這三種題

題型只有三種。

是非,叫 Noul。一句能用真假收住的話。回來的是“是”的機率,落在 0 到 1。程式碼拿這個數卡閾值。過了就執行。沒過的停住,或交給人。

單選,叫 Choice。選項事先給死,最多 255 項。每一項後面可以跟一句,這項指什麼。回來的是整張分佈,再標出機率最高的那一項。列表裡沒有的,它不補。

有序檔位,叫 Score。2 到 10 檔。從低到高排好,每一檔寫成具體情形。別只丟一個數字給它。落點可以停在兩檔中間,每一檔的機率都還在。業務上要整數,程式碼裡收。

三種能擱在同一次請求裡問。同一段 state,各問各的。是非不替單選打草稿。用哪一題,丟掉哪一題,程式碼說了算。題多加幾道,時間幾乎不加。加的是題目自己那點 token。輸入按 token 計,多出來的開銷就那一點。

取樣不是聊天那套。官方說的是新架構,並行取樣。一次把所有輸出採出來。不逐 token。聊天模型慢,是因為一個詞得等下一個詞,輸出也跟著變貴。Jev 不一個詞一個詞往外長。

訓練方法叫 RLCD,Reinforcement Learning for Calibrated Decisions。目標放在校準:它報出的把握,得和實際判對的頻率對得上。不拿“讀起來像人”當目標。

輸入 $0.042 / 百萬 token。輸出免費。端到端大約 70ms 到 500ms。七十毫秒有,五百毫秒也有。官方同時給了智力上的判斷:System One 任務上,和現有大模型差不多,快一到兩個數量級。這句“差不多”只對封閉判斷有效。用它寫文章,或者把一個沒封口的問題聊完,都不算在裡面。

規則斷了再接

這類節點不稀奇。分類、路由、打分、稽核、風控,再加上 Agent 裡的判斷節點,都是這個形狀。工單該進哪個佇列,下一跳走哪段程式碼,投訴有多衝,一句話放不放行,一筆操作像不像該攔的異常,岔口上工具交不交出去。這些都問得很快,也都能收成封閉題。

規則能吃掉好寫的那一截。例外一多,條件越疊越纏。改一條,怕旁邊的一起失效,後來就沒人敢動。

也有人把整段 state 扔給會聊天的模型,讓它回一句建議。聊天模型做得到。節點要的只是一個傾向。你還得把句子解析成分支,失敗了再試。時間耗在文字的形狀上。

不是不能上大腦。這個節點不配先上。Jev 接的就是這一截。封閉問題進去,分佈出來。過不過線,升不升級,寫在旁邊的程式碼裡。流程怎麼走,仍是程式碼的事。

退款就能拆成三問:是不是在要退,要退、要改簽還是只問規則,火氣落在第幾檔。分別用 Noul、Choice、Score,看同一段 state。政策裡寫死的句子,留給規則去對。對不上的那些,就看分佈。給客戶的那封回信,不歸它寫。

Agent 也這麼拆。人最後讀到的那句,留給會說話的模型。中間的判斷不要步步叫醒一個大腦。叫醒一次,這一步就按聊天的耗時走。判斷換成關節,對外的回覆可以不動。

寫稿請換模型

寫文章不行。它不生成文字。題目和語氣放進 state,它仍只回答你寫好的封閉題。有沒有偏題,這種它能判。句子得另找模型出。

開放題別按進單選。“接下來怎麼辦”,辦法你還沒列完,Choice 裡就沒有那一格。先拆。能窮盡的留給規則。憑直覺就能答的,寫成這三種題。需要展開著推理、還得對人把話說完的,再上智慧。如果拆不開,這事還不是關節。

有人把 System One 聽成降檔。規則才更低。System One 是規則上面的本能。它快,而且不寫解釋。語義還得懂,不然規則就夠了。再上面才是智慧。官方給的智力是封閉任務上差不多,給的速度是快一到兩個數量級。有這一截速度,呼叫才能放進迴圈,不用幹等一次聊天結束。

基礎模型把大多數人提得出的題做平以後,產品要收成明確的介面。Jev 收成關節。聊天能力不賣。規則寫不盡、上一個大腦又浪費的那些節點。就是它的位置。

參考資料

系列