大廠做得出,為什麼未必會做
2026 年 9 月 15 日 TypeSafe 放出 Jev,當時仍是 early access。這篇對照官方價格和訓練說法,說明輸出免費的判斷模型為什麼撞上按長輸出賣 token 的價目表。
聯合作者:folkbench.com (Folkbench 是面向 AI API、模型服務及相關站點的可覆核評測與選擇平台,依據已發布的服務資料、價格、可用性、延遲與證據窗口,幫助用戶比較並選擇使用路徑。)
這一組共十篇:
- JEV - 關節不需要大腦
- JEV - 不會聊天的 Jev,為什麼反而適合 Agent
- JEV - “不能幻覺”說到哪一層
- JEV - 是非、單選、檔位,夠不夠當一門語言
- JEV - 大廠做得出,為什麼未必會做
- JEV - 我跑的兩個 demo
- JEV - 人從環的中間退到邊緣
- JEV - 過了那條線,我已經分不出誰更聰明
- JEV - 有些話不該問它
- JEV - 大道至簡、套件,還有一個不說話的
2026 年 9 月 15 日,TypeSafe 放出 Jev,眼下還在 early access。這是他們第一款 System One 模型,只做判斷,不靠閒聊。創始人 Diogo Almeida,以前在 OpenAI 做指令跟隨,和 ChatGPT 那條研究有關。
Jev 本身沒有技術壁壘。任何一家模型廠商組一個小團隊,半個月就可以做出自己的版本。技術上擋不住。
官方確實做了新東西。他們上了新架構。取樣器是並行的,一次查詢把判斷出完,不用一個 token 一個 token 往下生。訓練方法他們另做了一套,叫 RLCD,按校準過的決定做強化學習。模型報出來的把握,得和後面做對的比例對上。這些是他們的實現。別人要模仿的是產品形態:不生成字串,只在封閉題上吐校準過的機率。題事先定死,模型交回一個帶機率的判斷,程式碼拿這個數去做分支。半個月仿的是這個形態,不是把 TypeSafe 的研究原樣抄走。要仿的人用不著先把那套研究拆開。
護城河談不上。形態一旦定下來,實現可以整套換掉。換掉以後,接進去的系統拿到的還是同一件事,前面是狀態,後面是一個判斷。
聊天模型的產出是字串。字串可以寫得很長,軟體真要用這段字串,還得再解析一次。Jev 不產字串。沒有那段能拉長的文字,輸出就沒有按長度往上加的賬。
大廠的價目表
看價就明白。Jev 的輸入是 $0.042 / 百萬 token,近乎免費,輸出免費。官方說,輸出便宜到不值得計量。他們也承認,沒法證明這個價格沒有補貼。長期看,他們預期價格往下走,不是往上走。
大廠的價目表是另一端。輸入從 $0.20 到 $10 / 百萬 token,輸出大約再貴 5 倍。聊天模型的錢在長輸出上。給人讀的回答,給代理接著執行的步驟,都得寫成一段文字。文字長了,錢就落在輸出這頭。輸入就算壓得很低,一次寫長的呼叫仍然是大頭。
兩邊對不上。大廠賣的是 token。這種模型輸出免費,輸入近乎免費,吃的就是 token 的生意。
這個衝突是結構性的。一個輸出免費的判斷模型用得越廣,原來那些“讓大模型做分類、做路由、做打分”的 token 就越沒人買。報銷核到收據,要判斷描述和憑據對不對得上。安全告警響了,要判斷這臺機器現在隔離不隔離。這類關節以前整包交給聊天模型,讓它寫一段理由,再把結論從文字裡摳出來。摳出來的文字按輸出計價,走更貴的那一檔。封閉題把判斷直接交出來,回來的是一組機率,長度事先就定了,沒有一段可以繼續往下寫的文字。理由可以不寫,這一檔收費就沒處落。
在位者損害的是自己的報表。模型用得越廣,自己原來那一欄掉得越快。這是從下方進入的生意。便宜的判斷貼著流程走,把本來要呼叫大模型的小決定換掉。換掉的不是上面那次寫長文的呼叫,是流程走到一半時非做不可的那個小決定。還得慢慢寫出來的呼叫,仍然賣得動。官方預期自家價錢繼續往下走,這也填不回在位者少掉的那一欄。
Jev 這個名字來自威廉·斯坦利·傑文斯。官方用煤和蒸汽機做類比。蒸汽機把燒煤的效率拉高以後,煤沒有因此少燒,反而燒得更多。效率上去,用量不會縮,會漲。便宜判斷會把用量打出來。以前問模型一次並不便宜,人只把最值錢的幾步交給模型,剩下的寫成死規則,或者自己看一眼。判斷便宜到能嵌進程式碼裡反覆問,原先不值得問的題會一起湧上來。上去的是次數。
打出來的用量,卻不是大廠今天最想賣的那種 token。單次寫出來的長度掉了,輸出還不收費。次數堆得再高,也進不了他們今天這張靠長輸出賺錢的表。
定義這種模型的人
難在人。
同時有業務視角和模型視角的人,才會看見系統裡到處是關節。關節要的東西和大腦不一樣。大腦要一段還能往下說的話。關節不要話,要一個能拿來分支的結果。機率靠譜,程式就接著走。機率要是拿不準,就留給人。只做模型的人,容易把這件事看成輸出格式。只做業務的人,容易覺得再調一次大模型也就夠了。兩個視角疊在一個人身上,他才會去定義這種模型。這樣的人少。排期裡不會自己冒出這一項。
用好這種模型,人碰到的是同一個難處。本能只能回答靠直覺答得了的問題。對不對,在定好的幾項裡選哪個,直覺答得了。要寫一段原來沒有的內容,要在沒有框住的題目裡把步驟想完,本能接不住,那是另一類模型的事。本能快,也便宜。程式要問的時候問它一次,時間和錢都扛得住。問得再多,題目也還是直覺接得住的那些。所以它會待在一直跑著的程式裡。
大廠做得出。人和算力都在。把輸出從字串收成封閉題,這件事工程上過得去,可不等於半個月就把 TypeSafe 的研究原樣做出來。半個月做出來的是一個能用的形態。TypeSafe 那套實現還在他們自己手裡。
那一欄眼下還在進賬。判斷一旦改成封閉題,輸出又做成免費,這欄會少一截。少掉的部分,季度報表裡看得見。更靠前的位置就留給還在把輸出寫長的專案。上下文繼續加,智慧體再多跑幾圈,多出來的正好是這張價目表認得的 token。
做得出,不會排在前面做。