我跑的兩個 demo
同一段業務狀態跑了兩個 demo:封閉題一次問完,再把置信度不夠的風險題停住。官方和 GPT-5.6 Terra 的並排只用來看不一致落在哪一道題。
聯合作者:folkbench.com (Folkbench 是面向 AI API、模型服務及相關站點的可覆核評測與選擇平台,依據已發布的服務資料、價格、可用性、延遲與證據窗口,幫助用戶比較並選擇使用路徑。)
這一組共十篇:
- JEV - 關節不需要大腦
- JEV - 不會聊天的 Jev,為什麼反而適合 Agent
- JEV - “不能幻覺”說到哪一層
- JEV - 是非、單選、檔位,夠不夠當一門語言
- JEV - 大廠做得出,為什麼未必會做
- JEV - 我跑的兩個 demo
- JEV - 人從環的中間退到邊緣
- JEV - 過了那條線,我已經分不出誰更聰明
- JEV - 有些話不該問它
- JEV - 大道至簡、套件,還有一個不說話的
今天我做了兩個 demo,試用 Jev。兩個都不是讓它聊天。我丟進一段業務狀態,問的是封閉題,看它回什麼。
狀態就是業務裡的一截,夠拿來判斷。我沒把它編成故事。聊天模型拿到這種輸入,常常先來一段理解,再跟建議。我不要建議。我想看它能不能待在流程中間當關節,吐出數來,讓程式碼接著走。
第一個 demo
我把那段狀態丟進去,封閉題一次問完。我點下去。一下就回來了。
官方寫著 70 到 500 毫秒。我沒掐表,說不出自己落在區間的哪一截。我這邊的感覺就是沒等到不耐煩。那些會寫長回覆的模型,我習慣把視窗晾著,自己先去幹別的。我這次晾都沒晾成。結果已經在頁面上了,我還沒來得及切走。
錢我單獨算過。輸出不收費。輸入是 $0.042 / 百萬 token。狀態不長的時候,一次的輸入花費,我得故意到賬上去找才看得見。拿來當關節,便宜。這種節點會重複走很多遍。輸出也計費的大模型,我問到第二句就會開始省。這裡我多問一道,沒有那個負擔。
題就是那三種。
是非我用 Noul 問。我問的是,這單該不該先從自動流程裡拎給一個人。它不回一個乾巴巴的“是”或者“否”。它回的是“是”的機率,落在 0 和 1 之間。我看它貼哪一頭。它要是貼著一頭,這道我就當成定了。它要是在中間晃,這道就還懸著。
歸類我用 Choice,是單選。選項和每項的意思都是我寫的。沒往 255 上堆。官方把上限放到 255,我這道用不著。項一多,我自己先看花。項少的時候我好判斷。重量明顯堆在一個選項上,其他選項都很薄,這種頭名我才讓它進分支。前兩名要是咬得很近,我不會因為有個第一名就收下。略高一點的第一名,還不算已經分開。
風險我用 Score 問,看它落在哪一檔。Score 這條譜是 2 到 10 檔。我這道就在這個範圍裡切,從輕到重。我沒有自己另起一套。它返回每一檔的機率,還帶一個按機率加權出來的位置。我不敢單獨用那個位置。機率要是堆在同一檔,位置說的就是這一檔。機率要是分在相鄰的兩檔,位置會掉在中間。這個位置看著更細,其實兩檔都還留著。這種位置我不會寫進後面的條件。
它不寫解釋。看機率,不看解釋。以前我拿聊天模型做同類判斷,結論包在一段話裡。我得把話剝開,才敢填進欄位,還怕把客氣當成了態度。今天沒有這層話。裡面就是型別和機率。這個 demo 我確認的就是,它適合當關節。我不用先讀完一篇短文,再去接程式碼。
取捨我按分佈來,不按一時的感覺。貼邊的是非,我讓它自動過,類別的重量堆在一項上,我也讓程式碼接上。風險那道分佈沒聚攏,我沒在這個 demo 裡寫死,留到下一個再看。
第二個,把同一件事拆開
第二個 demo 用的還是這段狀態。我沒另找一段新的。我把問題拆開,想驗證的就是那句,人不用站在每個環中間。
置信度高的,我準備交給程式碼。低的,我才留下來看。我試下來,高的那幾道我願意撒手。是非貼邊的,還有類別一邊倒的,我都讓程式自己走。高的,直接寫進分支。規矩寫在程式碼裡。置信夠了,程式就繼續。置信不夠,程式就停到我面前。我翻日誌的時候,那些高的環沒有等我點頭。我沒有再逐條確認。
偏低的是風險那一道。我問得不夠死,狀態裡也缺少能把相鄰兩檔分開的材料。分佈攤著,置信度起不來。我看著的時候其實想替它選一檔,好讓整條流程能走完。這個想法不能跟。攤開了,不想替它拍板。我要是隨手挑一檔寫進去,後面的步驟會把這一檔當成事實。那就是我在補一個它沒做的決定,裝成它已經答完了。
於是這道題停了。它留給我看,不進自動分支。我沒有再跑一次去碰運氣。材料還是這些,分佈多半還是攤的。這道題它不該硬答。以後我可以把狀態補厚,也可以把檔位寫成真正隔得開的說法。我現在要是逼它出一個檔,拿回來的就是平均數。我要是把這個數放進分支,後面就會把它當成已經定了的風險。
我沒有在旁邊寫上“我覺得更嚴重”。我的感覺不能壓過一條攤開的分佈,再送去自動執行。分佈要是真的偏,重量會自己堆到一邊。它堆不過去,我就沒有立場幫它堆。第二個 demo 我做到這兒就停了。
官方那個並排
兩個 demo 做完,我才去開啟官方 playground 裡那個並排的例子。一邊是 Jev,一邊是 GPT-5.6 Terra。Terra 用的是預設推理。我不是去判誰更聰明。我只看不一致落在哪道題。
我對了一遍。只有 “Churn likelihood level” 這一題兩邊不一樣。別的題是齊的。這題本身就含糊。流失可能有多高這件事,本來就不容易收成一個乾脆的檔。含糊的時候,它給的是分佈。另一邊要把回答做完,就得吐出一個詞。我沒把這個不一致記成輸贏。它給分佈,比硬吐一個詞誠實。那個詞可以放進人說的句子裡,放進會自己執行的分支就不合適。
我回頭看了看自己那道偏低的風險。我那道跟這個並排是同一類。旁邊沒有第二個模型,我也不該把攤開的機率捏成一個檔。
不會聊天這件事,我一開始當成缺陷。我用下來不這麼看。返回裡沒有開場白。我不用刪它的開場白。以前我從聊天接口裡摳一個判斷,得先跳過客套,還得防著它在後面改口。今天沒有這段要收拾的文字。這對我來說是解脫,少了一件容易做錯的事。
今天我跑的就是這兩個 demo。playground 裡那個並排,我只是開啟看了看,不算又做了一個。頭一個讓我確定,它能放在關節上,置信度高的可以交給程式碼。後一個裡,那道分佈攤開的題我停住了,沒有裝成它已經答完。它快,這個價拿來反覆呼叫我也覺得便宜。回來的不是文章,是分佈。
參考資料
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://console.typesafe.ai/playground?share=shr_13a74b495fb786c4bd7964f11597301e7c9
系列
- 上一篇:JEV - 大廠做得出,為什麼未必會做
- 下一篇:JEV - 人從環的中間退到邊緣