人從環的中間退到邊緣
把兜底和“每道題都要人看”拆開。高置信度的是非和單選直接進分支,人只處理彈回來的那一截,而且置信度得真能當門檻。
聯合作者:folkbench.com (Folkbench 是面向 AI API、模型服務及相關站點的可覆核評測與選擇平台,依據已發布的服務資料、價格、可用性、延遲與證據窗口,幫助用戶比較並選擇使用路徑。)
這一組共十篇:
- JEV - 關節不需要大腦
- JEV - 不會聊天的 Jev,為什麼反而適合 Agent
- JEV - “不能幻覺”說到哪一層
- JEV - 是非、單選、檔位,夠不夠當一門語言
- JEV - 大廠做得出,為什麼未必會做
- JEV - 我跑的兩個 demo
- JEV - 人從環的中間退到邊緣
- JEV - 過了那條線,我已經分不出誰更聰明
- JEV - 有些話不該問它
- JEV - 大道至簡、套件,還有一個不說話的
過去兩年,我看到的嚴肅 AI 系統幾乎都預設人在環裡,也就是大家說的 human in the loop。輸出不可預期。系統寫完一段,自己也不知道這段能不能直接拿去用,就只能讓人兜底。
兜底做著做著,就變成每個判斷都要人看一眼。我碰到的就是這樣。出事才把人叫來的少,人一直坐在環裡的多。題不多時,這種看一眼還像負責。題一多,人只是過手,過完手,事情照樣往下走。那兩年我把這當成嚴肅系統的標配。輸出長成那樣,人就得坐在中間。我不把這理解成偷懶。
我後來把兩件事分開。兜底是人站在邊上,等拿不準的那一下。人在每一個環裡,是每道題都要過手。以前我把這兩件當成一件事,就沒法把人從大多數環裡拿出去。我要是連哪一題沒把握都不知道,就只能全部自己看。
模型交給我的是一段話。話可以寫得很完整,也可以很像一個結論,但它進不了控制流。我得先讀,讀出它想把事情帶去哪一邊,再自己下分支。這一步我拿不掉。程式碼要的是一個值,那段話還不是值。人待在環的中間,是因為分支得等我讀完。
我審的不是偶爾的例外。放行還是升級,我都得先讀完一段理由,一篇一篇來。讀多了,我會把寫得完整的當成已經想清楚的。那時候人還坐在環中間,判斷跟著那段話走了。
判斷小到能進程式碼
Jev 反過來。判斷被壓到足夠小,也足夠封閉,小到能直接進程式碼的控制流。題在問出去之前就寫死,是非或者單選,再不然是一個 Score。模型只回答這道已經封好的題,不把整件事講成一段話。答案進分支。中間不再經過人。
我這裡說的小,指的是題,業務本身沒有變小。業務該多大還是多大。變小的是問模型的那一句。那一句必須能進程式碼裡的分支。進不了分支的,還是一篇要人讀的說明,人就又回到環的中間。
我寫題的時候就卡這個。選項寫得出來,邊界也不打架,這題才問出去。我要是只寫下“看著辦”,那就不是封閉的題。那要麼還是我自己判,要麼變成一段更長的話。這種我留著,不問模型。
更準確地說,它反的不是人,是“每個判斷都要人看一眼”。每道題帶置信度。置信度可信的時候,系統只把最沒把握的那一小截送到人面前。人從環的中間退到邊緣。有把握的部分,人不再出現。
我腦子裡放著四個很淺的畫面:告警關不關,發票付不付,客服下一句要不要升級,Agent 跑完要不要人看。都是同一類事:業務先拆成封閉的小題,程式碼再按結果走。人以前就站在這些環的中間。拆開之後,大多數分支不必再叫人。
我只處理彈回來的那截
我自己是這麼用的。高置信度的是非和單選,直接分支。內容我不開啟。Score 落到中間檔,分佈又平,這種才彈給我。只落在中間檔、分佈並不平的,我也不看,程式碼接著走。沒有第三種做法。我不讓它先寫一段理由,再由我決定看不看。那樣做,人還是要過每一道題。彈回來的只是一小截,我接得住。以前每道都過手,我看完也說不出自己判了什麼。
彈過來的時候,要看分佈,不要一段長文。長文會綁架人。理由一鋪開,結論通常已經選完了,文字順著這個結論往下寫。我明明另有判斷,也得先把那段話拆掉。我指不出它哪句寫錯,只是沒有它那麼確定,會不好意思反駁,拆到後面常常就順著點了頭。分佈不跟我爭。各檔有多重,都擺在那裡。平的地方我一眼能看見。我要改決定,就改,不用先勝過一段寫得很滿的話。
我還在這個系統裡,大部分環裡沒有我。彈回來的那一次,才歸我。我手上是一份沒拉開的分佈。我自己選邊。程式碼按我選的走。已經拉開的,在程式碼裡走完,輪不到我看。我不再寫一段話跟模型商量,也不等它回我一篇解釋。
置信度要真能當門檻
我敢這麼用,有個前提。置信度得真能當門檻。模型會做題,但說不出自己哪次沒把握,人還是沒法離開環的中間。官方說,他們用 RLCD 訓的就是校準:信心越高越準,相似的輸入會給出相似的答案。我信這個方向。頭一句讓閾值有意義。後面那句我更在意,相似的題要是今天一個樣、明天另一個樣,我設的門檻就固定不住。所以我才敢把人從環中間挪走。
信心要是裝飾,事情就反掉了。人沒有退到邊緣,是被換成了一個更會裝確定的機器。它每道題都給一個很滿的數字,數字和準不準沒關係。我拿它當放行條件,就會在不該放手的時候放手。我現在的用法裡,它沒有這樣。高置信度的,我交給程式碼。彈回來的,分佈就是平的,沒有配一句客氣的沒把握。
人也有必須站回來的時候。沒封閉好的,別自動化。選項缺一塊,或者兩條邊界纏在一起,置信度只是在壞題目上把數字做滿。這種我先回去改題,不拿模型去頂。後果大到不能用機率閾值買的,我留在環裡。四個畫面裡都有這種環,信心再高我也不把它交給閾值。那不是模型失敗,是這個環不該自動化。
人退到邊緣以後,我看的題少了很多。有把握的我不再看,最沒把握的那一小截還在我手上。不該交給閾值的環,人繼續留在裡面。