JEV - 人从环的中间退到边缘
把兜底和“每道题都要人看”拆开。高置信度的是非和单选直接进分支,人只处理弹回来的那一截,而且置信度得真能当门槛。
联合作者:folkbench.com (Folkbench 是面向 AI API、模型服务及相关站点的可复核评测与选择平台,依据已发布的服务资料、价格、可用性、延迟与证据窗口,帮助用户比较并选择使用路径。)
这一组共十篇:
- JEV - 关节不需要大脑
- JEV - 不会聊天的 Jev,为什么反而适合 Agent
- JEV - “不能幻觉”说到哪一层
- JEV - 是非、单选、档位,够不够当一门语言
- JEV - 大厂做得出,为什么未必会做
- JEV - 我跑的两个 demo
- JEV - 人从环的中间退到边缘
- JEV - 过了那条线,我已经分不出谁更聪明
- JEV - 有些话不该问它
- JEV - 大道至简、套件,还有一个不说话的
过去两年,我看到的严肃 AI 系统几乎都默认人在环里,也就是大家说的 human in the loop。输出不可预期。系统写完一段,自己也不知道这段能不能直接拿去用,就只能让人兜底。
兜底做着做着,就变成每个判断都要人看一眼。我碰到的就是这样。出事才把人叫来的少,人一直坐在环里的多。题不多时,这种看一眼还像负责。题一多,人只是过手,过完手,事情照样往下走。那两年我把这当成严肃系统的标配。输出长成那样,人就得坐在中间。我不把这理解成偷懒。
我后来把两件事分开。兜底是人站在边上,等拿不准的那一下。人在每一个环里,是每道题都要过手。以前我把这两件当成一件事,就没法把人从大多数环里拿出去。我要是连哪一题没把握都不知道,就只能全部自己看。
模型交给我的是一段话。话可以写得很完整,也可以很像一个结论,但它进不了控制流。我得先读,读出它想把事情带去哪一边,再自己下分支。这一步我拿不掉。代码要的是一个值,那段话还不是值。人待在环的中间,是因为分支得等我读完。
我审的不是偶尔的例外。放行还是升级,我都得先读完一段理由,一篇一篇来。读多了,我会把写得完整的当成已经想清楚的。那时候人还坐在环中间,判断跟着那段话走了。
判断小到能进代码
Jev 反过来。判断被压到足够小,也足够封闭,小到能直接进代码的控制流。题在问出去之前就写死,是非或者单选,再不然是一个 Score。模型只回答这道已经封好的题,不把整件事讲成一段话。答案进分支。中间不再经过人。
我这里说的小,指的是题,业务本身没有变小。业务该多大还是多大。变小的是问模型的那一句。那一句必须能进代码里的分支。进不了分支的,还是一篇要人读的说明,人就又回到环的中间。
我写题的时候就卡这个。选项写得出来,边界也不打架,这题才问出去。我要是只写下“看着办”,那就不是封闭的题。那要么还是我自己判,要么变成一段更长的话。这种我留着,不问模型。
更准确地说,它反的不是人,是“每个判断都要人看一眼”。每道题带置信度。置信度可信的时候,系统只把最没把握的那一小截送到人面前。人从环的中间退到边缘。有把握的部分,人不再出现。
我脑子里放着四个很浅的画面:告警关不关,发票付不付,客服下一句要不要升级,Agent 跑完要不要人看。都是同一类事:业务先拆成封闭的小题,代码再按结果走。人以前就站在这些环的中间。拆开之后,大多数分支不必再叫人。
我只处理弹回来的那截
我自己是这么用的。高置信度的是非和单选,直接分支。内容我不打开。Score 落到中间档,分布又平,这种才弹给我。只落在中间档、分布并不平的,我也不看,代码接着走。没有第三种做法。我不让它先写一段理由,再由我决定看不看。那样做,人还是要过每一道题。弹回来的只是一小截,我接得住。以前每道都过手,我看完也说不出自己判了什么。
弹过来的时候,要看分布,不要一段长文。长文会绑架人。理由一铺开,结论通常已经选完了,文字顺着这个结论往下写。我明明另有判断,也得先把那段话拆掉。我指不出它哪句写错,只是没有它那么确定,会不好意思反驳,拆到后面常常就顺着点了头。分布不跟我争。各档有多重,都摆在那里。平的地方我一眼能看见。我要改决定,就改,不用先胜过一段写得很满的话。
我还在这个系统里,大部分环里没有我。弹回来的那一次,才归我。我手上是一份没拉开的分布。我自己选边。代码按我选的走。已经拉开的,在代码里走完,轮不到我看。我不再写一段话跟模型商量,也不等它回我一篇解释。
置信度要真能当门槛
我敢这么用,有个前提。置信度得真能当门槛。模型会做题,但说不出自己哪次没把握,人还是没法离开环的中间。官方说,他们用 RLCD 训的就是校准:信心越高越准,相似的输入会给出相似的答案。我信这个方向。头一句让阈值有意义。后面那句我更在意,相似的题要是今天一个样、明天另一个样,我设的门槛就固定不住。所以我才敢把人从环中间挪走。
信心要是装饰,事情就反掉了。人没有退到边缘,是被换成了一个更会装确定的机器。它每道题都给一个很满的数字,数字和准不准没关系。我拿它当放行条件,就会在不该放手的时候放手。我现在的用法里,它没有这样。高置信度的,我交给代码。弹回来的,分布就是平的,没有配一句客气的没把握。
人也有必须站回来的时候。没封闭好的,别自动化。选项缺一块,或者两条边界缠在一起,置信度只是在坏题目上把数字做满。这种我先回去改题,不拿模型去顶。后果大到不能用概率阈值买的,我留在环里。四个画面里都有这种环,信心再高我也不把它交给阈值。那不是模型失败,是这个环不该自动化。
人退到边缘以后,我看的题少了很多。有把握的我不再看,最没把握的那一小截还在我手上。不该交给阈值的环,人继续留在里面。