JEV - 我跑的两个 demo

同一段业务状态跑了两个 demo:封闭题一次问完,再把置信度不够的风险题停住。官方和 GPT-5.6 Terra 的并排只用来看不一致落在哪一道题。

联合作者:folkbench.com (Folkbench 是面向 AI API、模型服务及相关站点的可复核评测与选择平台,依据已发布的服务资料、价格、可用性、延迟与证据窗口,帮助用户比较并选择使用路径。)

这一组共十篇:

今天我做了两个 demo,试用 Jev。两个都不是让它聊天。我丢进一段业务状态,问的是封闭题,看它回什么。

状态就是业务里的一截,够拿来判断。我没把它编成故事。聊天模型拿到这种输入,常常先来一段理解,再跟建议。我不要建议。我想看它能不能待在流程中间当关节,吐出数来,让代码接着走。

第一个 demo

我把那段状态丢进去,封闭题一次问完。我点下去。一下就回来了。

官方写着 70 到 500 毫秒。我没掐表,说不出自己落在区间的哪一截。我这边的感觉就是没等到不耐烦。那些会写长回复的模型,我习惯把窗口晾着,自己先去干别的。我这次晾都没晾成。结果已经在页面上了,我还没来得及切走。

钱我单独算过。输出不收费。输入是 $0.042 / 百万 token。状态不长的时候,一次的输入花费,我得故意到账上去找才看得见。拿来当关节,便宜。这种节点会重复走很多遍。输出也计费的大模型,我问到第二句就会开始省。这里我多问一道,没有那个负担。

题就是那三种。

是非我用 Noul 问。我问的是,这单该不该先从自动流程里拎给一个人。它不回一个干巴巴的“是”或者“否”。它回的是“是”的概率,落在 0 和 1 之间。我看它贴哪一头。它要是贴着一头,这道我就当成定了。它要是在中间晃,这道就还悬着。

归类我用 Choice,是单选。选项和每项的意思都是我写的。没往 255 上堆。官方把上限放到 255,我这道用不着。项一多,我自己先看花。项少的时候我好判断。重量明显堆在一个选项上,其他选项都很薄,这种头名我才让它进分支。前两名要是咬得很近,我不会因为有个第一名就收下。略高一点的第一名,还不算已经分开。

风险我用 Score 问,看它落在哪一档。Score 这条谱是 2 到 10 档。我这道就在这个范围里切,从轻到重。我没有自己另起一套。它返回每一档的概率,还带一个按概率加权出来的位置。我不敢单独用那个位置。概率要是堆在同一档,位置说的就是这一档。概率要是分在相邻的两档,位置会掉在中间。这个位置看着更细,其实两档都还留着。这种位置我不会写进后面的条件。

它不写解释。看概率,不看解释。以前我拿聊天模型做同类判断,结论包在一段话里。我得把话剥开,才敢填进字段,还怕把客气当成了态度。今天没有这层话。里面就是类型和概率。这个 demo 我确认的就是,它适合当关节。我不用先读完一篇短文,再去接代码。

取舍我按分布来,不按一时的感觉。贴边的是非,我让它自动过,类别的重量堆在一项上,我也让代码接上。风险那道分布没聚拢,我没在这个 demo 里写死,留到下一个再看。

第二个,把同一件事拆开

第二个 demo 用的还是这段状态。我没另找一段新的。我把问题拆开,想验证的就是那句,人不用站在每个环中间。

置信度高的,我准备交给代码。低的,我才留下来看。我试下来,高的那几道我愿意撒手。是非贴边的,还有类别一边倒的,我都让程序自己走。高的,直接写进分支。规矩写在代码里。置信够了,程序就继续。置信不够,程序就停到我面前。我翻日志的时候,那些高的环没有等我点头。我没有再逐条确认。

偏低的是风险那一道。我问得不够死,状态里也缺少能把相邻两档分开的材料。分布摊着,置信度起不来。我看着的时候其实想替它选一档,好让整条流程能走完。这个想法不能跟。摊开了,不想替它拍板。我要是随手挑一档写进去,后面的步骤会把这一档当成事实。那就是我在补一个它没做的决定,装成它已经答完了。

于是这道题停了。它留给我看,不进自动分支。我没有再跑一次去碰运气。材料还是这些,分布多半还是摊的。这道题它不该硬答。以后我可以把状态补厚,也可以把档位写成真正隔得开的说法。我现在要是逼它出一个档,拿回来的就是平均数。我要是把这个数放进分支,后面就会把它当成已经定了的风险。

我没有在旁边写上“我觉得更严重”。我的感觉不能压过一条摊开的分布,再送去自动执行。分布要是真的偏,重量会自己堆到一边。它堆不过去,我就没有立场帮它堆。第二个 demo 我做到这儿就停了。

官方那个并排

两个 demo 做完,我才去打开官方 playground 里那个并排的例子。一边是 Jev,一边是 GPT-5.6 Terra。Terra 用的是默认推理。我不是去判谁更聪明。我只看不一致落在哪道题。

我对了一遍。只有 “Churn likelihood level” 这一题两边不一样。别的题是齐的。这题本身就含糊。流失可能有多高这件事,本来就不容易收成一个干脆的档。含糊的时候,它给的是分布。另一边要把回答做完,就得吐出一个词。我没把这个不一致记成输赢。它给分布,比硬吐一个词诚实。那个词可以放进人说的句子里,放进会自己执行的分支就不合适。

我回头看了看自己那道偏低的风险。我那道跟这个并排是同一类。旁边没有第二个模型,我也不该把摊开的概率捏成一个档。

不会聊天这件事,我一开始当成缺陷。我用下来不这么看。返回里没有开场白。我不用删它的开场白。以前我从聊天接口里抠一个判断,得先跳过客套,还得防着它在后面改口。今天没有这段要收拾的文字。这对我来说是解脱,少了一件容易做错的事。

今天我跑的就是这两个 demo。playground 里那个并排,我只是打开看了看,不算又做了一个。头一个让我确定,它能放在关节上,置信度高的可以交给代码。后一个里,那道分布摊开的题我停住了,没有装成它已经答完。它快,这个价拿来反复调用我也觉得便宜。回来的不是文章,是分布。

参考资料

系列