JEV - 有些话不该问它

用过之后记下不该问的几类话:解释为什么、写给人看的回复、在开放集合里起名、还得把推理过程留下。该问的仍是封闭的是非、类别、档位和要不要升级。

联合作者:folkbench.com (Folkbench 是面向 AI API、模型服务及相关站点的可复核评测与选择平台,依据已发布的服务资料、价格、可用性、延迟与证据窗口,帮助用户比较并选择使用路径。)

这一组共十篇:

我用过之后,最清楚的不是 Jev 会什么,是哪几类话我不该问。

我拿它当关节,不拿它当嘴。本能只能回答靠直觉答得了的问题。要展开的,或者得把推理摆出来给人看的,问 Jev 就是问错对象。要对人把话说完,那也问错了。它没有字符串。问了也装不进去。

不该问的

你要是也从聊天模型转过来,最容易问错的就是后面这几类。

解释为什么,我不该问。我从聊天那边带过来的习惯,张口就是让它解释一下。这习惯放在它身上不行。我让它解释的时候,等来的只有判断。理由得写成句子。写不出来。返回里没有那个“因为”。别人要看因果怎么来的,它给不了。真要一段原因,我另写,或者另请会说话的模型,按已经定下的判断去写。

写一段给人看的回复,我问错过。要发出去的是一段话。哪句先说,语气放多重,都在字里。它给的是选项和概率。这些对不上要发出去的那一段。概率再高,回来的也是我事先给的某一项,不是它现写的一段话。我后来把顺序换了。它只判断这东西属哪一类、这步要不要升级,句子交给聊天模型,或者我自己写。

让它在开放集合里自己想一个名字,我做过。能用的叫法多得很,写进题目的只是一小截。它只能在我给的项里挑,项里没有的,它变不出来。候选要是我自己也说不上来,就还没轮到它。我先用规则收一收,或者用检索掏出一小撮,再把题封闭。后来起名我改成这样:自己先定几个候选,再让它挑。清单外要一个全新的,我留在会说话的那一步。

还有一种,看着像该交给模型的重活。证据得来回翻,推理过程还得留下。两边材料顶着,既要它选边,又要它把怎么对上的留下来。它没有这个来回。一次请求,就是凭我放进 state 的东西做个快判断,过程不会变成能翻的文字。我说的来回,常常是结论依赖下一页,而这页还不在 state 里。这种依赖我放在代码里。先问一个封闭判断,再由我去取证据,取回来换一份 state,重新问。那一串先看了哪页、又排除了什么,它写不出。要留痕迹,我交给会说话的模型。

该问的

该问的,我现在只认几种形状。是不是这种,我直接问。类别得是我事先定好的那几类,它只负责点中一个。严重程度我不让它报细数,我划好档,让它说落在哪一档。还有升级,这步要不要交给人,也是封闭题,我一并问。形状不在这里面的,我不塞给它。

我另外有把粗尺子。懂这件事的人,看着眼前这份 state,靠直觉就能点一下的,才像它的题。点一下之前还得推演半天的,我直接交给会说话的模型。

state 我来准备。题我来封闭。进上下文的字段我自己收,跟这题无关的,我不带。选项和档的边界写在题目里,不写在指望它发挥的地方。它不负责把开口的问题收圆,也不替我翻下一页材料。材料一翻,state 就变了,那是下一次请求,还得我来备。

题没封闭好,我踩过。分布会摊平。几个选项挤在一起,谁也不高出一截。我起先当成它笨。不是这回事。是我把一张嘴的活塞给了关节。选项彼此重叠,或者真正会出现的情况没写进清单,概率就只能铺开。这时候改题,或者把这步交回会说话的模型。改题就是把重叠的项并掉,没盖住的情况给一个“都不是”。交回去,是让会说话的模型先把情况说清楚,我再决定要不要重新封闭。不要盯着它调。开口的题还开着,分布还是摊的。

Choice 和 Score

Choice 尽量不用满 255。官方上限就是 255。再多,他们自己也得先打分再选择,还会慢。255 在我这里不是要去凑的数。我越把边角情况都列进选项,题就越像一张没封口的清单。我的题如果自然就有几百个出口,我先想规则能不能把候选砍掉,检索能不能砍。一小撮没有固定个数。我扫一眼还能分清这些项差在哪,才算砍到位。扫一眼分不清,这会儿我发请求太早。砍到一小撮,我再拿去选。

Score 我当成有序的档,不当成连续的精确小数。我自己出题,档一般划在 2 到 10。我要的是档,不是 7.63 这种假精度。档我写成白话。这一档和下一档,处理上会不会不一样,我先想清楚,会不一样,我才拆开。两档最后触发的是同一段代码,我就并成一档。代码里没有哪条分支在等小数点后两位。两档中间它有时会落一个数,我还是按档读,阈值写在代码里。档的意思要是写不清,我改档的说明,不去抠那个小数。

看 demo 的时候

官方 Doom demo 和维基竞速,我看了,没有拿去替我的题做结论。我看 Doom 时容易被屏幕带跑。屏幕上像在玩游戏,吃进去的却是结构化状态,不是画面。Doom 这边是大约每秒 10 次查询、一小时 7 美元那种量级。这个量级只说明实时关节成立,循环按这个密度转得动,不说明它会打游戏。画面没吃进去。下一步是外面的代码拿着状态在问。

维基竞速说明高基数选链接有用。比会推理的模型更会逛网页,它说明不了。非推理对照下,它步数更少。那是对方没把推理打开,展示才比较好看。对方把推理打开,这展示就不那么好看。步数会变,谁更利索也会变。我不会把“步数少”带回自己的任务,当成它更会找路。路要不要继续走、走到哪停,还是外面的程序在定。我把这个当成不要用玩具判全部。展示顺不顺眼,这不替我决定后面哪句话该问。

我自己用的时候分得比较硬。能穷尽的,条件又稳定,我还是写规则,不拿去问它。直觉一下答得了的,我才问它。问之前题得封闭,state 也得我准备得了。轮到要开口把内容说出来,我交给聊天模型。问错了,慢和贵都是我的问题。

参考资料

系列