JEV - “不能幻觉”说到哪一层

TypeSafe 说 Jev 不能幻觉。这句话站住的只有类型:答案出不了事先给定的表。校准和对错要分开看,workflow 评测对上的是 Astra 和 Fable 的平均。

联合作者:folkbench.com (Folkbench 是面向 AI API、模型服务及相关站点的可复核评测与选择平台,依据已发布的服务资料、价格、可用性、延迟与证据窗口,帮助用户比较并选择使用路径。)

这一组共十篇:

TypeSafe 说 Jev “can’t hallucinate”。这句话听上去像把幻觉一次禁掉。同一篇里收窄了。他们写的是,schema 匹配是保证,不是统计出来的,所以类型错误可以写成 0%。按说一个反例就能打脸。他们说这在数学上不可能。

这句话能站住的,只有类型。Jev 放弃了字符串生成,只交事先定好的结构,不交临时生成的一段文本。概率准不准,判断对不对,是另外两件事。读者要是不拆开,就会把“没写成散文”听成“答案是对的”。

出不去那张表

题型只有三种,都封死。Noul 问一件事成不成立,交回来的是 0 到 1 的概率。Choice 的选项得调用方事先写好,一张表最多 255 个。回来的是选中的那一项,附带每一项的概率和一个置信度。Score 的档位也得事先写好,最少两档,最多十档。分数可以落在两档中间。答案里同时有各档概率和置信度。这个分数仍是刻度上的位置,不是另起的一段话。

出不去选项表。模型也不能突然写一段散文,拿文字把答案圆过去。文档说得很直。模型交回的是调用方提交的选项或档位上的分布,不会交分布外面的值。代码可以直接用这些值,不用先从生成的段落里把字段抠出来。

聊天模型通常不是这样交卷的。它们交字符串。一段字符串里可能是正常回话,也可能是幻觉。软件还得自己解析,自己校验。校验不过,程序就没法直接往下用。TypeSafe 把类型安全和幻觉放在一起讲,认为类型安全是做自动化的最低条件。类型如果错在调用链深处,后面的分支会接到错的地方。官方还写了,现有模型再聪明,也仍会幻觉,也仍会出类型错误。

类型没越界,判断照样可以错。封闭题里选错,仍然是错。安全告警那条公开流程,模型要在关掉、交给分析师、现在就控制住这三项里选一个。三个选项都在表里。模型要是选错,类型还是合法的。

官方没有把 System One 说成永远正确。他们写了,System 1 思考给人的印象就是容易出错。他们相信 System One 模型可以做得比替代方案更稳。他们把具体理由留到以后再讲。这是他们的路线,不是永远正确。

Choice 还有一条硬边。选项一超过 255,一张表就装不下。维基竞速这种走链接的题目,一步要在几百到几千个链接里挑。他们改用两段式,先分别打分,再做选择。偶尔变慢。这种变慢在维基竞速的 demo 里出现过。高基数不是无限的。这里的“不幻觉”仍然只是不会交一个表里没有的链接。选项不能无限往上加。

信心还得另看

校准是分开的一件事。官方的说法是,答案带着概率和置信度。置信度更高的时候,准确率也更高。相似的输入会给出相似的答案。对照那边,他们写聊天模型。就算提示它报一个信心,它也常常过度自信,而且不稳定。一个任务 95% 能做对,模型却不说出哪 5% 没把握,这个任务就自动化不了。

Choice 和 Score 的置信度,不是模型另外报上来的一句把握。这个数从分布的形状算出来。概率堆在一个选项或一档上,数就高。概率摊开到好几处,数就低。调用方看见数高就自己做,看见数低就交给人。Noul 不另附置信度。是或否那个概率本身就是信号。官方对照表把概率和置信度写在一起。这个说法落到三种题上,Choice 和 Score 两者都有,Noul 只有概率。

置信度到了 1.0,只说明分布全压在一个结果上。它描述的是模型这份答案的形状。分布全压在错误选项上的时候,置信度也可以很高。这个数大,并不等于结果是对的。

类型错误本身出不来。数学上不可能。校准没有这层保证。官方给的是一条对应:置信度更高,准确率也更高。这条对应要是断了,类型照样出不去,只是置信度不再能当门槛。所以这层有机制,也有说法。数更高时出错会不会更少,相似输入会不会交回相近的分布,这两件都得另看。字段每次都在,只说明调用方拿得到这个数。

对的不是世界

对错还要再拆一次。workflow eval 比的是,同一套流程里,模型离一份参考有多近。这份参考不是客观世界的标准答案。他们假定流程代码是对的,不去争标签对不对。参考标签是 GPT-6 Astra 和 Claude Fable 5.1 的平均。两边都用 high thinking,把流程里每个问题答一遍。其余模型按各自厂商的默认推理来比。

Jev 接近这个平均,也就是接近那两个模型的合议。不能写成比事实更真。合议要是偏了,贴着合议的答案也偏。官方写了,用这两家的平均当参考,答案会偏向 OpenAI 和 Anthropic 的模型。

比的时候,大模型被套进 System One LLM adapter,强迫它们也输出结构化决策,这样才能放进同一套题型里比。官方承认,这种带概率的问法,通常比不带概率、直接给一个决定更慢,也更贵。他们的结论是,这是从大模型里拿决策最准的办法。这个准,是和不带概率的决定比。这并不说明决策对上了外部事实。

图上大模型的类型错误数字来自 OpenRouter,有偏差。复杂查询可能被路由到更强的模型。Jev 那个 0% 不是同一类统计。官方写明了,他们的数字不是经验结果。schema 匹配有保证,图上就可以填 0%。一边是路由之后的观测,另一边是按保证填进去的数。这两边不是同一种错误率。

跟 GPT-5.6 Terra 并排的那次,用的是默认推理。官方挑这个模型,是因为他们看下来,它的智力平均起来最接近 Jev。录下来的运行里,唯一的不一致:Churn likelihood level。官方觉得这题含糊,答案说不清。含糊的题,分布比一个硬标签诚实。

“不能幻觉”说到底,指的就是不产生类型之外的输出。他们因此才把类型错误写成 0%。校准得单独验收,看置信度能不能拿来当门槛。判断对不对,这套流程评测给不了世界本身的答案。它对上的是 Astra 和 Fable 的平均。

参考资料

系列