JEV - 不会聊天的 Jev,为什么反而适合 Agent
Agent 缺的常常是能直接进分支的判断,不是另一段长文本。这篇说明三种题、workflow 评测在比什么,以及为什么热路径等不了一次聊天。
联合作者:folkbench.com (Folkbench 是面向 AI API、模型服务及相关站点的可复核评测与选择平台,依据已发布的服务资料、价格、可用性、延迟与证据窗口,帮助用户比较并选择使用路径。)
这一组共十篇:
- JEV - 关节不需要大脑
- JEV - 不会聊天的 Jev,为什么反而适合 Agent
- JEV - “不能幻觉”说到哪一层
- JEV - 是非、单选、档位,够不够当一门语言
- JEV - 大厂做得出,为什么未必会做
- JEV - 我跑的两个 demo
- JEV - 人从环的中间退到边缘
- JEV - 过了那条线,我已经分不出谁更聪明
- JEV - 有些话不该问它
- JEV - 大道至简、套件,还有一个不说话的
Agent 缺的常常不是另一段长文本。缺一个能直接进控制流的判断。常见的就是这封告警关不关,这张发票付不付,这条 trace 要不要人看,下一句客服该不该升级。这些节点不是让模型写一篇分析。代码要的是一个能拿去比较、拿去分支的值。Jev 做的就是这个。
TypeSafe 的说法,意思就是前沿智力的一次函数调用。进来的是 state,出去的是类型化的概率决策。它不生成字符串。给人看的句子,和给程序走的判断,不是同一个出口。
出口先定死
现有大模型的输出是字符串。软件要接着用。还得解析、校验,再防着跑偏。字段会多冒一个。整段话看起来完整,枚举对不上。人在对话框里发现了,就再问一句。代码发现不了,就带着错往下走。错埋到好几层调用里,模型再聪明也补不回。
Jev 把输出空间事先定死。你先规定能返回什么,它就只在这个空间里给概率。类型错误在数学上不会发生。它交不回一份你没定义过的形状。这和判断一定正确不是一回事。概率会偏,选项也会选错。类型安全封的是形状,不是对错。形状定了,后面的分支才写得下去。你不用先从一段话里把值捞出来。
题只有三种。
Noul 负责是非。模型给一个 0 到 1 的概率。靠近 1 是肯定,靠近 0 是否定。0.5 附近就是拿不准。它不另给置信度,概率本身就是信号。Choice 是单选。选项你先列好,上限是 255 项。回来的是选中的那一项、每一项上的分布,还有置信度。代码按这个分布决定自己做,还是交给人。Score 是档位。档位从 2 档到 10 档,每一档什么意思由你写。回来的是分数、档位上的分布,还有置信度。分数可以落在两档之间,表示程度上的位置。
是否题写成条件判断。单选和档位不一样,前者看落在哪个选项,后者拿分数去卡阈值。好问题一样要窄。一个懂行的人看完材料,一秒就能做的判断,才适合丢给它。客户有没有在要退款,是这种题。把这封信分析完再决定最佳行动,就不是这种题。后一句要的是慢推理。得拆开再问。拆开的题对着同一份 state,彼此独立,一次请求里一起回来。权重留在代码里。政策改了,你改数字,不用重写整段提示。
卡人的是岔口
真正卡人的经常就是这种节点。告警带着机器上已有的记录来,结论是关、转给分析师,或立刻隔离。发票挂着订单和到货记录,要拍板的是付、押着,还是退回。客服 Agent 跑完了,工具调用全在轨迹里,有人得决定这条 trace 看不看、多久看。客户又写一封,线程和账户状态都在。下一句该怎么接、该不该升级,是同一个形状的问题。
规则能写死的部分,代码。脆的是写不完的例外。收据对得上,事由却含糊,轨迹里还有一步看着怪。手写逻辑碰到这些就碎。你把整段政策塞进一个 prompt,让模型一次想完,条件语句少写了。出口又变回一段文字。文字要进控制流,你还得再写一层解析。那一层自己也会错。
TypeSafe 的 workflow eval 测的就是这个接法。评测里把任务拆成很多窄问题。能用代码定的就用代码。模型只回答代码定不了的判断。公开的四条流程是安全事件、Agent trace 可观测、发票处理、客服。同一套流程下,模型走 workflow,比把整段政策塞进一个 prompt 更准,花费和耗时也更低。四条任务平均下来,被测的模型都是这个方向。
后面的动作跟着概率走,不跟着一个拍死的标签走。最后对外的结果仍是一个离散动作。中间那截工程每次都得做得一样。
测的是靠近,不是更懂
这套评测不跟你辩论流程本身写没写错。它假设 harness 是对的。参考答案不是人工逐题标出来的金标。GPT-6 Astra 和 Claude Fable 5.1 在 high thinking 下对每个问题作答,两家的回答再取平均。别的模型用厂商默认推理。流程定死以后才比得了。评测比的是接近那两个大模型判断的程度,还有速度和费用。
所以这张图证明不了 Jev 比 Astra 更懂业务。Astra 和 Fable 在这里是尺子。Jev 要靠近它们的判断,还得把延迟和费用拉开。题拆错了,尺子再近也没用。拆题是写流程的人的事。
Jev 在这张“又快又便宜”的前沿上很靠外。官网那组更高的倍数,大约快 193.6 倍、便宜 444.6 倍,是这套评测里偏高的一端。这个倍数不是每通电话都这样。这里的调用更接近真要上线的自动化负载。
它接近的是拆开之后那些窄问题上的概率,不是一篇长分析的写法。Jev 不写这种长分析。
热路径等不了
延迟对 Agent 是硬的。人对 3 秒还能等。一层套一层,就不能等了。同一条链路里还有检索、写库和下一次调用,每一跳吃的是同一份时间。70 毫秒到 500 毫秒这个区间,判断才能放进热路径。出了这个区间,调用栈就把它当成阻塞。
现有的前沿模型和人说话,端到端从 3 秒到 300 多秒都很常见。这个速度拿去当副驾驶,或是给人盯着的编程代理用,说得通。放进热路径当条件判断,这个速度就说不通。Jev 不逐 token 往外蹦句子,该返回的概率一次给齐。速度是从这里来的。
TypeSafe 还拿 Jev 做校验。别的模型的提示、推理痕迹和输出,Jev 来打分,也做护栏和查越狱。生成还是聊天模型的事。过不过这一关,由一个不会生成字符串的模型来定。这是 Agent 里的关节,不是聊天。点头和复查要是还停在长文本上,你就得再找程序去读。Jev 把结果收成概率和档位,复查就能写成代码。
写给用户看的那一句,还是聊天模型的事。Jev 不接这一句。它接前面的分流,也接后面的检查。Agent 在这里缺的不是再来一段更长的解释,是一个类型已经定好、代码拿来就能走的判断。
参考资料
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://docs.typesafe.ai/primitives
系列
- 上一篇:JEV - 关节不需要大脑
- 下一篇:JEV - “不能幻觉”说到哪一层