JEV - 关节不需要大脑
Jev 是 TypeSafe 的 System One 模型。它不写自由文本,只对封闭问题返回概率,放在规则写不尽、又不必先请一个聊天模型的节点上。
联合作者:folkbench.com (Folkbench 是面向 AI API、模型服务及相关站点的可复核评测与选择平台,依据已发布的服务资料、价格、可用性、延迟与证据窗口,帮助用户比较并选择使用路径。)
这一组共十篇:
- JEV - 关节不需要大脑
- JEV - 不会聊天的 Jev,为什么反而适合 Agent
- JEV - “不能幻觉”说到哪一层
- JEV - 是非、单选、档位,够不够当一门语言
- JEV - 大厂做得出,为什么未必会做
- JEV - 我跑的两个 demo
- JEV - 人从环的中间退到边缘
- JEV - 过了那条线,我已经分不出谁更聪明
- JEV - 有些话不该问它
- JEV - 大道至简、套件,还有一个不说话的
基础模型过了那条线。大多数人已经提不出超纲任务。你能想到的题,现有模型大体都能接住。再比谁更会聊,多出来的那一点撑不起一个新产品。差别开始在产品定义上。Jev 就是按这个阶段定的。
它是 TypeSafe AI 的 System One 模型。不生成自由文本。你给它一段 state,文本或者程序状态,再加一组封闭问题。每题返回一个概率分布。
它卖的不是聊天能力。它卖的是系统里的关节。
节点分几种。有的能用规则写死,写死就完了。有的得展开着推理,还得对着人把话说完,那是大脑的活。中间剩一批。规则写不尽。上一个大脑,浪费。关节安在这批节点上。
弯一下就行
走路的时候,膝盖不请示大脑。地面硬了就弯一点。坡陡了就顶住。没有说明,也没有草稿。
关节不需要智能。关节只需要本能。本能高于规则。能穷尽的交给规则,状态对上了就走那条分支,对不上就停。规则写尽了仍判不了、熟手却一眼有倾向的,交给本能。要铺开理由、要对人说话,再把智能请上来。别指望一道题同时干规则和大脑的活。
Jev 待在中间这一层。问题封闭,答案的形状也封闭。概率可以散,散就是拿不准。它只在你给定的答案里分配概率。官方把合适的问题卡得很死:懂行的人看着上下文,一秒里能做的判断。得分析半天的,整题扔进来就不对,要拆成几问。
这很像前 GPT 时代的通用分类器,干的还是同一类活。语义理解更好,速度更快。绕弯的话读得懂,程序状态里夹着的意图也读得懂。别拿它去聊天。
官方定位叫 System One。借 Kahneman 的系统一,快,直觉。步骤摊开写给人看的那种慢思考,不在这个定位里。
名字来自 William Stanley Jevons。煤和蒸汽机效率提高之后,需求没有下降,反而上升。官方用这个名字,是说判断一便宜,系统里要判断的节点会跟着变多。
就这三种题
题型只有三种。
是非,叫 Noul。一句能用真假收住的话。回来的是“是”的概率,落在 0 到 1。代码拿这个数卡阈值。过了就执行。没过的停住,或交给人。
单选,叫 Choice。选项事先给死,最多 255 项。每一项后面可以跟一句,这项指什么。回来的是整张分布,再标出概率最高的那一项。列表里没有的,它不补。
有序档位,叫 Score。2 到 10 档。从低到高排好,每一档写成具体情形。别只丢一个数字给它。落点可以停在两档中间,每一档的概率都还在。业务上要整数,代码里收。
三种能搁在同一次请求里问。同一段 state,各问各的。是非不替单选打草稿。用哪一题,丢掉哪一题,代码说了算。题多加几道,时间几乎不加。加的是题目自己那点 token。输入按 token 计,多出来的开销就那一点。
采样不是聊天那套。官方说的是新架构,并行采样。一次把所有输出采出来。不逐 token。聊天模型慢,是因为一个词得等下一个词,输出也跟着变贵。Jev 不一个词一个词往外长。
训练方法叫 RLCD,Reinforcement Learning for Calibrated Decisions。目标放在校准:它报出的把握,得和实际判对的频率对得上。不拿“读起来像人”当目标。
输入 $0.042 / 百万 token。输出免费。端到端大约 70ms 到 500ms。七十毫秒有,五百毫秒也有。官方同时给了智力上的判断:System One 任务上,和现有大模型差不多,快一到两个数量级。这句“差不多”只对封闭判断有效。用它写文章,或者把一个没封口的问题聊完,都不算在里面。
规则断了再接
这类节点不稀奇。分类、路由、打分、审核、风控,再加上 Agent 里的判断节点,都是这个形状。工单该进哪个队列,下一跳走哪段代码,投诉有多冲,一句话放不放行,一笔操作像不像该拦的异常,岔口上工具交不交出去。这些都问得很快,也都能收成封闭题。
规则能吃掉好写的那一截。例外一多,条件越叠越缠。改一条,怕旁边的一起失效,后来就没人敢动。
也有人把整段 state 扔给会聊天的模型,让它回一句建议。聊天模型做得到。节点要的只是一个倾向。你还得把句子解析成分支,失败了再试。时间耗在文本的形状上。
不是不能上大脑。这个节点不配先上。Jev 接的就是这一截。封闭问题进去,分布出来。过不过线,升不升级,写在旁边的代码里。流程怎么走,仍是代码的事。
退款就能拆成三问:是不是在要退,要退、要改签还是只问规则,火气落在第几档。分别用 Noul、Choice、Score,看同一段 state。政策里写死的句子,留给规则去对。对不上的那些,就看分布。给客户的那封回信,不归它写。
Agent 也这么拆。人最后读到的那句,留给会说话的模型。中间的判断不要步步叫醒一个大脑。叫醒一次,这一步就按聊天的耗时走。判断换成关节,对外的回复可以不动。
写稿请换模型
写文章不行。它不生成文本。题目和语气放进 state,它仍只回答你写好的封闭题。有没有偏题,这种它能判。句子得另找模型出。
开放题别按进单选。“接下来怎么办”,办法你还没列完,Choice 里就没有那一格。先拆。能穷尽的留给规则。凭直觉就能答的,写成这三种题。需要展开着推理、还得对人把话说完的,再上智能。如果拆不开,这事还不是关节。
有人把 System One 听成降档。规则才更低。System One 是规则上面的本能。它快,而且不写解释。语义还得懂,不然规则就够了。再上面才是智能。官方给的智力是封闭任务上差不多,给的速度是快一到两个数量级。有这一截速度,调用才能放进循环,不用干等一次聊天结束。
基础模型把大多数人提得出的题做平以后,产品要收成明确的接口。Jev 收成关节。聊天能力不卖。规则写不尽、上一个大脑又浪费的那些节点。就是它的位置。
参考资料
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://docs.typesafe.ai/primitives