JEV - 大道至简、套件,还有一个不说话的
DeepSeek、Kimi 和 Jev 不在同一张总榜上。一个拿来堆吞吐,一个拿来当现成前台,Jev 嵌在流程里吐概率,不开口。
联合作者:folkbench.com (Folkbench 是面向 AI API、模型服务及相关站点的可复核评测与选择平台,依据已发布的服务资料、价格、可用性、延迟与证据窗口,帮助用户比较并选择使用路径。)
这一组共十篇:
- JEV - 关节不需要大脑
- JEV - 不会聊天的 Jev,为什么反而适合 Agent
- JEV - “不能幻觉”说到哪一层
- JEV - 是非、单选、档位,够不够当一门语言
- JEV - 大厂做得出,为什么未必会做
- JEV - 我跑的两个 demo
- JEV - 人从环的中间退到边缘
- JEV - 过了那条线,我已经分不出谁更聪明
- JEV - 有些话不该问它
- JEV - 大道至简、套件,还有一个不说话的
同学群里又在传榜。有人甩 DeepSeek 的分数,有人甩 Kimi 的分数,底下有人把 Jev 也拖进来,问这三个谁更强。我看了一眼就退了。我没回。群里要的是一个名字,我手头没有这种名字。这三家不是同一张榜上的名次。硬排下去,热闹留在群里,跟我这周怎么干活关系不大。
我现在按生态位用,不按总榜用。我认的成功就这么窄:一个模型在自己的生态位上领先就行,不用全方位都第一。过了 Opus 4.5 到 4.6 那条线,这个习惯算是定死了。我觉得 90% 的用户已经提不出超纲任务。总智力再往上抬一档,我的日子几乎没动。再比总智力,感觉不到。开口不开口,我倒是每天都在选。界面这东西也影响我用不用得下去。价钱更直接。它得便宜到我敢写进循环,我才把模型放进代码。
会说话的,我分开用
DeepSeek 在我这儿就是大道至简。工程做到极致,速率拉满,价格减半。我打开看,页面上没有多少可逛的,也没有一套行业工作台等着。DeepSeek 把力气放在跑快和降价上。同一件事我敢多跑几轮。换一个更贵的,我就会开始算,要不要省着点。过夜的批处理我也会丢给它。人睡了,调用还在跑,贵的模型我会心虚。
拿它做要吞吐量的活。我把一批日志推进去扫,也把接口草稿来回挤,同一类问题打很多轮。我盯的就两样,别卡,别贵。光标转太久,或者一轮下来开始心疼钱,这条流水线自己就断了。句子它也能写。我通常顺手改改就用,很少停下来品。这种活我也不跟它讲品味。品味得一个字一个字磨,它不是为了让人磨句子,才定成这个价。
Kimi 我放在另一边。不是为了证明谁更聪明。前端能力是拉满的。一篇长材料丢进去,目录有了,引用还在,原文可以摊开对着看。这些要是我自己拼,一个下午就没了。它还专门给金融和法律做了套件。里面数据源接好了,要用的技能也放在那儿,交活时有个现成的台面。法规和财报我都在这个台面里翻,不另开一堆网页。金融或者法律的长材料摊开时,我不想先自己搭环境。我要的是坐下来就能翻,不是先当半天自己的前端。要读长文档、要现成工作台的时候才开。
用下来我认一件事。这是产品,不是模型更聪明、于是顺便做了个网站。数据从哪家接、法规翻到哪一款,这些不会因为模型更聪明就自己长出来。报告交出去长什么样,也得有人先把流程做成界面。说话又快又便宜的时候,我堆调用,用的是 DeepSeek。真要读材料、把活交出去,我开的是 Kimi 那个前台。两个都会说话。我不拿它们互相替代。
不说话的那个,我嵌在流程里
Jev 我不拿来聊天。state 丢进去,封闭题问完,回来的是概率。选哪一项,或者落在哪一档,也包括简单的是或不是,都得事先把类型写死。问题要是还没收成封闭题,我不会叫它。输出免费,输入 $0.042 / 百万 token。速度是 70 到 500 毫秒那种快。这个价,我才敢在一条流程里反复问,不用每问一次都去心算账单。我把它当成流程里的一次调用,我问完就走。
嵌在自己的流程里当关节。代码先把状态收干净,再丢一个闭着的问题过去。概率回来,分支交给后面的程序走。它在我这儿管分类和路由,也管分档,以及这一步要不要把人叫过来。分类完我接着问落在哪一档,档位出来再问要不要叫人。都是封闭题,都走同一种调用。写给别人看的理由和解释,都不归它。真要给人看的文字,我另外接一个会说话的模型。要是把这种判断交给会聊天的模型,它往往会回一整段,里面有态度,还有建议。我还得再写一层,把段落抠成一个分支。关节上多这一层,我就觉得不值。
评测我只点开过一次。workflow 里,拿它的判断去跟 Astra 和 Fable 5.1 比,比的是接近,还有成本,不是聊天胜负。那是另一套坐标系。看明白这一点,我就把页面关了。
发布的时候就该说给谁
GPT-6 那一波,把 computer use 重新变成大家认识的东西。模型自己去点屏幕,开软件,把桌面上的一件事做完。以前也有人在做。Astra 出来之后,操作电脑又变成一件大家能指认的事,不再只是聊天框外面的附赠。跟这三家搁一起看,就更确定了。模型一发布,发布的人就得说清楚做给谁。
准备把整台机器交出去的人,用得上 computer use。还有一批人坐在对话框前面,要的是把话说完。DeepSeek 和 Kimi 都在说话,可一个拿来堆吞吐,一个拿来当现成前台,已经不是同一个用法。Jev 就不在说话这一边。代码是我自己的,它只负责吐一个概率,好让后面的程序走下去。给它做个聊天页面,我会用错。一有对话框,我就想让它把理由写出来。
我不会写一篇“谁是 2026 最强”。这句话今年帮不上忙。聊天框里的那两个,还有这个不说话的,我早就分开用了。我也不准备写那种稿。
我自己就这么拿。吞吐量上来的活,我给 DeepSeek。文风上的拉扯我不跟它耗,贵的我也不想换上去。长材料要是再配现成工作台,我就开 Kimi。代码走到要做判断的那一步,分类和路由,档位,还有叫不叫人,这些我嵌 Jev,让它别开口。总榜爱更新就更新。我按生态位拿。名次那个,我不看了。
参考资料
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://openai.com/index/gpt-6-astra/
系列
- 上一篇:JEV - 有些话不该问它