JEV - 过了那条线,我已经分不出谁更聪明
分界被放在 Opus 4.5 和 4.6 之间:大多数人已经提不出超纲任务。过线之后分得开的是产品定义。Jev 吐的是概率,不是下一段更聪明的聊天。
联合作者:folkbench.com (Folkbench 是面向 AI API、模型服务及相关站点的可复核评测与选择平台,依据已发布的服务资料、价格、可用性、延迟与证据窗口,帮助用户比较并选择使用路径。)
这一组共十篇:
- JEV - 关节不需要大脑
- JEV - 不会聊天的 Jev,为什么反而适合 Agent
- JEV - “不能幻觉”说到哪一层
- JEV - 是非、单选、档位,够不够当一门语言
- JEV - 大厂做得出,为什么未必会做
- JEV - 我跑的两个 demo
- JEV - 人从环的中间退到边缘
- JEV - 过了那条线,我已经分不出谁更聪明
- JEV - 有些话不该问它
- JEV - 大道至简、套件,还有一个不说话的
基础模型这场竞争,打到第三年了。还留在牌桌上的,大多数已经过了一条线。这条线不低。
我给它的定义就一句。百分之九十的用户,已经提不出超出模型能力范围的任务。事情还在。人也不停地提要求。只是那些要求,模型接得住了。回邮件、收纪要、改一处报错、把一篇材料收成几条,我早就不敢拿这些分高下。它们都在这条线里面。我把落点放在 Opus 4.5 和 4.6 之间。再往上,糊成一片。
前两年我还会追发布,换上去认真比谁更强。我这一年不比了。榜还在更新,我手上的活没有多出一档。
换上去,只剩一点感觉
过线之前,我分得清。长文会不会写散,我换一个模型就知道。步骤一多,前面的条件还在不在,我当周也能感觉出来。过线之后,能力上的差别我感觉不到了。换模型,常常只剩下一个印象,又好了一点。好在哪,说不上。
同一类事情,上个月还要我返工,这个月就过去了。开会的记录丢进去,要办的事都收得出来。两家收出来的差一两条,我看着都够用。写代码也这样。一段报错贴过去,两家都给得出改法。我有时觉得其中一家更干净,改动更小。从哪一次更新开始拉开的,指不出来。真要挑,我挑改动少的那一版。中间没有哪一天,能让我指着说,从这儿起它会了。增量一直有,只是太细,我的日子记不住。
我后来就少为这个换模型。下一档到底谁更聪明,我分不出。
这些我分得开
最先摸到的是它吐出来的东西长什么样。吐文字的,我当成交谈对象。一段乱记录交给它,让它收成要办的几件事。我读一遍,改几个词,不满意再丢回去。这个来回很熟。声音是另一路。我对它说,它说回来。我用得不多,赶路的时候才开。一要改字,我还是回到能复制的文字上。这个形态我认得。
吐动作的更不一样。它去操作一台电脑,自己把一段流程点完。我盯的是它的手。点错一个地方,后面的话再完整也没用。还有一种只给概率。Jev 就是这种。它不吐文字,也不去操作电脑。这几样我都碰到过。我分得开,是因为接手的方式不一样。
性格和品味也会把人分开。同一份材料交过去,有的写得很满,边角也补一句,生怕我看不懂。也有的说到这儿就停,判断留给人。我留下谁,常常看这个脾气顺不顺手。停对了的,我会留在天天开的窗口里。旁边分数更高,我也很少为了分数换窗口。
成本和延迟放在一起摸。它落在成本曲线的哪一截,落在延迟曲线的哪一截,用两次就有数。跟人聊天,多等一会儿我还能忍,人本来也要停一停。真接到一段反复跑的流程上,等待就变成堵。慢到我可以去倒杯水,它就只适合留在对话里。贵到我不敢多叫一声,它就进不了那些又碎又密的环节。它要是便宜,回来又快,我才敢把它铺开。回来的要是一段得我读完的话,便宜也没用,我照样放不进循环。
拒绝也是差别。它拒绝什么,怎么拒绝,用一阵就露出来。有的直接回绝,话说得很短。我知道这条路不通,回头改要求,改一句就能继续。有的不明说,把事情绕开,做歪了再交回来。这种我还会以为是自己没说清,在坏结果上多磨一轮。我现在看的是,下次这活我还敢不敢交给它。
新模型先定位置
GPT-6 让全世界重新认识了 computer use。操作电脑被重新摆到发布的前头。我在意的不是原来模型会用鼠标。过了线,这已经不新鲜。以前我看发布,看的是又高了一档。这一次我改了问法。一家公司要发新模型,得先想自己的生态位,做给谁,自己在哪方面特别好。它不用再站出来说,自己就是下一档更聪明的。
Jev 是我最近真实摸到的一个极端。它不跟 Opus 比写作。写作这门,它不接。它占的是关节。材料走到要拍板的那个点,题是封闭的,选项事先给定。回来的是一个概率。一下就回来。聊天那边我还会切去别的窗口等。这边我不用切走,结果已经回来了。这种输出不收费。我丢过去的不是让它帮我写一段,是已经圈好的判断,这条走不走,把握有多大。概率回来以后,接手的是程序,不是我坐着读完再拍板。我没有跟它聊天的欲望。那个位置也不是留来聊天的。聊天模型再往上走,吐出来的还是文字。Jev 把生成文字这步拿掉了。这不是更聪明的聊天,是另一种产品。
模型公司之间,我现在看路线,也看产品定义做得成不成。模型怎么设计,现在就看这两件。轮不到榜单第一来决定。榜上的名字,过一阵就换。一个模型打算吐出什么,形状定了,后面的训练和接口都跟着走,计价也跟着走。
别的走法,这篇只带一句。有人把工程做到极致,也有人转去做垂直套件。剩下的干脆不说话,继续推通用模型。DeepSeek 和 Kimi 的具体套件,这篇先不展开,写在JEV - 大道至简、套件,还有一个不说话的。
过了那条线,我已经分不出谁更聪明。换的时候,还是会觉得又好了一点。可这点感觉,不够我拿来做选择。我分得清的是产品定义。你吐文字,吐动作,还是只吐一个概率。
参考资料
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://openai.com/index/gpt-6-astra/
系列
- 上一篇:JEV - 人从环的中间退到边缘
- 下一篇:JEV - 有些话不该问它