削いだモデル、スイート、そして話さない一つ
DeepSeek、Kimi、Jev は、一つの総合順位表の上の順位ではありません。一つはスループットを積むため、一つはすでに建てられたフロントのため、Jev は流れの内側に座って確率を出し、話しません。
共著者:folkbench.com (Folkbench は、AI API、モデルサービス、関連サイト向けの、検証できる評価・選定プラットフォームです。公開されたサービス情報、価格、可用性、レイテンシ、証拠の期間をもとに、利用者が経路を比較して選べるようにします。)
この一連は、十篇です。
- JEV - 関節に脳は要りません
- JEV - チャットできない Jev が、なぜ Agent に合うのか
- JEV - 「ハルシネーションできない」は、どこまで届くか
- JEV - 真偽、選択、段階は、言語として足りるか
- JEV - ラボには作れる。それでも、出さないかもしれない
- JEV - 私が走らせた二つのデモ
- JEV - 人はループの真ん中から、縁へ退く
- JEV - あの線を越えると、私にはもう誰が賢いか分からない
- JEV - それに問うてはいけない問いがある
- JEV - 削いだモデル、スイート、そして話さない一つ
クラスのグループが、また順位表を回しています。誰かが DeepSeek の点数を投げ、誰かが Kimi の点数を投げます。下で、誰かが Jev も引きずり込み、三つのうちどれがより強いかを問います。私は一度見て、退きました。返信はしませんでした。グループが欲しいのは名前で、私の手にはその種の名前がありません。この三つは、同じ順位表の上の順位ではありません。順位を強ければ、騒音はグループに残り、今週私がどう働くかとは、ほとんど関係がありません。
私は今、ニッチで使い、総合の順位表では使いません。私が認める成功は、それほど狭いです。モデルは自分のニッチでリードすればよく、すべてで一位である必要はありません。Opus 4.5 から 4.6 へのあの線を越えて、その習慣は固定されました。ユーザーの 90% は、もうモデルを越える課題を出せない、と私は思います。汎用の知能をもう一段持ち上げても、私の日々はほとんど動きません。汎用の知能を再び比べても、私は感じられません。話すか話さないかは、毎日選んでいます。インターフェースも、使い続けられるかに影響します。価格は、より直接です。ループへ書く勇気があるほど安くなければ、私はモデルをコードへ入れません。
話すものは、分けて使います
DeepSeek は、私にとって、単純さの極まで押した道です。エンジニアリングは行けるところまで取り、レートは満たし、価格は半分に切ります。開くと、ページの上に歩き回るものはあまりなく、待っている業界の作業台もありません。DeepSeek は、速く走ることと、価格を切ることに力を入れます。私は同じものを、あと数回走らせる勇気があります。より高いものへ切り替えると、節約するかを計算し始めます。夜を越すバッチの仕事も、そこへ投げます。人は眠り、呼び出しはなお走っていて、高いモデルでは落ち着きません。
私は、スループットが欲しい仕事に使います。ログの一群を通して走査し、インターフェースの下書きを行き来して押し、同じ種類の問いを何回も回します。私が見るのは二つです。止まらないこと、高くならないこと。カーソルが長く回りすぎるか、一回が金で痛み始めると、パイプラインは自分で切れます。文も書けます。私は通常、通りがかりに変えて使います。立ち止まって味わうことは稀です。この仕事で、好みの話もしません。好みは、一語ずつ磨かなければなりません。人が文を磨くために、この価格になったのではありません。
Kimi は、もう一方に置きます。誰がより賢いかを証明するためではありません。フロントの能力は、満たされています。長い材料の一片が入ると、目次が現れ、引用はなおそこにあり、原文を広げて照合して読めます。それを自分で組み立てれば、午後が消えます。金融と法律のために、スイートも建てました。データ源は内側で繋がれ、使うスキルはそこに座っていて、仕事を渡すときに出来ている面があります。規則と財務報告は、その面の上で繰ります。他のページの山は開きません。金融や法律が長い材料として広げられるとき、私は先に自分で環境を建てたくありません。欲しいのは、座って繰ることであり、時間の半分を自分のフロントとして費やすことではありません。長い文書を読む必要があるとき、すでにそこにある作業台が必要なとき、私はそれを開きます。
使ったあと受け入れるのは、一つのことです。これは製品です。モデルがより賢くなり、そのついでにウェブサイトが生えたのではありません。データがどの家から繋がるか、規則のどの条へ繰るかは、モデルがより賢いから自分で生えません。報告が渡されるときどう見えるかは、誰かが先に流れをインターフェースにしなければなりません。話が速く安いとき、私は呼び出しを積み、使うのは DeepSeek です。材料を実際に読み、仕事を渡す必要があるとき、開くのは Kimi のフロントです。どちらも話せます。私は一方を他方の代わりにはしません。
話さないものは、流れの内側に置きます
私は Jev を、チャットには連れません。状態が入り、閉じた問いが問われ、戻るのは確率です。どの項目を選ぶか、どの段階に着地するか、素のはいかいいえを含めて、型は事前に閉じて書かれていなければなりません。問いがまだ閉じられていなければ、私は呼びません。出力は無料です。入力は、100万トークンあたり $0.042 です。速度は速い種類で、70 から 500 ミリ秒です。この価格なら、一つの流れの内側で何度も問う勇気があり、問いごとに請求を暗算しません。私はそれを、流れの内側の一回の呼び出しとして扱います。問い、それから行きます。
自分の流れの内側に、関節として置きます。コードが先に状態を整え、それから閉じた問いを投げます。確率が戻り、分岐はそのあとのプログラムが歩きます。私にとっては、分類と振り分けを扱い、段階を扱い、この一歩が人を呼ぶべきかを扱います。分類のあと、どの段階に着地するかを続けて問い、段階が出てから、人を呼ぶかを問います。どれも閉じた問いで、どれも同じ種類の呼び出しです。他の誰かが読むために書かれた理由と説明は、その仕事ではありません。人が本当に見なければならないテキストは、話せるモデルを繋ぎます。この種の判断を、チャットできるモデルへ与えると、しばしば一段の全体として戻り、態度と助言があります。私はそれからもう一層を書き、段落を分岐へ掘らなければなりません。関節の上にもう一層は、値しないと私は思います。
評価は、一度だけ開きました。workflow の内側で、その判断は Astra と Fable 5.1 と比べられます。比べられるのは近さと費用であり、チャットの勝ち負けではありません。それは別の座標系です。それを理解すると、私はページを閉じました。
リリースは、誰のためかを言うべきです
GPT-6 の波は、computer use を、人々が再び認識するものにしました。モデルは自分で画面をクリックし、ソフトウェアを開き、デスクトップの上の一件を終えます。人々は以前もこれをしていました。Astra が出たあと、コンピュータを操作することは、人々が再び指せるものになり、チャット箱の外のおまけだけではなくなりました。この三つと並べて置くと、それはさらに定まります。モデルがリリースされる瞬間、リリースする人は、誰のためかを明確に言わなければなりません。
機械の全体を渡す用意のある人は、computer use を使えます。もう一つの群は、チャット箱の前に座り、話し終えることを欲します。DeepSeek と Kimi はどちらも話しますが、一方はスループットを積むため、一方はすでに建てられたフロントのためであり、それらはすでに同じ使用ではありません。Jev は、話す側にはいません。コードは私のものです。それが責任を負うのは、確率を出すことだけであり、そのあとのプログラムが歩けるようにするためです。それにチャットのページを作れば、私は使い誤ります。チャット箱がある瞬間、私は理由を書き出させたくなります。
私は、「2026年に誰が最強か」という篇は書きません。その文は、今年助けになりません。チャット箱の内側の二つと、この話さない一つを、私は使うなかでずっと前に分けました。その種の篇を書く用意もありません。
私は、こう取ります。スループットが欲しい仕事は、DeepSeek へ渡します。文体の綱引きに自分を費やさず、高いものへ切り替えたくもありません。長い材料が、すでに建てられた作業台も付いているなら、Kimi を開きます。コードが、判断しなければならない一歩へ達したとき、分類と振り分け、段階、人を呼ぶか、私はそこに Jev を置き、口を開かせません。総合の順位表は、好きなら更新できます。私はニッチで取ります。順位は、もう見ません。
出典
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://openai.com/index/gpt-6-astra/