Model yang disederhanakan, sebuah suite, dan satu yang tidak berbicara

DeepSeek, Kimi, dan Jev bukan peringkat pada satu papan keseluruhan. Satu untuk menumpuk throughput, satu adalah etalase yang sudah jadi, dan Jev duduk di dalam alur, mengeluarkan probabilitas, dan tidak berbicara.

Penulis bersama: folkbench.com (Folkbench adalah platform evaluasi dan pemilihan yang dapat ditinjau untuk API AI, layanan model, dan situs terkait. Platform ini memakai informasi layanan yang sudah diterbitkan, harga, ketersediaan, latensi, dan jendela bukti untuk membantu pengguna membandingkan dan memilih jalur.)

Sepuluh tulisan dalam seri ini:

Grup teman sekelas sedang mengedarkan papan lagi. Seseorang melempar skor DeepSeek. Seseorang melempar skor Kimi. Di bawahnya, seseorang menyeret Jev masuk dan bertanya yang mana dari ketiganya yang lebih kuat. Saya melihat sekali lalu pergi. Saya tidak membalas. Yang diinginkan grup adalah sebuah nama, dan saya tidak punya nama semacam itu di tangan. Ketiganya bukan peringkat pada papan yang sama. Paksa sebuah peringkat, dan keramaian tinggal di grup. Itu tidak banyak berhubungan dengan cara saya bekerja minggu ini.

Saya memakainya menurut ceruk sekarang, bukan menurut papan keseluruhan. Keberhasilan yang saya akui sesempit itu: sebuah model memimpin di ceruknya sendiri, dan ia tidak harus menjadi yang pertama dalam segala hal. Lewat garis dari Opus 4.5 ke 4.6, kebiasaan itu tetap. Saya pikir 90% pengguna sudah tidak bisa mengajukan tugas di luar model. Angkat kecerdasan umum satu tingkat lagi, dan hari-hari saya hampir tidak bergerak. Bandingkan kecerdasan umum lagi, dan saya tidak bisa merasakannya. Apakah sesuatu berbicara atau tidak, itu saya pilih setiap hari. Antarmuka juga memengaruhi apakah saya bisa terus memakainya. Harga lebih langsung. Ia harus cukup murah sampai saya berani menuliskannya ke dalam loop sebelum saya memasukkan model ke kode.

Yang berbicara, saya pakai terpisah

DeepSeek, bagi saya, adalah jalur yang didorong sampai ke ujung kesederhanaan. Rekayasa dibawa sejauh yang bisa, laju diisi penuh, harga dipotong setengah. Saya membukanya, dan tidak banyak yang bisa dikelilingi di halaman, dan tidak ada meja kerja industri yang menunggu. DeepSeek menaruh usahanya pada berlari cepat dan memotong harga. Saya berani menjalankan hal yang sama beberapa putaran lagi. Beralih ke yang lebih mahal, dan saya mulai menghitung apakah harus menghemat. Pekerjaan batch semalaman, saya juga lempar kepadanya. Orang tidur, panggilan masih berjalan, dan dengan model yang mahal saya merasa tidak tenang.

Saya memakainya untuk pekerjaan yang menginginkan throughput. Saya mendorong sekumpulan log untuk dipindai, dan saya memeras draf antarmuka bolak-balik, banyak putaran pertanyaan jenis yang sama. Saya mengawasi dua hal: jangan macet, dan jangan menjadi mahal. Kursor berputar terlalu lama, atau satu putaran mulai terasa sakit pada uang, dan pipeline putus sendiri. Ia juga bisa menulis kalimat. Saya biasanya mengubahnya sambil lalu dan memakainya. Saya jarang berhenti untuk mencicipinya. Saya juga tidak membicarakan selera dengannya pada pekerjaan ini. Selera harus digiling kata demi kata. Ia tidak dihargai begini agar seseorang bisa menggiling kalimat.

Saya menaruh Kimi di sisi lain. Bukan untuk membuktikan siapa yang lebih pintar. Kemampuan ujung depan diisi penuh. Sepotong materi panjang masuk, daftar isi muncul, kutipan masih ada, dan sumbernya bisa dibentangkan untuk dibaca berhadapan. Jika saya merakit itu sendiri, satu sore akan habis. Ia juga membangun suite khusus untuk keuangan dan hukum. Sumber data tersambung di dalam, keterampilan yang dipakai sudah duduk di situ, dan ada permukaan yang siap ketika pekerjaan diserahkan. Peraturan dan laporan keuangan, saya balik di permukaan itu. Saya tidak membuka setumpuk halaman lain. Ketika keuangan atau hukum dibentangkan sebagai materi panjang, saya tidak ingin membangun lingkungan sendiri lebih dulu. Yang saya inginkan adalah duduk dan membaliknya, bukan menghabiskan setengah waktu sebagai ujung depan saya sendiri. Saya membukanya ketika perlu membaca dokumen panjang, dan ketika perlu meja kerja yang sudah ada.

Yang saya terima setelah memakainya adalah satu hal. Ini produk. Ini bukan model yang menjadi lebih pintar dan karena itu menumbuhkan situs di samping. Dari rumah mana data tersambung, dan klausul peraturan mana yang dibalik, tidak tumbuh sendiri karena model lebih pintar. Seperti apa laporan ketika diserahkan, seseorang harus membuat alurnya menjadi antarmuka lebih dulu. Ketika bicara cepat dan murah, saya menumpuk panggilan, dan yang saya pakai adalah DeepSeek. Ketika saya benar-benar perlu membaca materi dan menyerahkan pekerjaan, saya membuka etalase Kimi. Keduanya bisa berbicara. Saya tidak mengganti yang satu dengan yang lain.

Yang tidak berbicara, saya pasang di dalam alur

Saya tidak membawa Jev untuk mengobrol. State masuk, pertanyaan tertutup ditanyakan, dan yang kembali adalah probabilitas. Butir mana yang dipilih, atau tingkat mana yang ia pijak, termasuk ya atau tidak yang polos, tipenya harus ditulis tertutup lebih dulu. Jika pertanyaan belum tertutup, saya tidak akan memanggilnya. Keluaran gratis. Input adalah $0.042 per juta token. Kecepatannya jenis yang cepat, 70 sampai 500 milidetik. Pada harga ini saya berani bertanya berulang-ulang di dalam satu alur, tanpa hitung-hitungan di kepala pada tagihan di setiap pertanyaan. Saya memperlakukannya sebagai satu panggilan di dalam alur. Saya bertanya, dan saya pergi.

Dipasang di dalam alur saya sendiri sebagai sendi. Kode membersihkan state lebih dulu, lalu melempar pertanyaan tertutup. Probabilitas kembali, dan cabang dijalankan oleh program sesudahnya. Bagi saya ia menangani klasifikasi dan perutean, ia menangani tingkat, dan ia menangani apakah langkah ini harus memanggil seseorang. Setelah klasifikasi saya lanjut bertanya tingkat mana yang ia pijak, dan setelah tingkat keluar saya bertanya apakah memanggil seseorang. Semuanya pertanyaan tertutup, semuanya jenis panggilan yang sama. Alasan dan penjelasan yang ditulis untuk dibaca orang lain bukan pekerjaannya. Teks yang benar-benar harus dilihat seseorang, saya sambungkan model yang bisa berbicara. Jika penilaian semacam ini diberikan kepada model yang bisa mengobrol, ia sering kembali sebagai satu paragraf utuh, dengan sikap dan dengan saran. Saya lalu harus menulis lapisan lain, dan menggali paragraf itu menjadi cabang. Satu lapisan lagi pada sendi, dan saya tidak merasa itu sepadan.

Saya hanya membuka evaluasi sekali. Di dalam workflow, penilaiannya dibandingkan dengan Astra dan Fable 5.1. Yang dibandingkan adalah kedekatan, dan biaya, bukan menang atau kalah dalam obrolan. Itu sistem koordinat yang lain. Begitu saya paham itu, saya menutup halamannya.

Rilis seharusnya mengatakan untuk siapa

Gelombang GPT-6 membuat computer use menjadi sesuatu yang dikenali orang lagi. Model pergi dan mengklik layar sendiri, membuka perangkat lunak, dan menyelesaikan sesuatu di desktop. Orang sudah melakukan ini sebelumnya. Setelah Astra keluar, mengoperasikan komputer menjadi sesuatu yang bisa ditunjuk orang lagi, tidak lagi hanya tambahan di luar kotak obrolan. Diletakkan di samping ketiganya, itu makin pasti. Saat sebuah model dirilis, orang yang merilisnya harus mengatakan dengan jelas untuk siapa.

Orang yang siap menyerahkan seluruh mesin bisa memakai computer use. Kelompok lain duduk di depan kotak obrolan dan menginginkan bicara yang selesai. DeepSeek dan Kimi keduanya berbicara, tetapi satu untuk menumpuk throughput dan satu untuk etalase yang sudah jadi, dan itu sudah bukan pemakaian yang sama. Jev tidak berada di sisi yang berbicara. Kodenya milik saya. Ia hanya bertanggung jawab mengeluarkan probabilitas, agar program sesudahnya bisa berjalan. Jika saya membuat halaman obrolan untuknya, saya akan memakainya dengan salah. Saat ada kotak obrolan, saya ingin ia menulis alasannya.

Saya tidak akan menulis tulisan berjudul "siapa yang terkuat pada 2026". Kalimat itu tidak menolong tahun ini. Dua yang di dalam kotak obrolan, dan yang satu ini yang tidak berbicara, sudah lama saya pisahkan dalam pemakaian. Saya juga tidak bersiap menulis tulisan semacam itu.

Beginilah saya mengambilnya. Pekerjaan yang menginginkan throughput, saya berikan kepada DeepSeek. Saya tidak menghabiskan diri pada tarik-menarik soal gaya, dan saya tidak ingin beralih naik ke yang mahal. Materi panjang, jika juga datang dengan meja kerja yang sudah jadi, saya buka Kimi. Ketika kode sampai pada langkah yang harus membuat penilaian — klasifikasi dan perutean, sebuah tingkat, dan apakah memanggil seseorang — saya memasang Jev di situ, dan saya menyuruhnya tidak membuka mulut. Papan keseluruhan boleh diperbarui jika ia mau. Saya mengambilnya menurut ceruk. Peringkatnya, saya tidak lihat lagi.

Sumber

Seri