Laboratorium bisa membuat ini. Mengapa tetap mungkin tidak.
TypeSafe merilis Jev pada 15 September 2026, saat itu masih early access. Tulisan ini menempatkan harga resmi dan uraian pelatihan di samping daftar harga petahana, dan menjelaskan mengapa model penilaian dengan keluaran gratis bertabrakan dengan penjualan keluaran panjang per token.
Penulis bersama: folkbench.com (Folkbench adalah platform evaluasi dan pemilihan yang dapat ditinjau untuk API AI, layanan model, dan situs terkait. Platform ini memakai informasi layanan yang sudah diterbitkan, harga, ketersediaan, latensi, dan jendela bukti untuk membantu pengguna membandingkan dan memilih jalur.)
Sepuluh tulisan dalam seri ini:
- JEV - Sendi tidak membutuhkan otak
- JEV - Mengapa Jev yang tidak bisa mengobrol justru cocok untuk Agent
- JEV - Sejauh mana "tidak bisa berhalusinasi" itu sebenarnya berlaku
- JEV - Apakah ya-tidak, pilihan, dan skor cukup untuk menjadi satu bahasa?
- JEV - Laboratorium bisa membuat ini. Mengapa tetap mungkin tidak.
- JEV - Dua demo yang saya jalankan
- JEV - Orang mundur dari tengah lingkaran ke tepi
- JEV - Lewat garis itu, saya sudah tidak bisa membedakan siapa yang lebih pintar
- JEV - Ada pertanyaan yang tidak seharusnya ditanyakan kepadanya
- JEV - Model yang disederhanakan, sebuah suite, dan satu yang tidak berbicara
Pada 15 September 2026, TypeSafe merilis Jev, dan saat itu masih early access. Ini model System One pertama mereka. Ia hanya membuat penilaian. Ia tidak bergantung pada obrolan ringan. Pendirinya, Diogo Almeida, dulu bekerja pada kepatuhan instruksi di OpenAI, pada penelitian yang menjadi ChatGPT.
Jev sendiri tidak punya hambatan teknis. Laboratorium model mana pun, dengan tim kecil, bisa membuat versinya sendiri dalam setengah bulan. Secara teknis, tidak ada yang menghalangi.
Pekerjaan resmi memang membuat sesuatu yang baru. Mereka membangun arsitektur baru. Sampler-nya paralel: satu kueri menyelesaikan penilaian, tanpa membangkitkan satu token sesudah token lain. Mereka membangun metode pelatihan yang terpisah, disebut RLCD, reinforcement learning pada keputusan yang dikalibrasi. Keyakinan yang dilaporkan model harus sejajar dengan bagian keputusan berikutnya yang benar. Itu implementasi mereka. Yang akan ditiru orang lain adalah bentuk produknya: jangan menghasilkan string, dan keluarkan probabilitas yang dikalibrasi hanya pada pertanyaan tertutup. Pertanyaannya ditetapkan lebih dulu, model menyerahkan penilaian dengan probabilitas, dan kode bercabang pada angka itu. Setengah bulan meniru bentuk itu. Itu tidak menyalin penelitian TypeSafe sebagaimana adanya. Orang yang menirunya tidak harus membongkar penelitian itu lebih dulu.
Hambatan sulit diklaim. Begitu bentuknya tetap, implementasinya bisa ditukar seluruhnya. Setelah penukaran, sistem yang ia tancapkan tetap menerima hal yang sama: state di depan, penilaian di belakang.
Produk model obrolan adalah string. String bisa ditulis sangat panjang, dan perangkat lunak yang benar-benar membutuhkan string itu harus mengurainya sekali lagi. Jev tidak menghasilkan string. Tanpa bentangan teks yang bisa dipanjangkan itu, keluaran tidak punya tagihan yang naik bersama panjangnya.
Daftar harga para petahana
Harganya membuatnya jelas. Input Jev adalah $0.042 per juta token, mendekati gratis, dan keluarannya gratis. Keterangan resmi mengatakan keluaran terlalu murah untuk diukur. Mereka juga mengakui tidak bisa membuktikan harga ini tidak disubsidi. Dalam jangka panjang, mereka memperkirakan harga turun, bukan naik.
Daftar harga para petahana ada di ujung lain. Input berjalan dari $0.20 sampai $10 per juta token, dan keluaran kira-kira lima kali lebih mahal lagi. Uang model obrolan duduk pada keluaran panjang. Jawaban untuk dibaca seseorang, dan langkah yang terus dijalankan Agent, keduanya harus ditulis sebagai teks. Begitu teksnya panjang, uangnya jatuh di sisi keluaran. Bahkan jika input ditekan sangat rendah, satu tulisan yang panjang tetap bagian terbesar pemanggilan.
Kedua sisi tidak bertemu. Petahana menjual token. Model yang keluarannya gratis, dan yang inputnya mendekati gratis, memakan bisnis token.
Konfliknya struktural. Semakin luas model penilaian dengan keluaran gratis dipakai, semakin sedikit orang membeli token yang dulu berarti "biarkan model besar mengklasifikasikan, merutekan, dan memberi skor". Laporan pengeluaran diperiksa terhadap kuitansi, dan seseorang harus menilai apakah deskripsi cocok dengan bukti. Peringatan keamanan berbunyi, dan seseorang harus menilai apakah mesin ini diisolasi sekarang. Sendi semacam itu dulu diserahkan utuh kepada model obrolan, yang menulis alasan, setelah itu kesimpulannya digali dari teks. Teks yang digali dihargai sebagai keluaran, pada tingkat yang lebih mahal. Pertanyaan tertutup menyerahkan penilaian secara langsung. Yang kembali adalah sekelompok probabilitas, panjangnya ditetapkan lebih dulu, dan tidak ada teks yang bisa terus ditulis ke bawah. Alasannya boleh tidak ditulis, dan tingkat tagihan itu tidak punya tempat untuk mendarat.
Yang dirusak petahana adalah laporannya sendiri. Semakin luas model dipakai, semakin cepat kolom lama jatuh. Ini bisnis yang masuk dari bawah. Penilaian yang murah berjalan bersama alur dan mengganti keputusan kecil yang dulu memanggil model besar. Yang diganti bukan pemanggilan di atas yang menulis karya panjang. Yang diganti adalah keputusan kecil yang harus dibuat di tengah jalan alur. Pemanggilan yang masih harus ditulis perlahan tetap bisa dijual. Perkiraan resmi bahwa harga mereka sendiri terus turun tidak mengisi kolom yang hilang dari petahana.
Nama Jev berasal dari William Stanley Jevons. Analogi resminya adalah batu bara dan mesin uap. Setelah mesin uap menaikkan efisiensi pembakaran batu bara, batu bara tidak dibakar lebih sedikit. Batu bara dibakar lebih banyak. Efisiensi naik, dan pemakaian tidak menyusut. Pemakaian tumbuh. Penilaian yang murah memanggil pemakaian agar muncul. Bertanya kepada model sekali dulu tidak murah, jadi orang hanya menyerahkan beberapa langkah yang paling berharga, dan menulis sisanya sebagai aturan mati, atau melihat sendiri. Begitu penilaian cukup murah untuk ditanyakan berulang-ulang di dalam kode, pertanyaan yang tadinya tidak layak ditanyakan datang bersama-sama. Yang naik adalah hitungannya.
Pemakaian yang dipanggil agar muncul bukan jenis token yang paling ingin dijual petahana hari ini. Panjang yang ditulis pada satu pemanggilan turun, dan keluaran tidak ditagih. Setinggi apa pun hitungan menumpuk, itu tidak masuk ke tabel yang mereka pakai hari ini, tabel yang menghasilkan uang pada keluaran panjang.
Orang yang mendefinisikan model semacam ini
Yang sulit adalah orangnya.
Hanya seseorang yang memegang pandangan bisnis dan pandangan model pada saat yang sama melihat sendi di seluruh sistem. Yang dibutuhkan sendi bukan yang dibutuhkan otak. Otak membutuhkan bentangan kata yang bisa terus berlanjut. Sendi tidak menginginkan kata. Ia menginginkan hasil yang bisa dijadikan cabang. Jika probabilitasnya masuk akal, program berlanjut. Jika probabilitasnya tidak yakin, itu diserahkan kepada seseorang. Seseorang yang hanya membangun model mudah melihat ini sebagai format keluaran. Seseorang yang hanya mengerjakan bisnis mudah merasa bahwa memanggil model besar sekali lagi sudah cukup. Kedua pandangan harus duduk pada satu orang sebelum orang itu mendefinisikan model semacam ini. Orang seperti itu sedikit. Butir itu tidak muncul sendiri di peta jalan.
Memakai model semacam ini dengan baik, seseorang menemui kesulitan yang sama. Naluri hanya bisa menjawab pertanyaan yang bisa dijawab naluri. Apakah sesuatu memang begitu, dan butir mana dari beberapa butir yang sudah tetap yang dipilih, naluri bisa menjawab. Menulis bentangan isi yang tadinya tidak ada, atau memikirkan langkah-langkahnya sampai selesai pada pertanyaan yang belum dibingkai, naluri tidak bisa menahan. Itu pekerjaan jenis model yang lain. Naluri cepat, dan murah. Ketika program perlu bertanya, ia bertanya sekali, dan waktu serta uangnya bisa menanggung. Sebanyak apa pun ia bertanya, pertanyaannya tetap yang bisa ditahan naluri. Jadi ia tinggal di dalam program yang terus berjalan.
Laboratorium besar bisa membuatnya. Orang dan komputasinya ada. Menutup keluaran dari string menjadi pertanyaan tertutup adalah sesuatu yang bisa dilalui rekayasa, dan itu tidak sama dengan mereproduksi penelitian TypeSafe dalam setengah bulan. Yang dihasilkan setengah bulan adalah bentuk yang bisa dipakai. Implementasi TypeSafe masih di tangan mereka sendiri.
Kolom itu masih menerima uang. Begitu penilaian diubah menjadi pertanyaan tertutup, dan keluaran dibuat gratis, kolom itu kehilangan satu bentangan. Bagian yang hilang terlihat di laporan kuartalan. Tempat yang lebih di depan diserahkan kepada proyek yang masih menulis keluaran panjang. Konteks terus bertambah, Agent menjalankan beberapa putaran lagi, dan yang keluar tambahan persis token yang dikenali daftar harga ini.
Mereka bisa membuatnya. Itu tidak akan dijadwalkan di depan.