Dua demo yang saya jalankan
State bisnis yang sama dijalankan lewat dua demo: pertanyaan tertutup ditanyakan sekaligus, lalu pertanyaan risiko yang keyakinannya tidak naik dihentikan. Perbandingan resmi berdampingan dengan GPT-5.6 Terra hanya untuk melihat pertanyaan mana yang tidak sepakat.
Penulis bersama: folkbench.com (Folkbench adalah platform evaluasi dan pemilihan yang dapat ditinjau untuk API AI, layanan model, dan situs terkait. Platform ini memakai informasi layanan yang sudah diterbitkan, harga, ketersediaan, latensi, dan jendela bukti untuk membantu pengguna membandingkan dan memilih jalur.)
Sepuluh tulisan dalam seri ini:
- JEV - Sendi tidak membutuhkan otak
- JEV - Mengapa Jev yang tidak bisa mengobrol justru cocok untuk Agent
- JEV - Sejauh mana "tidak bisa berhalusinasi" itu sebenarnya berlaku
- JEV - Apakah ya-tidak, pilihan, dan skor cukup untuk menjadi satu bahasa?
- JEV - Laboratorium bisa membuat ini. Mengapa tetap mungkin tidak.
- JEV - Dua demo yang saya jalankan
- JEV - Orang mundur dari tengah lingkaran ke tepi
- JEV - Lewat garis itu, saya sudah tidak bisa membedakan siapa yang lebih pintar
- JEV - Ada pertanyaan yang tidak seharusnya ditanyakan kepadanya
- JEV - Model yang disederhanakan, sebuah suite, dan satu yang tidak berbicara
Hari ini saya menjalankan dua demo, mencoba Jev. Tidak satu pun meminta ia mengobrol. Saya memasukkan sepotong state bisnis, menanyakan pertanyaan tertutup, dan melihat apa yang kembali.
State adalah sepotong bisnis, cukup untuk dijadikan dasar penilaian. Saya tidak mengubahnya menjadi cerita. Model obrolan yang diberi masukan semacam ini sering mulai dengan paragraf pemahaman, lalu saran. Saya tidak menginginkan saran. Saya ingin melihat apakah ia bisa tinggal di tengah alur sebagai sendi, mengeluarkan angka, dan membiarkan kode berlanjut.
Demo pertama
Saya memasukkan state itu dan menanyakan pertanyaan tertutup dalam satu lintasan. Saya mengklik. Ia kembali seketika.
Rentang resmi adalah 70 sampai 500 milidetik. Saya tidak mengukurnya, jadi saya tidak bisa mengatakan di mana saya mendarat di dalam rentang itu. Yang saya rasakan adalah saya tidak pernah sampai pada rasa tidak sabar. Dengan model yang menulis balasan panjang, saya terbiasa meninggalkan jendela dan mengerjakan hal lain. Kali ini saya tidak pernah sempat meninggalkan jendela. Hasilnya sudah ada di halaman sebelum saya beralih.
Saya menghitung uangnya secara terpisah. Keluaran tidak ditagih. Input adalah $0.042 per juta token. Ketika state-nya pendek, biaya input satu panggilan adalah sesuatu yang harus saya cari di akun sebelum saya bisa melihatnya. Sebagai sendi, ia murah. Simpul seperti ini dilalui berkali-kali. Model besar yang juga menagih keluaran, saya mulai menghemat pada kalimat kedua. Di sini, menanyakan satu pertanyaan lagi tidak membawa beban itu.
Pertanyaannya adalah tiga itu.
Untuk ya-tidak saya memakai Noul. Saya bertanya apakah pesanan ini harus diangkat keluar dari alur otomatis dan diberikan kepada seseorang lebih dulu. Ia tidak membalas dengan "ya" atau "tidak" yang kering. Ia membalas dengan probabilitas "ya", antara 0 dan 1. Saya melihat ujung mana yang ia tempeli. Jika ia menempel pada satu ujung, saya memperlakukan pertanyaan itu sebagai selesai. Jika ia goyah di tengah, pertanyaan itu masih terbuka.
Untuk klasifikasi saya memakai Choice, pilihan tunggal. Opsi dan arti masing-masing ditulis oleh saya. Saya tidak menumpuknya menuju 255. Batas resmi adalah 255, dan pertanyaan ini tidak membutuhkannya. Terlalu banyak butir, dan saya sendiri tidak bisa melihatnya. Dengan sedikit butir saya bisa menilai. Bobot jelas menumpuk pada satu opsi, dan yang lain sangat tipis: hanya juara semacam itu yang saya biarkan masuk ke cabang. Jika dua teratas menggigit berdekatan, saya tidak akan menerimanya hanya karena ada juara. Juara yang hanya sedikit lebih tinggi belum terpisah.
Untuk risiko saya memakai Score, untuk melihat tingkat mana yang ia pijak. Skala Score adalah 2 sampai 10 tingkat. Saya memotong pertanyaan ini di dalam rentang itu, dari ringan ke berat. Saya tidak mengarang skala lain. Ia mengembalikan probabilitas setiap tingkat, dan sebuah posisi yang dibobot oleh probabilitas itu. Saya tidak berani memakai posisi itu sendirian. Jika probabilitas menumpuk pada satu tingkat, posisinya adalah tingkat itu. Jika probabilitas terbelah di dua tingkat yang bertetangga, posisinya jatuh di tengah. Posisinya terlihat lebih halus, dan kedua tingkat masih ada. Saya tidak akan menulis posisi semacam itu ke dalam syarat yang kemudian.
Ia tidak menulis penjelasan. Lihat probabilitasnya, bukan penjelasannya. Ketika saya memakai model obrolan untuk penilaian jenis yang sama, kesimpulannya terbungkus dalam paragraf. Saya harus mengupas kata-katanya sebelum berani mengisi bidang, dan saya takut menganggap kesopanan sebagai sikap. Hari ini tidak ada lapisan kata semacam itu. Di dalamnya adalah tipe dan probabilitas. Yang dikonfirmasi demo ini bagi saya adalah bahwa ia cocok sebagai sendi. Saya tidak harus selesai membaca esai pendek sebelum menyambungkan kode.
Saya mengambil pertukarannya dari distribusi, bukan dari perasaan sesaat. Ya-tidak yang menempel pada tepi, saya biarkan lewat secara otomatis. Bobot kategori menumpuk pada satu butir, saya biarkan kode menyambung. Distribusi pertanyaan risiko tidak berkumpul, dan saya tidak membekukannya di demo ini. Saya meninggalkannya untuk yang berikutnya.
Yang kedua memecah hal yang sama
Demo kedua memakai state yang sama. Saya tidak pergi mencari yang baru. Saya memecah pertanyaannya, untuk memeriksa kalimat bahwa seseorang tidak harus berdiri di tengah setiap lingkaran.
Keyakinan tinggi, saya siap menyerahkannya kepada kode. Keyakinan rendah, saya simpan untuk dilihat. Setelah mencobanya, saya bersedia melepaskan yang tinggi. Ya-tidak yang menempel pada tepi, dan kategori yang menumpuk pada satu sisi, saya biarkan program berjalan sendiri. Yang tinggi langsung masuk ke cabang. Aturannya ditulis di kode. Keyakinan cukup, dan program berlanjut. Keyakinan tidak cukup, dan program berhenti di depan saya. Ketika saya membaca log, lingkaran yang tinggi itu tidak menunggu anggukan saya. Saya tidak mengonfirmasinya satu per satu.
Yang rendah adalah pertanyaan risiko. Saya tidak menanyakannya cukup ketat, dan state-nya juga kekurangan materi yang bisa memisahkan dua tingkat yang bertetangga. Distribusinya tersebar, dan keyakinan tidak mau naik. Sambil melihat, saya sebenarnya ingin memilih satu tingkat untuknya, agar seluruh alur bisa selesai. Pikiran itu tidak boleh diikuti. Begitu tersebar, saya tidak ingin menutupnya untuknya. Jika saya sembarangan memilih satu tingkat dan menuliskannya, langkah berikutnya akan memperlakukan tingkat itu sebagai fakta. Itu saya yang memasok keputusan yang tidak ia buat, dan mendandaninya sebagai jawaban yang sudah selesai.
Jadi pertanyaan itu berhenti. Ia tinggal untuk saya lihat, dan ia tidak masuk ke cabang otomatis. Saya tidak menjalankannya lagi untuk mencoba keberuntungan. Materinya masih sama, dan distribusinya kemungkinan besar masih tersebar. Pertanyaan ini tidak seharusnya dipaksa. Nanti saya bisa menebalkan state, atau menulis tingkat sebagai rumusan yang benar-benar berdiri terpisah. Jika saya memaksa satu tingkat keluar darinya sekarang, yang kembali adalah rata-rata. Jika saya memasukkan angka itu ke cabang, yang mengikuti akan memperlakukannya sebagai risiko yang sudah diputuskan.
Saya tidak menulis "saya merasa ini lebih serius" di sampingnya. Perasaan saya tidak bisa mengesampingkan distribusi yang tersebar lalu dikirim untuk berjalan secara otomatis. Jika distribusinya benar-benar condong, bobotnya akan menumpuk ke satu sisi dengan sendirinya. Jika ia tidak bisa menumpuk ke sana, saya tidak punya kedudukan untuk menumpukkannya untuknya. Saya menghentikan demo kedua di situ.
Yang berdampingan dari pihak resmi
Baru setelah dua demo itu saya membuka contoh berdampingan di playground resmi. Satu sisi adalah Jev. Sisi lain adalah GPT-5.6 Terra. Terra memakai penalaran default. Saya tidak ada di sana untuk menilai siapa yang lebih pintar. Saya hanya melihat pertanyaan mana yang menjadi tempat ketidaksepakatan.
Saya memeriksanya sampai selesai. Hanya "Churn likelihood level" yang berbeda di kedua sisi. Pertanyaan lain sejajar. Pertanyaannya sendiri samar. Seberapa tinggi kemungkinan churn tidak mudah ditutup menjadi tingkat yang bersih. Ketika samar, yang ia berikan adalah distribusi. Sisi lain, untuk menyelesaikan jawaban, harus mengeluarkan sebuah kata. Saya tidak mencatat ketidaksepakatan itu sebagai menang atau kalah. Memberi distribusi lebih jujur daripada memaksa keluar sebuah kata. Kata itu bisa duduk di dalam kalimat yang diucapkan seseorang. Ia tidak pantas berada di cabang yang akan mengeksekusi sendiri.
Saya menengok kembali pertanyaan risiko rendah milik saya. Milik saya dan yang berdampingan ini adalah jenis yang sama. Tidak ada model kedua di sampingnya, dan saya tetap tidak seharusnya mencubit probabilitas yang tersebar menjadi satu tingkat.
Tidak bisa mengobrol, saya mula-mula anggap sebagai cacat. Setelah memakainya, saya tidak melihatnya begitu. Tidak ada kalimat pembuka di kembalian. Saya tidak harus menghapus kalimat pembuka. Ketika dulu saya menggali penilaian dari antarmuka obrolan, saya harus melewati basa-basi lebih dulu, dan juga menjaga agar ia tidak berubah pikiran kemudian. Hari ini tidak ada teks yang harus dibereskan. Bagi saya itu kelegaan. Itu satu hal yang mudah salah, yang berkurang.
Yang saya jalankan hari ini adalah dua demo ini. Yang berdampingan di playground, saya hanya membuka dan melihat. Itu tidak dihitung sebagai yang ketiga yang saya buat. Yang pertama menetapkan, bagi saya, bahwa ia bisa duduk pada sendi, dan bahwa keyakinan tinggi bisa diberikan kepada kode. Pada yang kedua, saya menghentikan pertanyaan yang distribusinya tersebar, dan saya tidak mendandaninya seolah sudah dijawab. Ia cepat, dan pada harga ini saya juga merasa pemanggilan berulang itu murah. Yang kembali bukan artikel. Yang kembali adalah distribusi.
Sumber
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://console.typesafe.ai/playground?share=shr_13a74b495fb786c4bd7964f11597301e7c9