Mengapa Jev yang tidak bisa mengobrol justru cocok untuk Agent

Agent sering kekurangan penilaian yang bisa masuk ke cabang, bukan bentangan teks panjang yang lain. Tulisan ini menjelaskan tiga jenis pertanyaan, apa yang dibandingkan evaluasi workflow, dan mengapa jalur panas tidak bisa menunggu satu obrolan.

Penulis bersama: folkbench.com (Folkbench adalah platform evaluasi dan pemilihan yang dapat ditinjau untuk API AI, layanan model, dan situs terkait. Platform ini memakai informasi layanan yang sudah diterbitkan, harga, ketersediaan, latensi, dan jendela bukti untuk membantu pengguna membandingkan dan memilih jalur.)

Sepuluh tulisan dalam seri ini:

Yang sering kurang pada Agent bukan bentangan teks panjang yang lain. Yang kurang adalah penilaian yang bisa masuk ke alur kendali secara langsung. Yang biasa adalah apakah peringatan ini tetap ditutup, apakah faktur ini dibayar, apakah trace ini membutuhkan orang, dan apakah kalimat layanan pelanggan berikutnya harus dieskalasi. Simpul-simpul ini bukan tempat model menulis analisis. Kode membutuhkan nilai yang bisa dibandingkan dan dijadikan cabang. Itulah yang dilakukan Jev.

Rumusan TypeSafe berarti sebuah pemanggilan fungsi dari kecerdasan terdepan. State masuk. Keputusan probabilistik yang bertipe keluar. Ia tidak menghasilkan string. Kalimat untuk seseorang, dan penilaian untuk sebuah program, bukan pintu keluar yang sama.

Kunci keluarannya lebih dulu

Keluaran model besar yang ada sekarang adalah string. Perangkat lunak yang perlu melanjutkan tetap harus mengurainya, memvalidasinya, dan menjaga agar tidak melenceng. Satu bidang tambahan muncul. Paragrafnya terlihat lengkap, dan enum-nya tidak cocok. Seseorang di kotak obrolan menyadarinya dan bertanya lagi. Kode tidak menyadari, dan terus berjalan dengan kesalahan itu. Terkubur beberapa pemanggilan di dalam, model yang lebih pintar pun tidak bisa mengembalikannya.

Jev menetapkan ruang keluaran lebih dulu. Anda mengatakan apa yang boleh ia kembalikan, dan ia hanya membagikan probabilitas di dalam ruang itu. Kesalahan tipe tidak bisa terjadi, secara matematis. Ia tidak bisa menyerahkan bentuk yang tidak Anda definisikan. Itu bukan hal yang sama dengan penilaian yang benar. Probabilitas bisa condong ke arah yang salah, dan opsinya bisa yang salah. Keamanan tipe menutup bentuknya, bukan benar dan salah. Begitu bentuknya tetap, cabang sesudahnya bisa ditulis. Anda tidak harus mengail nilai dari sebuah paragraf lebih dulu.

Pertanyaannya hanya ada tiga.

Noul adalah ya-tidak. Model memberi probabilitas dari 0 sampai 1. Dekat 1 adalah ya. Dekat 0 adalah tidak. Dekat 0.5 adalah tidak yakin. Ia tidak menempelkan keyakinan yang terpisah. Probabilitas itulah sinyalnya. Choice adalah pilihan tunggal. Anda mendaftar opsinya lebih dulu, dengan batas 255. Yang kembali adalah opsi yang terpilih, distribusi di atas setiap opsi, dan sebuah keyakinan. Kode memakai distribusi itu untuk memutuskan apakah ia bertindak atau menyerahkan kasus itu kepada seseorang. Score adalah tingkat. Tingkatnya berjalan dari 2 sampai 10, dan Anda menuliskan arti setiap tingkat. Yang kembali adalah sebuah skor, distribusi di atas tingkat-tingkat itu, dan sebuah keyakinan. Skornya bisa jatuh di antara dua tingkat, sebagai posisi pada skala.

Ya-tidak ditulis sebagai syarat. Pilihan tunggal dan tingkat berbeda: yang pertama melihat opsi mana yang ia pijak, yang kedua memberi ambang pada skor. Pertanyaan yang baik tetap sempit. Penilaian yang bisa dibuat dalam satu detik oleh orang yang memahami domain itu setelah membaca materinya, itulah jenis yang diberikan kepadanya. Apakah pelanggan meminta pengembalian dana adalah pertanyaan jenis itu. Membaca seluruh surat lalu memutuskan tindakan terbaik, bukan. Kalimat kedua menginginkan penalaran yang lambat. Pecah, lalu tanyakan. Pertanyaan yang dipecah menghadap state yang sama, saling bebas, dan kembali bersama dalam satu permintaan. Bobotnya tinggal di kode. Ketika kebijakan berubah, Anda mengubah angkanya. Anda tidak menulis ulang seluruh prompt.

Yang menahan orang adalah persimpangan

Yang benar-benar menahan orang sering kali adalah simpul berbentuk ini. Sebuah peringatan datang bersama catatan yang sudah dimiliki mesin, dan kesimpulannya adalah tutup, kirim ke analis, atau isolasi sekarang. Sebuah faktur menggantung pada pesanan dan catatan pengiriman, dan seseorang harus memutuskan bayar, tahan, atau kirim kembali. Agent layanan pelanggan sudah selesai, pemanggilan alat semuanya ada di trace, dan seseorang harus memutuskan apakah trace ini dilihat, dan seberapa segera. Pelanggan menulis lagi, dan utas serta state akun keduanya ada. Bagaimana kalimat berikutnya harus berlanjut, dan apakah harus dieskalasi, adalah pertanyaan berbentuk sama.

Bagian yang bisa dibekukan aturan adalah kode. Yang rapuh adalah pengecualian yang tidak bisa diselesaikan. Kuitansinya cocok, alasannya samar, dan satu langkah di trace terlihat aneh. Logika tulisan tangan pecah pada hal-hal ini. Anda memasukkan seluruh kebijakan ke dalam satu prompt dan membiarkan model memikirkannya sekali, dan Anda menulis lebih sedikit syarat. Pintu keluarnya berubah kembali menjadi sepotong teks. Agar teks masuk ke alur kendali, Anda menulis lapisan penguraian yang lain. Lapisan itu bisa salah dengan sendirinya.

Evaluasi workflow milik TypeSafe mengukur cara penyambungan ini. Evaluasi itu memecah tugas menjadi banyak pertanyaan sempit. Yang bisa diputuskan kode, diputuskan kode. Model hanya menjawab penilaian yang tidak bisa diselesaikan kode. Empat alur publiknya adalah insiden keamanan, observabilitas jejak Agent, penanganan faktur, dan layanan pelanggan. Di bawah alur yang sama, model pada workflow lebih akurat daripada memasukkan seluruh kebijakan ke dalam satu prompt, dan biayanya lebih kecil serta waktunya lebih singkat. Dirata-ratakan pada empat tugas itu, model yang diuji bergerak ke arah itu.

Tindakan sesudah itu mengikuti probabilitas, bukan label yang sudah dibanting tertutup. Hasil yang keluar dari sistem tetap satu tindakan diskret. Rekayasa di tengah harus dilakukan dengan cara yang sama setiap kali.

Evaluasi mengukur kedekatan

Evaluasi ini tidak berdebat dengan Anda tentang apakah alurnya sendiri ditulis salah. Ia menganggap harness-nya benar. Jawaban rujukan bukan label emas yang ditandai tangan, pertanyaan demi pertanyaan. GPT-6 Astra dan Claude Fable 5.1 menjawab setiap pertanyaan di bawah high thinking, dan kedua jawaban itu dirata-ratakan. Model lain memakai penalaran default vendor. Baru setelah alurnya tetap mereka bisa dibandingkan. Evaluasi membandingkan seberapa dekat sebuah model dengan penilaian kedua model besar itu, plus kecepatan dan biaya.

Jadi grafik itu tidak membuktikan bahwa Jev memahami bisnis lebih baik daripada Astra. Astra dan Fable adalah penggaris di sini. Jev harus mendekati penilaian mereka, dan juga harus membuka celah pada latensi dan biaya. Jika pertanyaannya dipecah salah, penggaris yang lebih dekat tidak menolong. Memecah pertanyaan adalah pekerjaan orang yang menulis alur itu.

Jev duduk jauh di luar pada garis depan "cepat dan murah". Kelipatan yang lebih tinggi di situs resmi, sekitar 193.6 kali lebih cepat dan 444.6 kali lebih murah, adalah ujung tinggi evaluasi ini. Kelipatan itu bukan setiap panggilan. Panggilan di sini lebih dekat ke beban otomasi yang benar-benar akan Anda luncurkan.

Yang ia dekati adalah probabilitas pada pertanyaan-pertanyaan sempit itu setelah dipecah, bukan penulisan analisis yang panjang. Jev tidak menulis analisis panjang itu.

Jalur panas tidak bisa menunggu

Latensi itu keras bagi Agent. Seseorang masih bisa menunggu tiga detik. Begitu lapisan membungkus lapisan, mereka tidak bisa. Rantai yang sama juga punya pengambilan, penulisan basis data, dan panggilan berikutnya, dan setiap lompatan menghabiskan waktu yang sama. Di dalam 70 sampai 500 milidetik, sebuah penilaian bisa duduk di jalur panas. Di luar rentang itu, tumpukan panggilan memperlakukannya sebagai pemblokiran.

Berbicara kepada seseorang, model terdepan yang ada sekarang biasa memakan waktu dari 3 detik sampai lebih dari 300 detik ujung ke ujung. Kecepatan itu masuk akal untuk kopilot, atau untuk Agent pemrograman yang ditonton seseorang. Sebagai syarat pada jalur panas, kecepatan itu tidak. Jev tidak mengeluarkan kalimat token demi token. Probabilitas yang seharusnya kembali tiba bersama-sama. Kecepatannya datang dari situ.

TypeSafe juga memakai Jev untuk memeriksa. Prompt, jejak penalaran, dan keluaran dari model lain, Jev memberi skor, dan ia juga bertindak sebagai pagar pembatas serta mencari jailbreak. Pembangkitan tetap di model obrolan. Apakah gerbang ini dilewati diputuskan oleh model yang tidak menghasilkan string. Itu sendi di dalam Agent, bukan obrolan. Jika anggukan dan peninjauan masih duduk di teks panjang, Anda harus mencari program lain untuk membacanya. Jev menutup hasilnya menjadi probabilitas dan tingkat, dan peninjauannya bisa ditulis sebagai kode.

Kalimat yang ditulis untuk pengguna tetap pekerjaan model obrolan. Jev tidak mengambil kalimat itu. Ia mengambil perutean di depan, dan pemeriksaan di belakang. Yang kurang pada Agent di sini bukan satu penjelasan lagi yang lebih panjang. Yang kurang adalah penilaian yang tipenya sudah tetap, sehingga kode bisa berjalan bersamanya.

Sumber

Seri