Apakah ya-tidak, pilihan, dan skor cukup untuk menjadi satu bahasa?

Noul, Choice, dan Score adalah bahasa untuk kode. Tulisan ini memakai laporan pengeluaran untuk menunjukkan bagaimana tiga pertanyaan itu terpisah, dan kapan bahasa ini tidak cukup.

Penulis bersama: folkbench.com (Folkbench adalah platform evaluasi dan pemilihan yang dapat ditinjau untuk API AI, layanan model, dan situs terkait. Platform ini memakai informasi layanan yang sudah diterbitkan, harga, ketersediaan, latensi, dan jendela bukti untuk membantu pengguna membandingkan dan memilih jalur.)

Sepuluh tulisan dalam seri ini:

Apakah bahasa ini cukup bergantung pada apa yang ingin Anda katakan dengannya. Tiga pertanyaan tertutup membeli kecepatan, dan mereka membeli sifat dapat digabung. Harganya adalah apa pun yang perlu dibentangkan, ia tidak bisa mengatakannya. Ini bahasa untuk kode. Ini bukan untuk dibaca seseorang.

Dokumen dan situs evaluasi membaginya dengan cara yang sama: Noul, Choice, dan Score. Tidak ada jenis keempat di halaman itu.

Tiga jenis di dalam dokumen

Noul hanya bertanya ya atau tidak. Ia mengembalikan probabilitas. Di dalam dokumen angka itu berjalan dari 0 sampai 1. Dekat 1, itu ya yang yakin. Dekat 0, itu tidak yang yakin. Jika ia berhenti dekat 0.5, itu hanya berarti kedua sisi sama-sama mungkin. Itu tidak berarti "tingkat yang sedang-sedang". Dokumen menamai jebakan ini: tanyakan apakah seseorang kuat di Python, dan 0.5 bukan tingkat yang sedang. Jika Anda benar-benar ingin mengukur tingkat, beralih ke Score dan tulis seperti apa setiap tingkat. Noul juga tidak menempelkan keyakinan yang terpisah. Probabilitas itulah sinyalnya.

Choice memilih satu butir dari himpunan yang sudah ditetapkan. Yang kembali adalah butir yang terpilih, plus seluruh distribusi dan sebuah keyakinan. Keyakinan melihat apakah distribusinya tajam. Jika probabilitasnya tersebar, keyakinannya rendah, dan kode tahu pertanyaan ini goyah. Batas kardinalitas pertanyaan ini untuk Jev adalah 255. Di atas itu, Jev mengambil dua tahap. Dua tahap berarti beri skor secara terpisah lebih dulu, lalu buat pilihan yang eksplisit. Kadang sedikit lebih lambat. Kelambatannya adalah langkah tambahan, bukan pertanyaan sempit yang sama tiba-tiba menjadi mahal.

Score adalah tingkat pada sebuah skala. Dalam pemakaian ia adalah skala berurutan dari 2 sampai 10 tingkat. Dokumen mengatakan paling sedikit dua tingkat, dan antarmuka menerima paling banyak sepuluh. Sebuah tingkat harus ditulis sebagai situasi yang bisa dicocokkan. Tulis hanya "agak tinggi" atau "cukup baik", dan model tidak punya apa-apa untuk dicocokkan. Skornya bisa jatuh di antara dua tingkat. Angka itu adalah jumlah posisi setiap tingkat dikalikan probabilitasnya. Desimal di antara dua tingkat itu normal. Itu bukan perhitungan yang rusak. Ia mengembalikan skor, dan pada saat yang sama distribusi di atas tingkat-tingkat itu serta sebuah keyakinan. Skor yang sama mungkin semuanya tertekan pada tingkat tengah, atau terbelah di antara dua ujung. Lihat hanya skornya, dan Anda akan memperlakukan keduanya sebagai hal yang sama. Baca distribusi dan keyakinan bersama-sama.

Tidak satu pun dari tiga jawaban itu bisa keluar dari sel yang Anda berikan lebih dulu. Pertanyaan pada materi yang sama saling bebas. Tambah satu atau ambil satu, dan pertanyaan lain tidak berubah. Jika sebuah penilaian bergantung pada beberapa hal sekaligus, tanyakan secara terpisah dan tinggalkan bobotnya di kode. Nanti, ketika Anda menyesuaikan kebijakan, Anda mengubah angka-angka ini. Anda tidak menulis ulang seluruh prompt.

Laporan pengeluaran, dibongkar

Halaman evaluasi resmi memakai laporan pengeluaran sebagai mainan. Di kiri ada paragraf yang ditulis seseorang, jenis kebijakan yang akan dicatat sebuah tim. Setiap laporan harus membawa kuitansi. Jika kuitansi tidak bisa dibaca, minta karyawan menyerahkan yang lain. Lalu lihat apakah pengeluarannya adalah makan, perjalanan, atau peralatan. Jika makan di atas $75 dan deskripsinya tidak cocok dengan kuitansi, seorang manajer harus menandatangani. Laporan lain diperlakukan sebagai disetujui.

Di kanan, paragraf yang sama dipecah menjadi sebuah alur. Setiap kalimat kebijakan adalah satu pertanyaan, atau satu aturan kode. Apakah kuitansi bisa dibaca adalah ya-tidak. Jika tidak bisa, kode meminta yang baru, dan langkah itu tidak bertanya kepada model lagi. Kategori memakai pilihan tunggal, dan opsinya adalah makan, perjalanan, atau peralatan. Apakah jumlahnya di atas $75, kode membandingkan sendiri. Hanya setengah kalimat tentang deskripsi yang tidak cocok dengan kuitansi yang perlu ditanyakan lagi kepada model. Bersama jumlah itu, hal tersebut memutuskan apakah seorang manajer menandatangani. Laporan yang tidak membutuhkan tanda tangan manajer, kode perlakukan sebagai disetujui. Model tidak menulis komentar di sini.

Arah pada halaman evaluasi adalah satu kalimat: struktur selalu lebih baik daripada satu prompt besar. Dirata-ratakan pada empat alur contoh, setiap model pada workflow punya akurasi lebih tinggi daripada seluruh kebijakan sebagai satu prompt, dan pengeluaran serta waktunya lebih rendah. Sisi prompt menyerahkan seluruh kebijakan dan membiarkan model menelusuri logika di dalam satu jawaban. Sisi workflow memberi kode apa pun yang bisa ditulis sebagai aturan, dan hanya menyisakan penilaian yang sempit sebagai pertanyaan.

Alur nyata yang paling stabil biasanya bukan satu pertanyaan besar. Ia adalah banyak pertanyaan sempit, saling bebas. Perilaku bergantung pada probabilitas, bukan hanya pada satu label diskret. Kategorinya bisa terlihat sudah tetap sementara opsi lain masih memegang bagian probabilitas. Kode bisa mengambil satu langkah lagi pada ambang yang Anda tulis, tanpa membuang distribusinya. Di luar alur, itu tetap satu cabang. Lapisan di tengah adalah rekayasa domain. Pertanyaan mana yang tidak terpakai kali ini, dan angka mana yang dihitung sebagai melewati garis, harus dituliskan untuk bisnis ini, dan dijalankan dengan cara yang sama setiap kali. Begitu jawaban pertanyaan sempit ada di kode, bobot dan ambang ditetapkan di lapisan ini.

Setelah pembangkitan string ditinggalkan

Jev meninggalkan pembangkitan string dan mengambil sampling paralel sebagai gantinya. Pertanyaan dalam satu permintaan dihitung bersama-sama. Setiap keluaran keluar sekaligus. Bukan token demi token. Model obrolan harus menumbuhkan satu token sesudah token lain, masing-masing melihat yang sebelumnya. Tidak ada langkah huruf demi huruf di sini. Tambah beberapa pertanyaan sempit yang biasa, dan waktunya hampir tidak naik bersama mereka. Biaya tambahan terutama token milik pertanyaan itu sendiri.

Harga resmi bukan harga antarmuka obrolan. Input adalah $0.042 per juta token. Keluaran adalah FREE. Tanpa rentetan panjang kata yang dibangkitkan dan ditagih per token, keluaran tidak dikenakan biaya. Latensi jatuh pada 70–500 milidetik. Rentang itu untuk rantai pemanggilan, bukan untuk menunggu di dalam kotak obrolan.

Nilai kembalian langsung menuju kode. Probabilitas Noul bisa masuk ke if. Perutean memakai label Choice. Ambang pemberian skor memakai posisi Score. Tidak ada penguraian lebih dulu. Jika model obrolan menyerahkan sepotong Markdown, Anda harus memecah kata-katanya lebih dulu, dan satu kalimat tambahan bisa membengkokkan format sehingga sisanya tidak bisa tersambung. Tiga pertanyaan itu tidak menyerahkan teks itu kembali, karena Jev tidak membangkitkannya.

Menjelaskan mengapa laporan ini ditolak tidak muat di tiga pertanyaan, dan permintaan maaf serta negosiasi juga tidak. Alasan yang ditulis untuk dibaca seseorang juga tidak ada di nilai kembalian. Itu pergi ke model yang bisa berbicara. Jev berhenti pada penilaian.

Ketika tidak cukup, kasusnya konkret. Jika opsinya adalah nama di dunia terbuka, nama perusahaan dan nama produk terus muncul, dan himpunannya tidak bisa ditetapkan lebih dulu. 255 adalah batas kardinalitas, bukan daftar yang tidak terbatas. Ketika sebuah alasan harus mengutip kalimat dari sumber, tidak ada kalimat semacam itu untuk diserahkan. Ketika pengguna menunggu kalimat manusia, antarmuka menginginkan kata yang bisa dibaca. Memaksa Jev pada saat itu adalah memperlakukan sendi sebagai mulut.

Ketika kebijakan bisa ditutup menjadi ya-tidak, pilihan tunggal, dan tingkat, yang mengikuti adalah cabang, dan penilaian dirakit kembali ke kode yang sama. Jika yang Anda inginkan adalah kecepatan, dan sifat dapat digabung semacam ini, itu cukup. Yang perlu dibentangkan, ia tidak bisa mengatakannya. Kecepatan dan sifat dapat digabung adalah yang dibeli pertukaran itu.

Sumber

Seri