Orang mundur dari tengah lingkaran ke tepi
Menangkap kegagalan dan melihat setiap pertanyaan dipisahkan. Ya-tidak dan pilihan tunggal berkeyakinan tinggi langsung masuk cabang. Orang hanya menangani potongan yang terpental kembali, dan keyakinan harus benar-benar berfungsi sebagai ambang.
Penulis bersama: folkbench.com (Folkbench adalah platform evaluasi dan pemilihan yang dapat ditinjau untuk API AI, layanan model, dan situs terkait. Platform ini memakai informasi layanan yang sudah diterbitkan, harga, ketersediaan, latensi, dan jendela bukti untuk membantu pengguna membandingkan dan memilih jalur.)
Sepuluh tulisan dalam seri ini:
- JEV - Sendi tidak membutuhkan otak
- JEV - Mengapa Jev yang tidak bisa mengobrol justru cocok untuk Agent
- JEV - Sejauh mana "tidak bisa berhalusinasi" itu sebenarnya berlaku
- JEV - Apakah ya-tidak, pilihan, dan skor cukup untuk menjadi satu bahasa?
- JEV - Laboratorium bisa membuat ini. Mengapa tetap mungkin tidak.
- JEV - Dua demo yang saya jalankan
- JEV - Orang mundur dari tengah lingkaran ke tepi
- JEV - Lewat garis itu, saya sudah tidak bisa membedakan siapa yang lebih pintar
- JEV - Ada pertanyaan yang tidak seharusnya ditanyakan kepadanya
- JEV - Model yang disederhanakan, sebuah suite, dan satu yang tidak berbicara
Selama dua tahun terakhir, hampir setiap sistem AI yang serius yang saya lihat menganggap ada orang di dalam lingkaran, yang orang sebut human in the loop. Keluarannya tidak bisa diandalkan. Sistem menyelesaikan satu penggal dan sendiri tidak tahu apakah penggal itu bisa dipakai secara langsung, jadi seseorang harus menangkapnya.
Menangkapnya, jika diteruskan, berubah menjadi seseorang yang melihat setiap penilaian. Itulah yang saya temui. Memanggil seseorang hanya ketika ada yang sudah salah itu jarang. Seseorang yang duduk di lingkaran sepanjang waktu itu biasa. Ketika pertanyaannya sedikit, lirikan itu masih terlihat seperti tanggung jawab. Ketika banyak, orang itu hanya melewatkannya, dan setelah lewat pekerjaan tetap berlanjut. Dua tahun itu saya menganggap ini perlengkapan standar sistem yang serius. Keluaran berbentuk begitu, dan seseorang harus duduk di tengah. Saya tidak membacanya sebagai kemalasan.
Kemudian saya memisahkan dua hal. Menangkapnya adalah seseorang yang berdiri di samping, menunggu saat yang tidak yakin. Seseorang di setiap lingkaran berarti setiap pertanyaan harus melewati tangannya. Dulu saya memperlakukan keduanya sebagai satu hal, dan kemudian saya tidak bisa mengeluarkan orang dari kebanyakan lingkaran. Jika saya bahkan tidak tahu pertanyaan mana yang tidak yakin, saya hanya bisa melihat semuanya sendiri.
Yang diserahkan model kepada saya adalah satu penggal. Penggal itu bisa ditulis sangat lengkap, dan bisa terlihat sangat seperti kesimpulan, tetapi tidak bisa masuk ke alur kendali. Saya harus membaca lebih dulu, membaca ke arah mana ia ingin membawa perkara itu, lalu menetapkan cabang sendiri. Saya tidak bisa menghapus langkah itu. Kode menginginkan sebuah nilai, dan penggal itu belum menjadi nilai. Orang tinggal di tengah lingkaran karena cabang harus menunggu sampai saya selesai membaca.
Yang saya tinjau bukan pengecualian yang sesekali. Melepas atau eskalasi, saya harus menyelesaikan sebuah alasan lebih dulu, satu demi satu. Setelah cukup banyak membaca, saya memperlakukan tulisan yang lengkap sebagai pemikiran yang sudah selesai. Orang masih duduk di tengah lingkaran, dan penilaian sudah mengikuti penggal itu.
Penilaian yang cukup kecil untuk masuk ke kode
Jev membalikkan itu. Penilaian ditekan cukup kecil, dan cukup tertutup, untuk masuk langsung ke alur kendali kode. Pertanyaannya ditulis tertutup sebelum ditanyakan: ya-tidak, atau pilihan tunggal, atau kalau tidak sebuah Score. Model hanya menjawab pertanyaan yang sudah tertutup. Ia tidak menceritakan seluruh perkara sebagai satu penggal. Jawabannya masuk ke cabang. Seseorang tidak lagi berada di tengah.
Kekecilan yang saya maksud adalah pertanyaannya. Bisnisnya sendiri tidak menjadi lebih kecil. Bisnis tetap sebesar yang seharusnya. Yang menjadi lebih kecil adalah kalimat yang ditanyakan kepada model. Kalimat itu harus bisa masuk ke cabang di kode. Yang tidak bisa masuk ke cabang tetap catatan yang harus dibaca seseorang, dan orang itu kembali ke tengah lingkaran.
Saya berpegang pada ini ketika menulis pertanyaan. Jika opsinya bisa ditulis, dan batasnya tidak bertengkar, pertanyaan itu bisa ditanyakan. Jika saya hanya menulis "gunakan penilaian Anda", itu bukan pertanyaan tertutup. Entah saya tetap menilainya sendiri, atau itu menjadi penggal yang lebih panjang. Saya menyimpan itu. Saya tidak bertanya kepada model.
Lebih tepatnya, yang dibaliknya bukan orangnya. Yang dibalik adalah "setiap penilaian perlu seseorang meliriknya". Setiap pertanyaan membawa keyakinan. Ketika keyakinan bisa dipercaya, sistem hanya mengirim potongan yang paling tidak yakin kepada seseorang. Orang mundur dari tengah lingkaran ke tepi. Pada bagian yang yakin, orang tidak lagi muncul.
Saya menyimpan empat gambar yang dangkal di kepala: apakah sebuah peringatan ditutup, apakah sebuah faktur dibayar, apakah kalimat layanan pelanggan berikutnya dieskalasi, dan apakah satu jalankan Agent perlu dilihat seseorang. Semuanya jenis hal yang sama. Bisnis dipecah menjadi pertanyaan kecil yang tertutup lebih dulu, dan kode berjalan dari hasilnya. Orang dulu berdiri di tengah lingkaran-lingkaran ini. Setelah dipecah, kebanyakan cabang tidak harus memanggil seseorang.
Saya hanya menangani yang terpental kembali
Beginilah saya memakainya. Ya-tidak dan pilihan tunggal berkeyakinan tinggi langsung menuju cabang. Saya tidak membuka isinya. Score yang jatuh pada tingkat tengah, dengan distribusi yang datar, itulah yang terpental kepada saya. Yang hanya jatuh pada tingkat tengah, dengan distribusi yang tidak datar, juga tidak saya lihat. Kode berlanjut. Tidak ada cara ketiga. Saya tidak membiarkannya menulis alasan lebih dulu lalu memutuskan, dari situ, apakah saya melihat. Dilakukan begitu, seseorang tetap melewati setiap pertanyaan. Yang terpental kembali hanya potongan kecil, dan saya bisa menerimanya. Ketika dulu saya melewati setiap pertanyaan, saya bisa selesai melihat dan tetap tidak bisa mengatakan apa yang sudah saya nilai.
Ketika terpental, lihat distribusinya, bukan karya yang panjang. Karya yang panjang menculik seseorang. Begitu alasannya dibentangkan, kesimpulannya biasanya sudah dipilih, dan kata-kata menulis ke bawah mengikuti kesimpulan itu. Saya mungkin punya penilaian lain, dan saya tetap harus membongkar penggal itu lebih dulu. Saya tidak bisa menunjuk kalimat yang salah. Saya hanya kurang yakin daripada ia, dan saya merasa canggung menolak, dan pada akhir pembongkaran saya sering mengangguk ikut. Distribusi tidak berdebat dengan saya. Seberapa berat setiap tingkat, terbentang. Tempat yang datar bisa saya lihat dalam sekali lirik. Jika saya mengubah keputusan, saya mengubahnya, tanpa lebih dulu harus mengalahkan penggal yang ditulis sangat penuh.
Saya masih di dalam sistem ini, dan saya tidak ada di kebanyakan lingkaran. Saat ia terpental kembali adalah saat yang menjadi milik saya. Yang ada di tangan saya adalah distribusi yang tidak terpisah. Saya memilih sisi sendiri. Kode berjalan menurut yang saya pilih. Yang sudah terpisah selesai di dalam kode, dan bukan giliran saya untuk melihat. Saya tidak lagi menulis penggal untuk berunding dengan model, dan saya tidak menunggu ia mengirimkan penjelasan.
Keyakinan harus berfungsi sebagai ambang
Saya berani memakai cara ini dengan satu syarat. Keyakinan harus benar-benar berfungsi sebagai ambang. Jika model bisa mengerjakan pertanyaan tetapi tidak bisa mengatakan kapan ia tidak yakin, seseorang tetap tidak bisa meninggalkan tengah lingkaran. Keterangan resmi mengatakan yang mereka latih dengan RLCD adalah kalibrasi: keyakinan lebih tinggi lebih akurat, dan masukan yang serupa memberi jawaban yang serupa. Saya memercayai arah itu. Kalimat pertama membuat ambang bermakna. Kalimat kedua lebih saya pedulikan. Jika pertanyaan yang serupa begini hari ini dan begitu besok, ambang yang saya tetapkan tidak akan tetap. Itulah sebabnya saya berani memindahkan orang keluar dari tengah lingkaran.
Jika keyakinan hiasan, hal itu terbalik. Orang belum mundur ke tepi. Orang sudah diganti oleh mesin yang lebih pandai menampilkan kepastian. Ia memberi setiap pertanyaan angka yang sangat penuh, dan angka itu tidak ada hubungannya dengan apakah ia akurat. Jika saya memakainya sebagai syarat untuk membiarkan sesuatu lewat, saya melepas ketika seharusnya tidak. Dalam cara saya memakainya sekarang, ia tidak melakukan itu. Keyakinan tinggi, saya berikan kepada kode. Yang terpental kembali, distribusinya datar, tanpa kalimat sopan tentang ketidakyakinan yang menempel.
Ada juga saat seseorang harus melangkah kembali masuk. Yang belum tertutup dengan baik tidak seharusnya diotomatisasi. Sebuah opsi kehilangan sepotong, atau dua batas saling kusut, dan keyakinan hanya mengisi angka pada pertanyaan yang buruk. Saya kembali dan mengubah pertanyaan lebih dulu. Saya tidak menopang celah itu dengan model. Akibat yang terlalu besar untuk dibeli dengan ambang probabilitas, saya tinggalkan di dalam lingkaran. Keempat gambar punya lingkaran semacam itu, dan setinggi apa pun keyakinannya, saya tidak memberikannya kepada ambang. Itu bukan model yang gagal. Lingkaran itu tidak seharusnya diotomatisasi.
Setelah orang mundur ke tepi, pertanyaan yang saya lihat jauh lebih sedikit. Yang saya yakin, saya tidak lagi melihat. Potongan yang paling tidak yakin masih di tangan saya. Lingkaran yang tidak seharusnya diberikan kepada ambang, seseorang tetap di dalamnya.