Sejauh mana "tidak bisa berhalusinasi" itu sebenarnya berlaku

TypeSafe mengatakan Jev tidak bisa berhalusinasi. Kalimat itu hanya berlaku untuk tipe: jawaban tidak bisa keluar dari tabel yang ditetapkan lebih dulu. Kalibrasi dan kebenaran terpisah, dan evaluasi workflow sejajar dengan rata-rata Astra dan Fable.

Penulis bersama: folkbench.com (Folkbench adalah platform evaluasi dan pemilihan yang dapat ditinjau untuk API AI, layanan model, dan situs terkait. Platform ini memakai informasi layanan yang sudah diterbitkan, harga, ketersediaan, latensi, dan jendela bukti untuk membantu pengguna membandingkan dan memilih jalur.)

Sepuluh tulisan dalam seri ini:

TypeSafe mengatakan Jev "tidak bisa berhalusinasi". Kalimat itu terdengar seperti halusinasi sudah dilarang dalam satu sapuan. Tulisan yang sama menyempitkannya. Yang mereka tulis adalah bahwa pencocokan skema adalah jaminan, bukan statistik, jadi kesalahan tipe bisa ditulis sebagai 0%. Satu contoh lawan sudah cukup untuk membantahnya. Mereka mengatakan ini tidak mungkin secara matematis.

Satu-satunya lapisan yang bisa ditopang kalimat itu adalah tipe. Jev meninggalkan pembangkitan string. Ia menyerahkan struktur yang ditetapkan lebih dulu, bukan satu penggal teks yang dibangkitkan di tempat. Apakah probabilitasnya akurat, dan apakah penilaiannya benar, adalah dua perkara lain. Jika pembaca tidak memisahkannya, "ia tidak menulis prosa" terdengar sebagai "jawabannya benar".

Ia tidak bisa keluar dari tabel itu

Jenis pertanyaan hanya ada tiga, dan semuanya tersegel. Noul bertanya apakah satu hal berlaku, dan yang kembali adalah probabilitas dari 0 sampai 1. Opsi Choice harus ditulis pemanggil lebih dulu, paling banyak 255 pada satu tabel. Yang kembali adalah opsi yang terpilih, dengan probabilitas pada setiap opsi dan sebuah keyakinan. Tingkat Score juga harus ditulis lebih dulu, paling sedikit dua dan paling banyak sepuluh. Skornya bisa jatuh di antara dua tingkat. Jawaban membawa probabilitas setiap tingkat dan sebuah keyakinan pada saat yang sama. Skor itu tetap posisi pada skala, bukan paragraf baru.

Ia tidak bisa keluar dari tabel opsi. Model juga tidak bisa tiba-tiba menulis sepotong prosa dan membujuk jawaban itu sampai berbentuk. Dokumen mengatakannya terus terang. Yang diserahkan model adalah distribusi di atas opsi atau tingkat yang diajukan pemanggil. Ia tidak menyerahkan nilai di luar distribusi itu. Kode bisa memakai nilai-nilai ini secara langsung, tanpa lebih dulu menggali bidang dari paragraf yang dibangkitkan.

Model obrolan biasanya tidak menyerahkan pekerjaan dengan cara ini. Mereka menyerahkan string. Sebuah string mungkin balasan yang biasa, dan mungkin juga halusinasi. Perangkat lunak tetap harus mengurainya dan memvalidasinya. Jika validasi gagal, program tidak bisa memakainya secara langsung. TypeSafe meletakkan keamanan tipe dan halusinasi bersama-sama, dan memperlakukan keamanan tipe sebagai syarat minimum untuk otomasi. Jika tipenya salah jauh di dalam rantai pemanggilan, cabang berikutnya tersambung ke tempat yang salah. Tulisan resmi juga mengatakan bahwa model yang ada sekarang, secerdas apa pun, tetap berhalusinasi, dan tetap membuat kesalahan tipe.

Tetap di dalam tipe tidak menghentikan penilaian agar tidak salah. Memilih butir yang salah pada pertanyaan tertutup tetap salah. Pada alur peringatan keamanan yang publik, model harus memilih di antara menutupnya, menyerahkannya kepada analis, dan mengendalikannya sekarang. Ketiga opsi ada di tabel. Jika model memilih yang salah, tipenya tetap sah.

Keterangan resmi tidak menyebut System One selalu benar. Mereka menulis bahwa pemikiran System 1 memberi kesan rawan kesalahan. Mereka percaya model System One bisa dibuat lebih andal daripada alternatifnya. Mereka meninggalkan alasan khususnya untuk nanti. Itu arah mereka. Itu bukan "selalu benar".

Choice punya tepi keras yang lain. Begitu opsinya melewati 255, satu tabel tidak bisa menampungnya. Lomba Wikipedia yang menelusuri tautan harus memilih di antara ratusan atau ribuan tautan pada satu langkah. Mereka beralih ke dua tahap: beri skor secara terpisah, lalu buat pilihan. Sesekali ia melambat. Perlambatan itu muncul di demo lomba Wikipedia. Kardinalitas tinggi bukan tidak terbatas. "Tidak berhalusinasi" di sini tetap hanya berarti ia tidak akan menyerahkan tautan yang tidak ada di tabel. Opsi tidak bisa ditambah tanpa batas.

Keyakinan adalah pertanyaan yang terpisah

Kalibrasi adalah perkara yang terpisah. Keterangan resminya adalah bahwa jawaban membawa probabilitas dan keyakinan. Ketika keyakinan lebih tinggi, akurasi lebih tinggi. Masukan yang serupa mengembalikan jawaban yang serupa. Di sisi lain, mereka menulis tentang model obrolan. Bahkan jika Anda meminta satu model melaporkan keyakinan, ia sering terlalu yakin, dan tidak stabil. Jika sebuah tugas bisa dikerjakan dengan benar 95% dari waktunya dan model tidak mengatakan 5% yang mana yang tidak ia yakini, tugas itu tidak bisa diotomatisasi.

Keyakinan pada Choice dan Score bukan kalimat kepastian terpisah yang dilaporkan model. Angka itu dihitung dari bentuk distribusinya. Probabilitas menumpuk pada satu opsi atau satu tingkat, dan angkanya tinggi. Probabilitas tersebar di beberapa tempat, dan angkanya rendah. Pemanggil bertindak ketika angkanya tinggi, dan menyerahkan kasus itu kepada seseorang ketika angkanya rendah. Noul tidak menempelkan keyakinan yang terpisah. Probabilitas ya-atau-tidak itu sendiri adalah sinyalnya. Tabel perbandingan resmi menulis probabilitas dan keyakinan bersama-sama. Diterapkan pada tiga pertanyaan itu, Choice dan Score memiliki keduanya, dan Noul hanya memiliki probabilitas.

Keyakinan 1.0 hanya berarti distribusi tertekan seluruhnya pada satu hasil. Itu menggambarkan bentuk jawaban ini. Ketika distribusi tertekan seluruhnya pada opsi yang salah, keyakinan tetap bisa tinggi. Angka yang besar tidak berarti hasilnya benar.

Kesalahan tipe tidak bisa keluar. Itu tidak mungkin secara matematis. Kalibrasi tidak punya jaminan semacam itu. Yang diberikan keterangan resmi adalah sebuah korespondensi: keyakinan lebih tinggi, akurasi lebih tinggi. Jika korespondensi itu putus, tipenya tetap tidak bisa lolos, dan keyakinan tidak lagi bisa menjadi ambang. Jadi lapisan ini punya mekanisme, dan punya klaim. Apakah kesalahan lebih sedikit ketika angkanya lebih tinggi, dan apakah masukan yang serupa kembali dengan distribusi yang serupa, keduanya harus dilihat secara terpisah. Bidang itu hadir setiap kali hanya berarti pemanggil bisa membaca angkanya.

Yang benar bukan dunia

Benar dan salah harus dipecah sekali lagi. Evaluasi workflow mengukur seberapa dekat sebuah model mendekati sebuah rujukan di dalam alur yang sama. Rujukan itu bukan jawaban objektif dari dunia. Mereka menganggap kode alurnya benar, dan mereka tidak memperdebatkan apakah labelnya benar. Label rujukannya adalah rata-rata GPT-6 Astra dan Claude Fable 5.1. Keduanya memakai high thinking, dan masing-masing menjawab setiap pertanyaan di dalam alur. Model lain dibandingkan pada penalaran default masing-masing vendor.

Jev mendekati rata-rata itu berarti mendekati kesepakatan kedua model itu. Itu tidak bisa ditulis sebagai lebih benar daripada fakta. Jika kesepakatannya condong, jawaban yang menempel pada kesepakatan ikut condong. Tulisan resmi mengatakan bahwa memakai rata-rata kedua model ini sebagai rujukan membuat jawaban condong ke model OpenAI dan Anthropic.

Selama perbandingan, model besar dibungkus di dalam System One LLM adapter, yang memaksa mereka juga mengeluarkan keputusan terstruktur, sehingga mereka bisa dibandingkan di dalam jenis pertanyaan yang sama. Keterangan resmi mengakui bahwa bertanya dengan probabilitas biasanya lebih lambat dan lebih mahal daripada memberi keputusan tanpa probabilitas. Kesimpulan mereka adalah bahwa ini cara paling akurat untuk mengambil keputusan dari model besar. Akurasi itu dibandingkan dengan keputusan yang tidak membawa probabilitas. Itu tidak berarti keputusan itu cocok dengan fakta eksternal.

Angka kesalahan tipe untuk model besar pada grafik berasal dari OpenRouter, dan angka itu bias. Kueri yang lebih rumit mungkin diarahkan ke model yang lebih kuat. 0% milik Jev bukan jenis statistik yang sama. Tulisan resmi mengatakan angka mereka bukan hasil empiris. Pencocokan skema dijamin, jadi grafik bisa diisi 0%. Satu sisi adalah pengamatan setelah perutean. Sisi lain adalah angka yang diisi dari sebuah jaminan. Ini bukan tingkat kesalahan yang sama.

Perbandingan berdampingan dengan GPT-5.6 Terra memakai penalaran default. Keterangan resmi memilih model itu karena, menurut bacaan mereka, kecerdasannya rata-rata paling dekat dengan Jev. Pada jalankan yang terekam, satu-satunya ketidaksepakatan adalah "Churn likelihood level". Pandangan resmi adalah bahwa pertanyaannya ambigu dan jawabannya tidak bisa dikatakan dengan bersih. Pada pertanyaan yang ambigu, distribusi lebih jujur daripada label yang keras.

"Tidak bisa berhalusinasi", pada akhirnya, berarti ia tidak menghasilkan keluaran di luar tipe. Itulah sebabnya mereka menulis kesalahan tipe sebagai 0%. Kalibrasi harus diterima sendiri, dari apakah keyakinan bisa dipakai sebagai ambang. Apakah penilaiannya benar, evaluasi alur ini tidak bisa memberi jawaban milik dunia sendiri. Yang ia sejajari adalah rata-rata Astra dan Fable.

Sumber

Seri