Jev không chat được, vì sao lại hợp với Agent

Agent thường thiếu một phán đoán đi thẳng vào nhánh, không phải thêm một đoạn chữ dài. Bài này nói ba loại câu, đánh giá workflow đang so gì, và vì sao đường nóng không chờ hết một lần chat.

Đồng tác giả: folkbench.com (Folkbench là nền tảng đánh giá có thể kiểm chứng và lựa chọn cho AI API, dịch vụ mô hình và các trang liên quan. Nền tảng dựa trên tài liệu dịch vụ đã công bố, giá, độ sẵn sàng, độ trễ và cửa sổ bằng chứng để giúp so sánh và chọn đường dùng.)

Nhóm này gồm mười bài:

Thứ một Agent thường thiếu không phải thêm một đoạn chữ dài. Là một phán đoán đi thẳng vào luồng điều khiển. Những cái thường gặp là cảnh báo này có giữ đóng không, hóa đơn này có trả không, trace này có cần người không, và câu chăm sóc khách hàng kế tiếp có nên nâng cấp không. Những nút này không để mô hình viết một bài phân tích. Mã cần một giá trị để so và để rẽ nhánh. Jev làm đúng việc đó.

Cách TypeSafe đặt lời nghĩa là một lời gọi hàm của trí tuệ tuyến đầu. State đi vào. Một quyết định xác suất đã có kiểu đi ra. Nó không sinh chuỗi. Câu cho người đọc, và phán đoán cho chương trình, không phải cùng một lối ra.

Chốt đầu ra trước

Đầu ra của các mô hình lớn hiện nay là một chuỗi. Phần mềm cần đi tiếp vẫn phải tách nó, kiểm nó, và chặn nó trôi. Một trường thừa hiện ra. Đoạn văn trông đủ, còn enum thì không ăn. Người ngồi trong hộp chat nhận ra và hỏi lại. Mã không nhận ra, và đi tiếp với lỗi. Lỗi chôn sâu vài lớp gọi, mô hình thông minh hơn cũng không đặt lại được.

Jev chốt không gian đầu ra từ trước. Bạn nói nó được trả về cái gì, và nó chỉ gán xác suất trong không gian đó. Lỗi kiểu không thể xảy ra, về mặt toán. Nó không thể trả lại một hình bạn không định nghĩa. Đó không phải chuyện phán đoán đúng. Xác suất có thể nghiêng sai hướng, và lựa chọn có thể là lựa chọn sai. An toàn kiểu khép cái hình, không khép đúng và sai. Hình đã chốt thì các nhánh phía sau viết được. Bạn không phải móc một giá trị ra khỏi một đoạn văn trước.

Chỉ có ba loại câu hỏi.

Noul là có-không. Mô hình đưa một xác suất từ 0 đến 1. Gần 1 là có. Gần 0 là không. Gần 0.5 là không chắc. Nó không gắn thêm một độ tin cậy riêng. Xác suất chính là tín hiệu. Choice là chọn một. Bạn liệt kê lựa chọn trước, trần là 255. Cái trả về là lựa chọn đã chọn, phân bố trên mọi lựa chọn, và một độ tin cậy. Mã dùng phân bố đó để quyết tự làm hay giao việc cho người. Score là mức. Các mức chạy từ 2 đến 10, và bạn viết mỗi mức nghĩa là gì. Cái trả về là một điểm, phân bố trên các mức, và một độ tin cậy. Điểm có thể rơi giữa hai mức, như một vị trí trên thước.

Câu có-không viết thành một điều kiện. Chọn một và mức thì khác: cái trước nhìn nó rơi vào lựa chọn nào, cái sau lấy điểm làm ngưỡng. Một câu hỏi tốt vẫn phải hẹp. Phán đoán mà người rành việc làm được trong một giây sau khi đọc tài liệu, đó là loại để đưa cho nó. Khách có đang xin hoàn tiền không, là loại câu đó. Đọc hết bức thư rồi mới quyết hành động tốt nhất, thì không phải. Câu thứ hai muốn suy luận chậm. Tách ra, rồi hỏi. Các câu đã tách nhìn cùng một state, độc lập với nhau, và cùng trở về trong một request. Trọng số ở trong mã. Chính sách đổi thì bạn đổi các con số. Bạn không viết lại cả prompt.

Ngã ba mới là chỗ làm người đứng lại

Cái thực sự làm người đứng lại thường là một nút hình này. Một cảnh báo đến cùng các bản ghi máy đã có, và kết luận là đóng, gửi cho nhà phân tích, hoặc cô lập ngay. Một hóa đơn treo trên đơn hàng và biên bản giao, và ai đó phải quyết trả, giữ, hay gửi trả. Một Agent chăm sóc khách hàng đã chạy xong, mọi lời gọi công cụ nằm trong trace, và ai đó phải quyết trace này có được xem không, và xem sớm đến mức nào. Khách viết thêm, và luồng hội thoại cùng state tài khoản đều có đó. Câu kế tiếp nên nối thế nào, và có nên nâng cấp không, là cùng một hình câu hỏi.

Phần quy tắc đóng băng được là mã. Cái giòn là những ngoại lệ không viết hết. Biên lai thì đúng với chứng từ, lý do thì mơ hồ, và một bước trong trace trông kỳ. Logic viết tay vỡ trên những cái này. Bạn nhét cả chính sách vào một prompt và để mô hình nghĩ một lượt, thì bạn viết ít điều kiện hơn. Lối ra lại thành một đoạn chữ. Để chữ đi vào luồng điều khiển, bạn viết thêm một lớp tách. Lớp đó tự nó cũng sai được.

Đánh giá workflow của TypeSafe đo đúng cách nối này. Bài đánh giá tách một tác vụ thành nhiều câu hỏi hẹp. Cái mã quyết được thì mã quyết. Mô hình chỉ trả lời những phán đoán mà mã không chốt được. Bốn luồng công khai là một sự cố bảo mật, khả năng quan sát trace của Agent, xử lý hóa đơn, và chăm sóc khách hàng. Cùng một luồng, mô hình đi trên workflow chính xác hơn là nhét cả chính sách vào một prompt, và tốn ít hơn, mất ít thời gian hơn. Lấy trung bình trên bốn tác vụ, các mô hình được đo đều đi theo hướng đó.

Các hành động sau đó đi theo xác suất, không theo một nhãn đã đóng sập. Kết quả ra khỏi hệ thống vẫn là một hành động rời rạc. Phần kỹ thuật ở giữa phải làm cùng một cách mỗi lần.

Bài đánh giá đo độ gần

Bài đánh giá này không cãi với bạn về chuyện luồng có viết sai không. Nó giả định harness là đúng. Câu trả lời tham chiếu không phải nhãn vàng người đánh tay, từng câu một. GPT-6 Astra và Claude Fable 5.1 trả lời mọi câu dưới high thinking, rồi hai câu trả lời được lấy trung bình. Các mô hình khác dùng suy luận mặc định của nhà cung cấp. Chỉ sau khi luồng đã chốt mới so được. Bài đánh giá so một mô hình gần các phán đoán của hai mô hình lớn đó đến mức nào, cộng tốc độ và chi phí.

Nên biểu đồ không chứng minh Jev hiểu việc hơn Astra. Astra và Fable ở đây là thước. Jev phải đến gần phán đoán của chúng, và còn phải mở một khoảng về độ trễ và chi phí. Nếu câu hỏi tách sai, thước gần hơn cũng không giúp. Tách câu hỏi là việc của người viết luồng.

Jev ngồi rất xa trên tuyến đầu của “nhanh và rẻ”. Những bội số cao hơn trên trang chính thức, khoảng nhanh hơn 193.6 lần và rẻ hơn 444.6 lần, là đầu cao của bài đánh giá này. Bội số đó không phải mọi lần gọi. Những lần gọi ở đây gần hơn với tải tự động hóa mà bạn thực sự đưa lên.

Cái nó đến gần là xác suất trên những câu hỏi hẹp sau khi tách, không phải cách viết một bài phân tích dài. Jev không viết bài phân tích dài đó.

Đường nóng không chờ được

Độ trễ với một Agent là cứng. Người vẫn chờ được ba giây. Một khi lớp bọc lớp, thì không chờ được. Cùng một chuỗi còn có truy xuất, một lần ghi cơ sở dữ liệu, và lần gọi kế tiếp, và mỗi bước tiêu cùng một quỹ thời gian. Trong khoảng 70 đến 500 mili giây, một phán đoán ngồi được trên đường nóng. Ra ngoài khoảng đó, ngăn gọi coi nó là nghẽn.

Nói với người, các mô hình tuyến đầu hiện nay thường mất từ 3 giây đến hơn 300 giây từ đầu đến cuối. Tốc độ đó hợp với một copilot, hoặc một Agent lập trình có người nhìn. Làm điều kiện trên đường nóng, tốc độ đó không hợp. Jev không nhả câu theo từng token. Những xác suất phải trả về thì đến cùng nhau. Tốc độ đến từ đó.

TypeSafe cũng dùng Jev để kiểm. Prompt, vết suy luận, và đầu ra của các mô hình khác, Jev chấm chúng, và nó còn làm hàng rào, tìm jailbreak. Việc sinh vẫn thuộc mô hình chat. Cửa này có qua không do một mô hình không sinh chuỗi quyết. Đó là một khớp trong Agent, không phải chat. Nếu cái gật và lần rà vẫn nằm trên chữ dài, bạn phải tìm chương trình khác để đọc. Jev khép kết quả thành xác suất và mức, và lần rà viết được thành mã.

Câu viết cho người dùng vẫn là việc của mô hình chat. Jev không nhận câu đó. Nó nhận việc chia luồng phía trước, và việc kiểm phía sau. Thứ một Agent thiếu ở đây không phải thêm một lời giải thích dài hơn. Là một phán đoán mà kiểu đã chốt, để mã đi cùng nó.

Nguồn

Nhóm bài