“Không thể ảo giác” thực sự tới lớp nào
TypeSafe nói Jev không thể ảo giác. Câu đó chỉ đứng ở kiểu: câu trả lời không ra khỏi bảng đã cho trước. Hiệu chuẩn và đúng sai phải tách, và đánh giá workflow thẳng hàng với trung bình của Astra và Fable.
Đồng tác giả: folkbench.com (Folkbench là nền tảng đánh giá có thể kiểm chứng và lựa chọn cho AI API, dịch vụ mô hình và các trang liên quan. Nền tảng dựa trên tài liệu dịch vụ đã công bố, giá, độ sẵn sàng, độ trễ và cửa sổ bằng chứng để giúp so sánh và chọn đường dùng.)
Nhóm này gồm mười bài:
- JEV - Khớp không cần não
- JEV - Jev không chat được, vì sao lại hợp với Agent
- JEV - “Không thể ảo giác” thực sự tới lớp nào
- JEV - Có-không, chọn một và mức, đủ một ngôn ngữ chưa?
- JEV - Một lab làm được chuyện này. Vì sao vẫn có thể không làm.
- JEV - Hai demo tôi đã chạy
- JEV - Người từ giữa vòng bước ra rìa
- JEV - Qua vạch đó, tôi không còn phân được ai thông minh hơn
- JEV - Có những câu hỏi không thuộc về nó
- JEV - Một mô hình cực giản, một suite, và một cái không nói
TypeSafe nói Jev “không thể ảo giác”. Câu đó nghe như ảo giác bị cấm một lần là xong. Cùng bài ấy thu hẹp lại. Điều họ viết là việc đúng với schema là một bảo đảm, không phải một thống kê, nên lỗi kiểu viết được thành 0%. Một phản ví dụ là đủ để bác lời đó. Họ nói điều đó không thể về mặt toán.
Lớp duy nhất câu đó đứng được là kiểu. Jev bỏ việc sinh chuỗi. Nó trả một cấu trúc đã chốt từ trước, không phải một đoạn chữ sinh tại chỗ. Xác suất có chính xác không, và phán đoán có đúng không, là hai chuyện khác. Nếu người đọc không tách chúng, “nó không viết văn xuôi” sẽ bị nghe thành “câu trả lời là đúng”.
Nó không ra khỏi bảng
Chỉ có ba loại câu hỏi, và tất cả đều bị niêm. Noul hỏi một việc có đứng không, và cái trả về là một xác suất từ 0 đến 1. Các lựa chọn của Choice phải do bên gọi viết từ trước, nhiều nhất 255 trên một bảng. Cái trả về là lựa chọn đã chọn, kèm xác suất trên mỗi lựa chọn và một độ tin cậy. Các mức của Score cũng phải viết từ trước, ít nhất hai và nhiều nhất mười. Điểm có thể rơi giữa hai mức. Câu trả lời mang xác suất của mỗi mức và một độ tin cậy cùng lúc. Điểm đó vẫn là một vị trí trên thước, không phải một đoạn văn mới.
Nó không ra khỏi bảng lựa chọn. Mô hình cũng không thể đột ngột viết một đoạn văn xuôi rồi nói cho câu trả lời tròn. Tài liệu nói thẳng. Cái mô hình trả về là một phân bố trên các lựa chọn hoặc mức mà bên gọi đã nộp. Nó không trả một giá trị ngoài phân bố đó. Mã dùng các giá trị này trực tiếp, không phải đào trường ra khỏi một đoạn đã sinh trước.
Mô hình chat thường không nộp bài theo cách này. Chúng nộp chuỗi. Một chuỗi có thể là câu trả lời bình thường, và cũng có thể là một ảo giác. Phần mềm vẫn phải tách và kiểm. Kiểm không qua thì chương trình không dùng trực tiếp được. TypeSafe đặt an toàn kiểu và ảo giác cạnh nhau, và coi an toàn kiểu là điều kiện tối thiểu cho tự động hóa. Nếu kiểu sai sâu trong một chuỗi gọi, các nhánh sau nối vào chỗ sai. Bài viết chính thức còn nói các mô hình hiện nay, thông minh đến đâu, vẫn ảo giác, và vẫn mắc lỗi kiểu.
Ở trong kiểu không ngăn phán đoán sai. Chọn sai mục trên một câu hỏi đóng vẫn là sai. Trên luồng cảnh báo bảo mật công khai, mô hình phải chọn giữa đóng, giao cho nhà phân tích, và khống chế ngay. Cả ba lựa chọn đều trên bảng. Nếu mô hình chọn sai, kiểu vẫn hợp lệ.
Lời chính thức không gọi System One là luôn đúng. Họ viết rằng suy nghĩ System 1 gây ấn tượng dễ sai. Họ tin các mô hình System One có thể làm đáng tin hơn các phương án thay thế. Họ để các lý do cụ thể lại sau. Đó là hướng của họ. Không phải “luôn đúng”.
Choice còn một cạnh cứng. Một khi lựa chọn quá 255, một bảng không chứa hết. Một cuộc đua Wikipedia đi theo liên kết phải chọn giữa hàng trăm hoặc hàng nghìn liên kết ở một bước. Họ chuyển sang hai đoạn: chấm độc lập, rồi mới chọn. Thỉnh thoảng nó chậm lại. Sự chậm đó hiện trong demo cuộc đua Wikipedia. Cardinality cao không phải vô hạn. “Không ảo giác” ở đây vẫn chỉ nghĩa là nó sẽ không trả một liên kết không có trên bảng. Lựa chọn không thêm được không giới hạn.
Độ tin cậy là một câu hỏi riêng
Hiệu chuẩn là chuyện riêng. Lời chính thức là câu trả lời mang xác suất và độ tin cậy. Khi độ tin cậy cao hơn, độ chính xác cao hơn. Các đầu vào giống nhau trả về các câu trả lời giống nhau. Ở phía kia, họ viết về mô hình chat. Dù bạn nhắc một mô hình báo độ tin cậy, nó thường quá tự tin, và không ổn. Nếu một tác vụ làm đúng được 95% số lần mà mô hình không nói 5% nào nó không chắc, tác vụ đó không tự động hóa được.
Độ tin cậy trên Choice và Score không phải một câu chắc chắn riêng mà mô hình báo. Con số được tính từ hình của phân bố. Xác suất chất trên một lựa chọn hoặc một mức, thì số cao. Xác suất tản ra nhiều chỗ, thì số thấp. Bên gọi tự làm khi số cao, và giao việc cho người khi số thấp. Noul không gắn độ tin cậy riêng. Xác suất có-hay-không chính là tín hiệu. Bảng so sánh chính thức viết xác suất và độ tin cậy cùng nhau. Áp vào ba loại câu, Choice và Score có cả hai, còn Noul chỉ có xác suất.
Độ tin cậy 1.0 chỉ nghĩa là phân bố bị ép hết lên một kết quả. Nó mô tả hình của câu trả lời này. Khi phân bố bị ép hết lên lựa chọn sai, độ tin cậy vẫn có thể cao. Một số lớn không nghĩa là kết quả đúng.
Lỗi kiểu không ra được. Điều đó không thể về mặt toán. Hiệu chuẩn không có bảo đảm loại đó. Lời chính thức đưa một sự tương ứng: độ tin cậy cao hơn, độ chính xác cao hơn. Nếu sự tương ứng đó đứt, kiểu vẫn không thoát được, và độ tin cậy không còn làm ngưỡng được. Nên lớp này có một cơ chế, và có một lời khẳng định. Lỗi có ít hơn khi số cao hơn không, và các đầu vào giống nhau có trả về các phân bố giống nhau không, cả hai đều phải xem riêng. Trường có mặt mỗi lần chỉ nghĩa là bên gọi đọc được con số.
Đúng không phải là thế giới
Đúng và sai phải tách thêm một lần. Đánh giá workflow đo một mô hình gần một tham chiếu đến mức nào trong cùng một luồng. Tham chiếu đó không phải câu trả lời khách quan của thế giới. Họ giả định mã của luồng là đúng, và họ không tranh về nhãn có đúng không. Nhãn tham chiếu là trung bình của GPT-6 Astra và Claude Fable 5.1. Cả hai dùng high thinking, và mỗi bên trả lời mọi câu trong luồng. Các mô hình khác được so ở suy luận mặc định của từng nhà cung cấp.
Jev đến gần trung bình đó nghĩa là đến gần sự đồng thuận của hai mô hình ấy. Không viết thành thật hơn sự thật được. Nếu sự đồng thuận nghiêng, một câu trả lời dính vào sự đồng thuận cũng nghiêng. Bài viết chính thức nói rằng lấy trung bình của hai bên này làm tham chiếu sẽ làm câu trả lời lệch về mô hình của OpenAI và của Anthropic.
Trong lúc so, các mô hình lớn được bọc trong System One LLM adapter, thứ buộc chúng cũng nhả các quyết định có cấu trúc, để so được trong cùng các loại câu hỏi. Lời chính thức nhận rằng hỏi kèm xác suất thường chậm hơn và đắt hơn là đưa một quyết định không kèm xác suất. Kết luận của họ là đây là cách lấy một quyết định từ mô hình lớn chính xác nhất. Độ chính xác đó được so với một quyết định không mang xác suất. Nó không nghĩa là quyết định trúng một sự thật bên ngoài.
Các số lỗi kiểu của mô hình lớn trên biểu đồ đến từ OpenRouter, và chúng bị lệch. Các truy vấn phức tạp hơn có thể được định tuyến tới một mô hình mạnh hơn. Số 0% của Jev không phải cùng loại thống kê. Bài viết chính thức nói số của họ không phải kết quả thực nghiệm. Việc đúng với schema được bảo đảm, nên biểu đồ điền được 0%. Một bên là quan sát sau khi định tuyến. Bên kia là một số điền từ một bảo đảm. Đây không phải cùng một tỷ lệ lỗi.
Lần đặt cạnh GPT-5.6 Terra dùng suy luận mặc định. Lời chính thức chọn mô hình đó vì, theo cách họ đọc, trí tuệ của nó trung bình gần Jev nhất. Trong lần chạy đã ghi, chỗ không đồng ý duy nhất là “Churn likelihood level”. Quan điểm chính thức là câu hỏi mơ hồ và câu trả lời không nói gọn được. Trên một câu hỏi mơ hồ, một phân bố trung thực hơn một nhãn cứng.
“Không thể ảo giác”, rốt cuộc, nghĩa là nó không sinh đầu ra ngoài kiểu. Vì thế họ viết lỗi kiểu thành 0%. Hiệu chuẩn phải được nhận riêng, bằng chuyện độ tin cậy có dùng làm ngưỡng được không. Phán đoán có đúng không, bài đánh giá luồng này không đưa được câu trả lời của chính thế giới. Cái nó thẳng hàng là trung bình của Astra và Fable.
Nguồn
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://github.com/typesafe-ai/system-one-adapter-python
- https://docs.typesafe.ai/primitives/choice
- https://docs.typesafe.ai/primitives/score
- https://docs.typesafe.ai/confidence