Hai demo tôi đã chạy
Cùng một state của việc chạy qua hai demo: các câu đóng hỏi trong một lượt, rồi một câu rủi ro mà độ tin cậy không lên thì bị dừng. Lần đặt cạnh chính thức với GPT-5.6 Terra chỉ để xem sự không đồng ý rơi vào câu nào.
Đồng tác giả: folkbench.com (Folkbench là nền tảng đánh giá và lựa chọn có thể kiểm chứng cho API AI, dịch vụ mô hình và các trang liên quan. Nền tảng dựa trên thông tin dịch vụ đã công bố, giá, độ sẵn sàng, độ trễ và cửa sổ bằng chứng để giúp người dùng so sánh và chọn một đường đi.)
Nhóm này gồm mười bài:
- JEV - Khớp không cần não
- JEV - Jev không chat được, vì sao lại hợp với Agent
- JEV - “Không thể ảo giác” thực sự tới lớp nào
- JEV - Có-không, chọn một và mức, đủ một ngôn ngữ chưa?
- JEV - Một lab làm được chuyện này. Vì sao vẫn có thể không làm.
- JEV - Hai demo tôi đã chạy
- JEV - Người từ giữa vòng bước ra rìa
- JEV - Qua vạch đó, tôi không còn phân được ai thông minh hơn
- JEV - Có những câu hỏi không thuộc về nó
- JEV - Một mô hình cực giản, một suite, và một cái không nói
Hôm nay tôi chạy hai demo, thử Jev. Không cái nào bảo nó chat. Tôi đưa vào một đoạn state của việc, hỏi các câu đóng, và nhìn cái trả về.
State là một lát của việc, đủ để phán. Tôi không biến nó thành một câu chuyện. Một mô hình chat nhận loại đầu vào này thường bắt đầu bằng một đoạn hiểu, rồi lời khuyên. Tôi không muốn lời khuyên. Tôi muốn xem nó có ở được giữa một luồng như một khớp, nhả số, và để mã đi tiếp không.
Demo thứ nhất
Tôi đưa state đó vào và hỏi các câu đóng trong một lượt. Tôi bấm. Nó về ngay.
Khoảng chính thức là 70 đến 500 mili giây. Tôi không bấm giờ, nên không nói được mình rơi vào chỗ nào trong khoảng. Cái tôi cảm là mình chưa kịp đến chỗ sốt ruột. Với những mô hình viết câu trả lời dài, tôi quen để cửa sổ đó và đi làm việc khác. Lần này tôi chưa kịp để cửa sổ. Kết quả đã ở trên trang trước khi tôi chuyển đi.
Tôi tính tiền riêng. Đầu ra không bị tính phí. Đầu vào là $0.042 mỗi một triệu token. Khi state ngắn, chi phí đầu vào của một lần gọi là thứ tôi phải lên tài khoản tìm mới thấy. Làm một khớp, nó rẻ. Một nút như thế này được đi nhiều lần. Một mô hình lớn còn tính cả đầu ra, tôi bắt đầu tiết từ câu thứ hai. Ở đây, hỏi thêm một câu không mang gánh đó.
Các câu là ba loại ấy.
Với có-không tôi dùng Noul. Tôi hỏi đơn này có nên được nhấc khỏi luồng tự động và đưa cho một người trước không. Nó không trả một chữ “có” hoặc “không” trần. Nó trả xác suất của “có”, giữa 0 và 1. Tôi nhìn nó dính đầu nào. Nếu nó dính một đầu, tôi coi câu đã chốt. Nếu nó lưỡng ở giữa, câu vẫn mở.
Với phân loại tôi dùng Choice, chọn một. Các lựa chọn và nghĩa của từng cái do tôi viết. Tôi không chất chúng về phía 255. Trần chính thức là 255, và câu này không cần. Quá nhiều mục, chính tôi cũng không nhìn hết. Ít mục thì tôi phán được. Trọng lượng chất rõ trên một lựa chọn, các lựa chọn khác rất mỏng: chỉ loại hạng nhất đó tôi mới cho vào một nhánh. Nếu hai hạng đầu cắn sát nhau, tôi sẽ không nhận chỉ vì có một hạng nhất. Một hạng nhất chỉ cao hơn một chút thì chưa tách.
Với rủi ro tôi dùng Score, để xem nó rơi vào mức nào. Thước của Score là 2 đến 10 mức. Tôi cắt câu này trong khoảng đó, từ nhẹ đến nặng. Tôi không bịa một thước khác. Nó trả xác suất của mỗi mức, và một vị trí được các xác suất đó gia trọng. Tôi không dám dùng vị trí đó một mình. Nếu xác suất chất trên một mức, vị trí là mức đó. Nếu xác suất chia trên hai mức kề nhau, vị trí rơi vào giữa. Vị trí trông mịn hơn, và cả hai mức vẫn còn đó. Tôi sẽ không viết loại vị trí đó vào một điều kiện sau.
Nó không viết giải thích. Nhìn xác suất, không nhìn giải thích. Khi tôi dùng mô hình chat cho cùng loại phán đoán, kết luận được bọc trong một đoạn. Tôi phải bóc chữ ra mới dám điền một trường, và tôi sợ nhận sự lịch sự làm một lập trường. Hôm nay không có lớp chữ đó. Bên trong là kiểu và xác suất. Demo này xác nhận với tôi là nó hợp làm một khớp. Tôi không phải đọc hết một bài ngắn trước khi nối mã.
Tôi lấy sự đánh đổi từ phân bố, không từ một cảm giác của lúc đó. Một câu có-không dính một mép, tôi cho qua tự động. Trọng lượng hạng mục chất trên một mục, tôi để mã nối. Phân bố của câu rủi ro không tụ, và tôi không đóng băng nó trong demo này. Tôi để nó cho cái kế tiếp.
Cái thứ hai tách cùng một việc
Demo thứ hai dùng cùng state. Tôi không đi tìm một cái mới. Tôi tách các câu, để kiểm câu rằng một người không phải đứng giữa mọi vòng.
Độ tin cậy cao, tôi sẵn sàng giao cho mã. Độ tin cậy thấp, tôi giữ lại để nhìn. Sau khi thử, tôi chịu buông những cái cao. Có-không dính một mép, và hạng mục chất về một phía, tôi để chương trình tự đi. Những cái cao đi thẳng vào một nhánh. Quy tắc viết trong mã. Độ tin cậy đủ, chương trình đi tiếp. Độ tin cậy không đủ, chương trình dừng trước mặt tôi. Khi tôi đọc nhật ký, những vòng cao đó đã không chờ cái gật của tôi. Tôi không xác nhận từng cái một.
Cái thấp là câu rủi ro. Tôi chưa hỏi đủ chặt, và state cũng thiếu tài liệu tách được hai mức kề nhau. Phân bố thì tản, và độ tin cậy không lên. Trong lúc nhìn, tôi thực sự muốn chọn một mức cho nó, để cả luồng đi hết. Ý đó không theo được. Một khi nó đã tản, tôi không muốn khép hộ nó. Nếu tôi tùy tiện chọn một mức và viết vào, các bước sau sẽ coi mức đó là sự thật. Đó là tôi cung cấp một quyết định nó không làm, và trang điểm thành một câu trả lời đã xong.
Nên câu dừng. Nó ở lại để tôi nhìn, và nó không vào một nhánh tự động. Tôi không chạy lại để thử vận. Tài liệu vẫn vậy, và phân bố rất có thể vẫn tản. Câu này không nên bị ép. Sau này tôi có thể làm state dày hơn, hoặc viết các mức thành những cách nói thực sự đứng tách. Nếu tôi ép một mức ra khỏi nó bây giờ, cái trả về là một trung bình. Nếu tôi đặt số đó vào một nhánh, phần theo sau sẽ coi nó là một rủi ro đã quyết.
Tôi không viết “tôi cảm thấy nó nghiêm hơn” bên cạnh. Cảm giác của tôi không đè được một phân bố tản rồi được gửi đi chạy tự động. Nếu phân bố thực sự nghiêng, trọng lượng sẽ tự chất về một phía. Nếu nó không chất qua được, tôi không có tư cách chất hộ. Tôi dừng demo thứ hai ở đó.
Lần đặt cạnh chính thức
Chỉ sau hai demo tôi mới mở ví dụ đặt cạnh trong playground chính thức. Một bên là Jev. Bên kia là GPT-5.6 Terra. Terra dùng suy luận mặc định. Tôi không ở đó để phán ai thông minh hơn. Tôi chỉ nhìn sự không đồng ý rơi vào câu nào.
Tôi đối từng câu. Chỉ “Churn likelihood level” khác nhau ở hai bên. Các câu khác thẳng hàng. Bản thân câu thì mơ hồ. Mức rời bỏ có thể cao đến đâu thì không dễ khép thành một mức gọn. Khi nó mơ hồ, cái nó đưa là một phân bố. Bên kia, để làm xong một câu trả lời, phải nhả một chữ. Tôi không ghi sự không đồng ý thành thắng hay thua. Đưa một phân bố trung thực hơn là ép ra một chữ. Chữ đó ngồi được trong một câu người nói. Nó không thuộc về một nhánh sẽ tự thực thi.
Tôi nhìn lại câu rủi ro thấp của mình. Câu của tôi và lần đặt cạnh này cùng loại. Không có mô hình thứ hai bên cạnh, và tôi vẫn không nên bóp một xác suất tản thành một mức.
Không chat được, lúc đầu tôi coi là một khiếm khuyết. Dùng xong, tôi không thấy vậy. Trong phần trả về không có lời mở. Tôi không phải xóa một lời mở. Khi trước tôi móc một phán đoán ra khỏi giao diện chat, tôi phải nhảy qua lời khách sáo trước, và còn phải phòng nó đổi ý sau. Hôm nay không có chữ để dọn. Với tôi đó là một sự nhẹ. Ít đi một việc dễ làm sai.
Cái tôi chạy hôm nay là hai demo này. Lần đặt cạnh trong playground, tôi chỉ mở và nhìn. Nó không tính là cái thứ ba tôi làm. Cái thứ nhất chốt, với tôi, rằng nó ngồi được trên một khớp, và độ tin cậy cao giao được cho mã. Ở cái thứ hai, tôi dừng câu mà phân bố tản, và tôi không trang điểm nó thành đã trả lời. Nó nhanh, và với giá này tôi cũng thấy các lần gọi lặp thì rẻ. Cái trả về không phải một bài. Là một phân bố.
Nguồn
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://console.typesafe.ai/playground?share=shr_13a74b495fb786c4bd7964f11597301e7c9