Có-không, chọn một và mức, đủ một ngôn ngữ chưa?

Noul, Choice và Score là một ngôn ngữ cho mã. Bài này dùng một phiếu chi để chỉ ba loại câu tách thế nào, và khi nào ngôn ngữ này không đủ.

Đồng tác giả: folkbench.com (Folkbench là nền tảng đánh giá và lựa chọn có thể kiểm chứng cho API AI, dịch vụ mô hình và các trang liên quan. Nền tảng dựa trên thông tin dịch vụ đã công bố, giá, độ sẵn sàng, độ trễ và cửa sổ bằng chứng để giúp người dùng so sánh và chọn một đường đi.)

Nhóm này gồm mười bài:

Ngôn ngữ này đủ hay không tùy bạn muốn nó nói gì. Ba câu hỏi đóng đổi lấy tốc độ, và đổi lấy khả năng ghép. Cái giá là những gì cần trải ra, nó không nói được. Đây là một ngôn ngữ cho mã. Không phải để người đọc.

Tài liệu và trang đánh giá chia cùng một cách: Noul, Choice và Score. Trên trang không có loại thứ tư.

Ba loại trong tài liệu

Noul chỉ hỏi có hay không. Nó trả một xác suất. Trong tài liệu số đó chạy từ 0 đến 1. Gần 1, đó là một cái có chắc. Gần 0, đó là một cái không chắc. Nếu nó dừng gần 0.5, điều đó chỉ nghĩa là hai phía khả năng ngang nhau. Không nghĩa là “một mức vừa”. Tài liệu gọi tên cái bẫy này: hỏi một người có giỏi Python không, và 0.5 không phải mức vừa. Nếu bạn thực sự muốn đo mức, chuyển sang Score và viết mỗi mức trông thế nào. Noul cũng không gắn độ tin cậy riêng. Xác suất chính là tín hiệu.

Choice chọn một mục từ một tập đã chốt. Cái trả về là mục đã chọn, cộng cả phân bố và một độ tin cậy. Độ tin cậy nhìn phân bố có nhọn không. Nếu xác suất tản ra, độ tin cậy thấp, và mã biết câu này không vững. Trần cardinality của câu này với Jev là 255. Trên mức đó, Jev đi hai đoạn. Hai đoạn nghĩa là chấm độc lập trước, rồi mới chọn rõ. Đôi khi chậm hơn một chút. Sự chậm là bước thêm, không phải cùng một câu hẹp đột ngột thành đắt.

Score là các mức trên một thước. Khi dùng, đó là một thước có thứ tự từ 2 đến 10 mức. Tài liệu nói ít nhất hai mức, và giao diện nhận nhiều nhất mười. Một mức phải viết thành một tình huống đối được. Chỉ viết “hơi cao” hoặc “cũng được”, thì mô hình không có gì để đối. Điểm có thể rơi giữa hai mức. Số đó là tổng vị trí của mỗi mức nhân với xác suất của nó. Một số thập phân giữa hai mức là bình thường. Không phải phép tính hỏng. Nó trả điểm, và cùng lúc phân bố trên các mức cùng một độ tin cậy. Cùng một điểm có thể là mọi thứ ép lên mức giữa, hoặc một lần chia giữa hai đầu. Chỉ nhìn điểm, bạn sẽ coi chúng là cùng một việc. Hãy đọc phân bố và độ tin cậy cùng nhau.

Không câu trả lời nào trong ba loại ra khỏi các ô bạn đã đưa từ trước. Các câu hỏi trên cùng một tài liệu độc lập với nhau. Thêm một câu hoặc bớt một câu, các câu khác không đổi. Nếu một phán đoán phụ thuộc nhiều việc cùng lúc, hãy hỏi riêng và để trọng số trong mã. Sau này, khi bạn chỉnh chính sách, bạn đổi các số này. Bạn không viết lại cả một prompt.

Một phiếu chi, bị tách ra

Trang đánh giá chính thức lấy một phiếu chi làm đồ chơi. Bên trái là một đoạn người viết, loại chính sách một đội sẽ ghi lại. Mỗi phiếu phải kèm biên lai. Nếu biên lai không đọc được, hãy xin nhân viên một tờ khác. Rồi xem khoản chi là bữa ăn, đi lại, hay thiết bị. Nếu một bữa ăn quá $75 và mô tả không đúng với biên lai, quản lý phải ký. Các phiếu còn lại được coi là đã duyệt.

Bên phải, cùng đoạn ấy được tách thành một luồng. Mỗi câu chính sách là một câu hỏi, hoặc một quy tắc mã. Biên lai đọc được không là một câu có-không. Nếu không đọc được, mã xin một tờ mới, và bước đó không hỏi mô hình lần nữa. Hạng mục dùng chọn một, và các lựa chọn là bữa ăn, đi lại, hoặc thiết bị. Số tiền có quá $75 không, mã tự so. Chỉ nửa câu về mô tả không đúng với biên lai mới cần hỏi mô hình thêm một lần. Cùng với số tiền, điều đó quyết quản lý có ký không. Những phiếu không cần chữ ký của quản lý, mã coi là đã duyệt. Mô hình không viết lời phê ở đây.

Hướng trên trang đánh giá là một câu: cấu trúc luôn tốt hơn một prompt lớn. Lấy trung bình trên bốn luồng ví dụ, mọi mô hình trên workflow có độ chính xác cao hơn cả chính sách như một prompt, và tiền cùng thời gian thì thấp hơn. Phía prompt giao cả chính sách và để mô hình đi hết logic trong một câu trả lời. Phía workflow đưa cho mã mọi thứ viết thành quy tắc được, và chỉ để các phán đoán hẹp làm câu hỏi.

Luồng thật vững nhất thường không phải một câu hỏi lớn. Là nhiều câu hỏi hẹp, độc lập với nhau. Hành vi phụ thuộc xác suất, không chỉ một nhãn rời rạc. Hạng mục có thể trông đã chốt trong khi các lựa chọn khác vẫn giữ một phần xác suất. Mã đi thêm một bước ở ngưỡng bạn đã viết, mà không vứt phân bố. Ra ngoài luồng, vẫn là một nhánh. Lớp ở giữa là kỹ thuật miền. Câu nào lần này không dùng, và số nào tính là qua vạch, phải ghi lại cho việc này, và chạy cùng một cách mỗi lần. Khi câu trả lời của các câu hỏi hẹp đã ở trong mã, trọng số và ngưỡng được đặt ở lớp này.

Sau khi bỏ việc sinh chuỗi

Jev bỏ việc sinh chuỗi và đổi lấy lấy mẫu song song. Các câu hỏi trong một request được tính cùng nhau. Mọi đầu ra ra một lúc. Không theo từng token. Một mô hình chat phải mọc token này sau token kia, mỗi token nhìn token trước. Ở đây không có bước từng chữ. Thêm vài câu hỏi hẹp bình thường, thời gian hầu như không tăng theo. Phần tốn thêm chủ yếu là token của chính câu hỏi.

Giá chính thức không phải giá của giao diện chat. Đầu vào là $0.042 mỗi một triệu token. Đầu ra là FREE. Không có một dải chữ sinh ra tính theo token, thì đầu ra không bị tính phí. Độ trễ rơi vào 70–500 mili giây. Khoảng đó dành cho một chuỗi gọi, không phải cho việc chờ trong hộp chat.

Giá trị trả về đi thẳng vào mã. Xác suất của Noul vào được một if. Định tuyến dùng nhãn của Choice. Một ngưỡng chấm điểm dùng vị trí của Score. Không tách trước. Nếu một mô hình chat trả về một đoạn Markdown, bạn phải tách chữ trước, và một câu thừa có thể làm lệch định dạng đến mức phần còn lại không nối được. Ba loại câu không trả đoạn chữ đó, vì Jev không sinh nó.

Giải thích vì sao phiếu này bị từ chối thì không vừa ba loại câu, và một lời xin lỗi cùng một cuộc thương lượng cũng vậy. Một lý do viết cho người đọc cũng không nằm trong giá trị trả về. Những cái đó giao cho một mô hình biết nói. Jev dừng ở phán đoán.

Khi nó không đủ, các trường hợp thì cụ thể. Nếu các lựa chọn là tên trong một thế giới mở, tên công ty và tên sản phẩm cứ hiện ra, và tập không chốt trước được. 255 là một trần cardinality, không phải một danh sách vô hạn. Khi một lý do phải trích một câu từ nguồn, không có câu đó để giao. Khi người dùng đang chờ một câu của người, giao diện muốn chữ đọc được. Lúc đó ép Jev là coi một khớp như một cái miệng.

Khi chính sách khép được thành có-không, chọn một, và mức, cái theo sau là một nhánh, và phán đoán được lắp lại vào cùng một đoạn mã. Nếu cái bạn muốn là tốc độ, và loại khả năng ghép này, thì đủ. Cái cần trải ra, nó không nói được. Tốc độ và khả năng ghép là thứ cuộc đổi ấy mua được.

Nguồn

Nhóm bài