Một mô hình cực giản, một suite, và một cái không nói

DeepSeek, Kimi và Jev không phải hạng trên một bảng tổng. Một cái để chất thông lượng, một cái là mặt trước đã dựng sẵn, còn Jev ngồi trong luồng, nhả một xác suất, và không nói.

Đồng tác giả: folkbench.com (Folkbench là nền tảng đánh giá và lựa chọn có thể kiểm chứng cho API AI, dịch vụ mô hình và các trang liên quan. Nền tảng dựa trên thông tin dịch vụ đã công bố, giá, độ sẵn sàng, độ trễ và cửa sổ bằng chứng để giúp người dùng so sánh và chọn một đường đi.)

Nhóm này gồm mười bài:

Nhóm lớp lại đang chuyền bảng. Có người ném điểm của DeepSeek. Có người ném điểm của Kimi. Phía dưới, có người kéo Jev vào và hỏi trong ba cái này cái nào mạnh hơn. Tôi nhìn một cái rồi thoát. Tôi không trả lời. Cái nhóm muốn là một cái tên, và tôi không có loại tên đó trong tay. Ba cái này không phải hạng trên cùng một bảng. Ép xếp hạng, thì ồn ào ở lại trong nhóm. Nó chẳng liên quan mấy đến cách tôi làm việc tuần này.

Bây giờ tôi dùng chúng theo chỗ đứng, không theo một bảng tổng. Thành công tôi nhận thì hẹp thế này: một mô hình dẫn ở chỗ đứng của nó, và nó không phải đứng đầu mọi thứ. Qua vạch từ Opus 4.5 đến 4.6, thói đó đã chốt. Tôi nghĩ 90% người dùng không còn nêu được một việc nằm ngoài mô hình. Nâng trí tuệ tổng quát thêm một bậc, những ngày của tôi hầu như không nhúc nhích. So trí tuệ tổng quát lần nữa, tôi không cảm được. Có nói hay không, cái đó tôi chọn mỗi ngày. Giao diện cũng ảnh hưởng tôi có dùng tiếp được không. Giá thì trực tiếp hơn. Nó phải rẻ đến mức tôi dám viết vào một vòng lặp, tôi mới đặt mô hình vào mã.

Những cái biết nói, tôi dùng riêng

DeepSeek, với tôi, là đường bị đẩy đến cực giản. Kỹ thuật làm đến nơi nó đi được, tốc độ kéo đầy, giá cắt một nửa. Tôi mở nó, và trên trang không có nhiều thứ để lang thang, cũng không có bàn làm của một ngành đang chờ. DeepSeek đặt sức vào chạy nhanh và cắt giá. Tôi dám chạy cùng một việc thêm vài vòng. Chuyển sang cái đắt hơn, tôi bắt đầu tính có nên tiết không. Việc theo lô qua đêm, tôi cũng ném cho nó. Người đã ngủ, các lần gọi vẫn chạy, và với một mô hình đắt tôi thấy không yên.

Tôi dùng nó cho việc muốn thông lượng. Tôi đẩy một lô nhật ký qua để quét, và tôi ép các bản nháp giao diện qua lại, nhiều vòng cùng loại câu hỏi. Tôi nhìn hai thứ: đừng đứng, và đừng thành đắt. Con trỏ quay quá lâu, hoặc một vòng bắt đầu đau về tiền, thì đường ống tự đứt. Nó cũng viết được câu. Tôi thường sửa qua rồi dùng. Tôi hiếm khi dừng để nếm. Tôi cũng không nói khẩu vị với nó trên việc này. Khẩu vị phải mài từng chữ. Nó không được định giá theo cách này để một người mài câu.

Tôi đặt Kimi ở phía kia. Không phải để chứng minh ai thông minh hơn. Năng lực mặt trước được kéo đầy. Một tài liệu dài đi vào, một mục lục hiện ra, các trích dẫn vẫn còn, và nguồn mở ra để đọc đối. Nếu tôi tự lắp, một buổi chiều sẽ mất. Nó cũng xây các suite riêng cho tài chính và luật. Các nguồn dữ liệu được nối ở trong, các kỹ năng cần dùng nằm sẵn đó, và có một mặt sẵn khi việc được giao. Quy định và báo cáo tài chính, tôi lật trên mặt đó. Tôi không mở một đống trang khác. Khi tài chính hoặc luật được trải thành tài liệu dài, tôi không muốn tự dựng môi trường trước. Cái tôi muốn là ngồi xuống và lật, không phải mất nửa thời gian làm mặt trước của chính mình. Tôi mở nó khi cần đọc tài liệu dài, và khi cần một bàn làm đã có sẵn.

Cái tôi nhận sau khi dùng là một việc. Đây là một sản phẩm. Không phải một mô hình thông minh hơn nên mọc thêm một website bên cạnh. Dữ liệu nối từ nhà nào, và khoản nào của một quy định được lật tới, không tự mọc vì một mô hình thông minh hơn. Một báo cáo trông thế nào khi được giao, ai đó phải làm luồng thành một giao diện trước. Khi lời nói nhanh và rẻ, tôi chất các lần gọi, và cái tôi dùng là DeepSeek. Khi tôi thực sự cần đọc tài liệu và giao việc, tôi mở mặt trước của Kimi. Cả hai đều nói được. Tôi không thay cái này bằng cái kia.

Cái không nói, tôi đặt trong luồng

Tôi không đem Jev đi chat. State đi vào, các câu hỏi đóng được hỏi, và cái trả về là xác suất. Chọn mục nào, hoặc rơi vào mức nào, kể cả một cái có hoặc không trần, kiểu phải được viết kín từ trước. Nếu câu hỏi chưa được đóng, tôi sẽ không gọi nó. Đầu ra miễn phí. Đầu vào là $0.042 mỗi một triệu token. Tốc độ là loại nhanh, 70 đến 500 mili giây. Với giá này tôi dám hỏi đi hỏi lại trong một luồng, không tính nhẩm hóa đơn ở mỗi câu. Tôi coi nó là một lần gọi trong luồng. Tôi hỏi, rồi tôi đi.

Đặt trong luồng của tôi như một khớp. Mã dọn state trước, rồi ném một câu hỏi đóng sang. Xác suất về, và nhánh được chương trình phía sau đi. Với tôi nó lo phân loại và định tuyến, nó lo các mức, và nó lo bước này có nên gọi một người đến không. Sau phân loại tôi hỏi tiếp nó rơi vào mức nào, và sau khi mức ra tôi hỏi có gọi người không. Toàn câu hỏi đóng, toàn cùng loại gọi. Lý do và giải thích viết cho người khác đọc không phải việc của nó. Chữ thực sự phải được người thấy, tôi nối một mô hình biết nói. Nếu loại phán đoán này được giao cho một mô hình biết chat, nó thường về thành cả một đoạn, có thái độ và có lời khuyên. Rồi tôi phải viết thêm một lớp, và móc đoạn thành một nhánh. Thêm một lớp trên khớp, tôi không thấy đáng.

Tôi chỉ mở bài đánh giá một lần. Trong workflow, các phán đoán của nó được so với Astra và Fable 5.1. Cái được so là độ gần, và chi phí, không phải thắng thua ở chat. Đó là một hệ tọa độ khác. Hiểu được điều đó, tôi đóng trang.

Một lần phát hành nên nói nó dành cho ai

Làn sóng GPT-6 khiến computer use thành thứ người ta nhận ra lần nữa. Mô hình tự đi bấm màn hình, mở phần mềm, và làm xong một việc trên màn hình máy. Người ta đã làm chuyện này từ trước. Sau khi Astra ra, việc thao tác máy tính lại thành thứ người ta chỉ được, không còn chỉ là phần thêm ngoài hộp chat. Đặt cạnh ba cái này, điều đó càng chốt. Khoảnh khắc một mô hình được phát hành, những người phát hành phải nói rõ nó dành cho ai.

Người sẵn sàng giao cả máy thì dùng được computer use. Một nhóm khác ngồi trước hộp chat và muốn lời nói được nói hết. DeepSeek và Kimi đều nói, nhưng một cái để chất thông lượng và một cái để làm một mặt trước đã dựng sẵn, và đó đã không phải cùng một cách dùng. Jev không ở phía nói. Mã là của tôi. Nó chỉ chịu trách nhiệm nhả một xác suất, để chương trình phía sau đi. Nếu tôi làm một trang chat cho nó, tôi sẽ dùng sai. Khoảnh khắc có hộp chat, tôi muốn nó viết lý do ra.

Tôi sẽ không viết một bài tên là “ai mạnh nhất năm 2026”. Câu đó không giúp năm nay. Hai cái trong hộp chat, và cái không nói này, tôi đã tách trong cách dùng từ lâu. Tôi cũng không chuẩn bị viết loại bài đó.

Tôi lấy chúng như thế này. Việc muốn thông lượng, tôi giao cho DeepSeek. Tôi không tiêu mình vào một cuộc giằng về văn phong, và tôi không muốn chuyển lên một cái đắt. Tài liệu dài, nếu còn kèm một bàn làm đã dựng sẵn, tôi mở Kimi. Khi mã đến bước phải đưa ra một phán đoán — phân loại và định tuyến, một mức, và có gọi người không — tôi đặt Jev ở đó, và tôi bảo nó đừng mở miệng. Bảng tổng muốn cập nhật thì cập nhật. Tôi lấy chúng theo chỗ đứng. Hạng, tôi không nhìn nữa.

Nguồn

Nhóm bài