Grok 4.6 ra mắt: API, giá, ngữ cảnh 500K và hướng dẫn

Hướng dẫn Grok 4.6 đã kiểm chứng gồm ID chính xác, ngữ cảnh 500K, giá token, mức suy luận, ví dụ API, benchmark khi ra mắt và danh sách chuyển đổi production.

xAI phát hành Grok 4.6 ngày 12 tháng 8 năm 2026. Hướng dẫn developer chính thức ghi ID mô hình API grok-4.6, cửa sổ ngữ cảnh 500.000 token, đầu vào văn bản và hình ảnh, đầu ra văn bản cùng bốn mức suy luận: low, medium, high (mặc định) và xhigh.

Với developer, thông tin quan trọng không chỉ là benchmark lúc ra mắt. Grok 4.6 hoạt động với Responses API và Chat Completions, chuyển sang mức giá ngữ cảnh dài khi prompt đạt 200.000 token, và cần chủ động quản lý liên kết cache cùng ngữ cảnh cho agent chạy dài.

Hướng dẫn này tách biệt thông số chính thức của xAI, kết quả benchmark do nhà cung cấp công bố và tình trạng khả dụng hiện tại trên Modelflare. Giá và khả năng cung cấp có thể thay đổi; mọi dữ liệu biến động dưới đây được kiểm tra ngày 13 tháng 8 năm 2026.

Tổng quan Grok 4.6

Thuộc tính Giá trị chính thức
Ngày phát hành 12 tháng 8 năm 2026
ID mô hình API grok-4.6
Cửa sổ ngữ cảnh 500.000 token
Mốc kiến thức 1 tháng 2 năm 2026
Phương thức Đầu vào văn bản và hình ảnh; đầu ra văn bản
Giới hạn đầu ra văn bản xAI ghi không có giới hạn cố định
Mức suy luận low, medium, high (mặc định), xhigh
Định dạng API Responses API và Chat Completions
Khả năng được ghi trong tài liệu Gọi hàm, đầu ra có cấu trúc, tìm kiếm web, tìm kiếm X, thực thi mã

“Không có giới hạn đầu ra văn bản cố định” là mô tả trên trang mô hình, không phải cam kết rằng mọi SDK, gateway, tài khoản hay yêu cầu đều trả về văn bản không giới hạn. Thời gian chờ của client, giới hạn tài khoản, chính sách tuyến và ngữ cảnh khả dụng vẫn được áp dụng.

Điểm mới so với Grok 4.5

xAI định vị Grok 4.6 là bản cập nhật tăng dần cho mô hình frontier, tập trung vào agent chạy dài và công việc tương tác, trực quan tham vọng hơn. Thông báo chính thức mô tả quá trình huấn luyện bổ sung dài hơn, các quỹ đạo fine-tuning có giám sát được tái tạo và reinforcement learning theo kiểu agent trong công việc tri thức, lập trình, phát triển web, tối ưu kernel và CAD.

Các thay đổi thực tế cần đánh giá gồm:

  • xhigh được bổ sung bên cạnh low, medium và high;
  • xAI báo cáo khả năng duy trì tốt hơn trong nghiên cứu nhiều bước, làm việc xuyên codebase và xây dựng ứng dụng lặp;
  • mô hình nhận hình ảnh cùng văn bản và trả về văn bản;
  • lớp ngữ cảnh 500K và mức giá khởi điểm $2 cho đầu vào / $6 cho đầu ra được giữ nguyên, nhưng đầu vào cache của Grok 4.6 là $0,50 mỗi triệu token so với $0,30 hiện được niêm yết cho Grok 4.5;
  • xAI khuyến nghị liên kết cache theo cuộc hội thoại và nén ngữ cảnh cho các vòng lặp agent dài.

Đây là lý do để thực hiện chuyển đổi có kiểm soát, không phải thay Grok 4.5 một cách mù quáng. Hãy so sánh tỷ lệ hoàn thành nhiệm vụ, độ trễ, tổng token, số lần gọi công cụ và chi phí trên workload của bạn.

Giá API Grok 4.6

Trang giá của xAI niêm yết giá tiêu chuẩn bằng đô la Mỹ trên mỗi một triệu token như sau:

Kích thước prompt Đầu vào Đầu vào cache Đầu ra
Dưới 200K token prompt $2.00 $0.50 $6.00
Từ 200K token prompt trở lên $4.00 $1.00 $12.00

Khi prompt đạt 200K token, xAI cho biết giá ngữ cảnh dài áp dụng cho toàn bộ token trong yêu cầu. Ba phép tính ngắn minh họa ngưỡng này:

  • 100K đầu vào và 5K đầu ra có giá khoảng $0.23 theo mức ngữ cảnh ngắn tiêu chuẩn.
  • Nếu toàn bộ 100K token đầu vào được phục vụ từ cache, cùng đầu ra đó có giá khoảng $0.08.
  • 220K đầu vào và 10K đầu ra vượt ngưỡng, có giá khoảng $1.00 theo mức ngữ cảnh dài đã niêm yết.

Các ví dụ chưa bao gồm công cụ phía server. xAI hiện niêm yết thêm $5 cho mỗi 1.000 lần gọi tìm kiếm web, tìm kiếm X hoặc thực thi mã ngoài chi phí token. Thông báo cũng đề cập biến thể nhanh có giá gấp đôi mức tiêu chuẩn. Trước khi lập ngân sách, hãy xác nhận đúng mô hình, cấp dịch vụ, khu vực và giá hiện hành trong console xAI.

Để có phương pháp chi phí tổng quát hơn, xem Cách tính chi phí token LLMTheo dõi chi phí API AI.

Gọi Grok 4.6 bằng Responses hoặc Chat Completions

Các yêu cầu sau dùng endpoint API chính thức của xAI vì đây là hướng dẫn phát hành, không phải tuyên bố rằng mô hình đã được bật trên mọi gateway.

Responses API:

export XAI_API_KEY="<YOUR_XAI_API_KEY>"

curl -sS https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.6",
    "input": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps.",
    "prompt_cache_key": "grok-46-migration-review"
  }'

Chat Completions:

curl -sS https://api.x.ai/v1/chat/completions \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -H "x-grok-conv-id: grok-46-migration-review" \
  -d '{
    "model": "grok-4.6",
    "messages": [
      {
        "role": "user",
        "content": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps."
      }
    ]
  }'

Dùng prompt_cache_key với Responses hoặc header x-grok-conv-id với Chat Completions để tăng khả năng cùng một cuộc hội thoại chạm đúng cache. Hãy coi các giá trị này là metadata vận hành: giữ ổn định trong một cuộc hội thoại, không chứa bí mật hay dữ liệu cá nhân và không dùng chung cho người dùng không liên quan.

Nếu đang chọn giữa hai định dạng truyền, hãy đọc Responses API so với Chat Completions.

Cache prompt và vòng lặp agent dài

Cửa sổ 500K là sức chứa, không phải mục tiêu. Gửi toàn bộ lịch sử ở mỗi lượt làm tăng độ trễ và có thể đẩy toàn bộ yêu cầu sang mức giá ngữ cảnh dài.

Với workflow chạy lâu:

  1. đặt chỉ dẫn ổn định và ngữ cảnh có thể tái sử dụng ở đầu prompt;
  2. dùng khóa liên kết cache ổn định cho từng cuộc hội thoại;
  3. đo riêng đầu vào cache và không cache;
  4. nén hoặc tóm tắt lượt cũ trước khi prompt gần 200K token;
  5. giữ kết quả công cụ vẫn có thẩm quyền và loại bỏ nhiễu truyền tải trùng lặp;
  6. đặt rõ mức suy luận và so sánh thành công theo nhiệm vụ thay vì cho rằng xhigh luôn tốt hơn;
  7. ghi trạng thái, độ trễ, đầu vào, đầu vào cache, đầu ra, số lần gọi công cụ và tổng chi phí trên mỗi nhiệm vụ thành công.

Nén ngữ cảnh thay đổi thông tin mô hình nhìn thấy. Hãy đối chiếu bản tóm tắt với trạng thái gốc và giữ lại ID, ràng buộc, quyết định cùng lỗi chưa giải quyết có thẩm quyền.

Đọc benchmark lúc ra mắt đúng cách

xAI công bố các kết quả Grok 4.6 High sau trong thông báo ra mắt:

Bài đánh giá Điểm Grok 4.6 do xAI công bố
Artificial Analysis Intelligence Index 61
GDPVal-AA v2 1753
CursorBench v3.2 69.9%
DeepSWE v1.1 65.9%
FrontierCode v1.1 Extended 61.3%
APEX-Agents 57.5%

Đây là kết quả ra mắt do nhà cung cấp công bố, không phải kiểm thử độc lập của Modelflare. Bộ chạy benchmark, cài đặt suy luận, quyền truy cập công cụ, giới hạn thời gian và phiên bản chấm điểm đều ảnh hưởng tính so sánh. Hãy dùng bảng để chọn workload cần thử, không dùng như xếp hạng chất lượng phổ quát hoặc bảo đảm kết quả production.

Danh sách kiểm tra chuyển đổi production

Trước khi chuyển lưu lượng production sang Grok 4.6:

  1. dùng chính xác ID grok-4.6 và từ chối việc thay alias ngầm;
  2. xác nhận mô hình đã bật cho đúng tài khoản, khu vực, định dạng API và cấp dịch vụ;
  3. chạy lại một bộ đánh giá cố định, không chứa dữ liệu riêng tư trên Grok 4.5 và Grok 4.6;
  4. kiểm thử riêng văn bản, hình ảnh, gọi hàm, đầu ra có cấu trúc, streaming, đường từ chối và hủy theo phạm vi ứng dụng;
  5. so sánh low, medium, high và xhigh theo chi phí và độ trễ của nhiệm vụ thành công;
  6. thử yêu cầu ngay dưới và ngay trên ngưỡng prompt 200K;
  7. xác minh cache hit, nén ngữ cảnh, số lần gọi công cụ, retry và bảo vệ khỏi tác dụng phụ trùng lặp;
  8. giữ tuyến rollback và ghi mô hình cuối, tuyến, usage, độ trễ cùng khoản phí cho mỗi yêu cầu.

HTTP 200 chỉ chứng minh một yêu cầu đã hoàn tất. Nó không chứng minh tính tương đương chức năng, độ trễ ổn định, hành vi công cụ đúng hoặc chi phí chấp nhận được. Để kiểm thử theo tuyến, dùng Kiểm thử tuân thủ API tương thích OpenAIĐịnh tuyến API AI ổn định.

Grok 4.6 đã có trên Modelflare chưa?

Có. Trong lần kiểm tra production ngày 13 tháng 8 năm 2026, danh mục công khai Mô hình & Giá của Modelflare đã liệt kê đúng ID grok-4.6 trong các nhóm grok-awardgrok-stable. Danh mục ghi hỗ trợ tuyến Chat Completions và Responses API tương thích OpenAI.

Hệ số nhóm hiển thị tại thời điểm kiểm tra là 0,03x cho grok-award và 0,06x cho grok-stable. Quyền truy cập nhóm, tuyến, giá và khả năng cung cấp có thể thay đổi. Vì xAI còn áp dụng mức giá ngữ cảnh dài riêng, không nên áp một hệ số quảng bá hoặc ví dụ ngữ cảnh ngắn cho mọi yêu cầu. Hãy xem trang giá trực tiếp và bản ghi chi phí của yêu cầu đã hoàn tất là nguồn hiện tại.

Tạo hoặc cập nhật API Key với nhóm đủ điều kiện, dùng đúng ID grok-4.6 và hoàn thành một yêu cầu thực không có dữ liệu nhạy cảm trước khi chuyển lưu lượng production. Việc có tên trong danh mục xác nhận cấu hình công khai, nhưng không phải benchmark độc lập của Modelflare hay bảo đảm quyền truy cập cho mọi API Key.

Nguồn chính thức và nhật ký cập nhật

Nguồn sơ cấp:

Nhật ký cập nhật:

  • 13 tháng 8 năm 2026: Xuất bản lần đầu. Đã kiểm tra thông số chính thức, giá, định dạng API, benchmark ra mắt và tình trạng trong danh mục Modelflare.