Claude Sonnet 5.5: thông số, giá và truy cập Modelflare

Bản ghi có nguồn về claude-sonnet-5-5: thông số đã công bố, giá token chính thức, cách đọc bảng benchmark ngày 28 tháng 9 năm 2026, cùng nhóm và giá người dùng Modelflare được trả về ngày 30 tháng 9 năm 2026.

Anthropic phát hành Claude Sonnet 5.5 vào ngày 28 tháng 9 năm 2026. ID mô hình trên API là claude-sonnet-5-5. Đây là mô hình thứ hai trong họ Claude 5.5. Anthropic đặt nó cạnh Opus 5.5: tác vụ hằng ngày có phạm vi rõ, sửa lỗi, cùng tài liệu, slide và bảng tính dùng mô hình này; công việc phức tạp, mở, cần phán đoán kéo dài vẫn ở Opus 5.5. Giá niêm yết trùng Sonnet 5, $2 cho mỗi một triệu token đầu vào, $10 cho mỗi một triệu token đầu ra, và $0.20 cho mỗi một triệu token đọc cache.

Bài viết này giữ ba lớp tách riêng. Thông số và các thay đổi phá vỡ tương thích lấy từ trang mô hình, trang cập nhật và hướng dẫn migration. Bảng benchmark được chép từ trang ra mắt. Modelflare không chạy lại các đánh giá đó. Nhóm và giá người dùng lấy từ GET https://modelflare.dev/api/pricing đã đọc ngày 30 tháng 9 năm 2026. Những câu của nhà cung cấp như “rẻ hơn tới 30%” và “nhanh hơn từ 30%” mô tả thiết bị thử của chính Anthropic.

Kết luận sau khi đối chiếu

Theo giá niêm yết đã công bố, Sonnet 5.5 là cùng một bảng giá với Sonnet 5. Đầu vào và đầu ra bằng một nửa Opus 5.5. Trên các dòng lập trình và công việc tri thức in ở trang ra mắt, nó vượt khá xa Sonnet 5. Terminal-Bench 4.0 ở 70.6% cao hơn 66.4% mà bảng đó in cho Opus 5.5. CursorBench 4.0 ở 55.5% và GDPval-AA v2.1 ở 1844 nằm sát Opus 5.5 và thấp hơn nó. Anthropic cũng viết rằng, trong cách họ dùng và trong thử nghiệm bên ngoài, Opus 5.5 vẫn mạnh hơn ở công việc phức tạp, mở, cần phán đoán kéo dài.

Ngày 30 tháng 9 năm 2026, phản hồi giá của Modelflare đã có claude-sonnet-5-5. Đơn giá khớp mức chính thức của đầu vào, đầu ra, đọc cache và ghi cache 5 phút. Các nhóm công khai là claude-award, claude-stable, claude-premium và claude-tmp-cheap. Thông báo trang chính ngày 29 tháng 9 năm 2026 nêu các nhóm mở ngày hôm đó, claude-award và claude-stable. Đến lần đọc này, danh sách công khai còn có thêm hai nhóm sau.

Thông số đã công bố

Hạng mục Claude Sonnet 5.5
Claude API ID claude-sonnet-5-5
Amazon Bedrock ID anthropic.claude-sonnet-5-5
Google Cloud, Microsoft Foundry, Claude Platform on AWS claude-sonnet-5-5
Ngày phát hành 28 tháng 9 năm 2026
Cam kết ngừng phục vụ Không sớm hơn 28 tháng 9 năm 2027
Ngữ cảnh / output đồng bộ tối đa 1M / 128K tokens
Output tối đa của Batch API 300K tokens, header beta output-300k-2026-03-24
Đầu vào → đầu ra Văn bản và hình ảnh → văn bản
Suy nghĩ Thích ứng, bật theo mặc định
Effort mặc định trên Claude API high
Effort mặc định trong ứng dụng Claude và Claude Code medium
Giá trị effort low, medium, high, xhigh, max
Mốc kiến thức đáng tin Tháng 6 năm 2026
Độ dài tối thiểu của prompt có thể cache 512 tokens
Bộ tách token Giống Sonnet 5, nên cùng một đoạn văn có cùng số token

Trang mô hình ghi độ trễ là Fast. Đó là phép so sánh trong dòng sản phẩm Claude hiện tại, không phải số token mỗi giây đã đo. Mức thấp nhất tắt suy nghĩ trước là thinking: {"type": "between_tools"}, chỉ được nhận ở low, medium và high. xhigh và max quay lại suy nghĩ thích ứng. Đặt temperature, top_p hoặc top_k lệch khỏi mặc định thì trả về 400.

Trang ra mắt viết Haiku 5.5 sẽ theo sau trong vài tuần tới. Bài viết này không định giá một ID chưa có.

Giá chính thức

Số tiền là đô la Mỹ cho mỗi một triệu token. Cột Sonnet 5.5 là trang mô hình. Cột Opus 5.5 là bảng so sánh trên cùng trang ra mắt. Trang cập nhật viết Sonnet 5.5 có cùng giá với Sonnet 5, gồm cache prompt và xử lý batch. Mức giảm batch là 50% trên đầu vào và đầu ra.

Mỗi 1M token Sonnet 5.5 Opus 5.5 trên trang ra mắt
Đầu vào $2 $4
Đầu ra $10 $20
Đọc cache $0.20 $0.20
Ghi cache 5 phút $2.50; 1 giờ $4 $5
Đầu vào / đầu ra batch 50% giá niêm yết Bảng đó không in

Trang ra mắt in một con số ghi cache của Opus 5.5, $5, không tách 5 phút và 1 giờ. Trang mô hình Sonnet 5.5 tách hai mức. So với đầu vào và đầu ra của Opus 5.5, bảng này là một nửa. Đọc cache của cả hai đều là $0.20.

Anthropic còn công bố hai nhận định về tải: cùng một việc thường tốn ít token hơn, và hầu hết tác vụ rẻ hơn tới 30%; việc sinh đầu ra nhanh hơn Sonnet 5 từ 30%. Biểu đồ chi phí thêm các so sánh theo từng tác vụ ở khoảng một phần mười, một phần năm và một phần mười lăm. Những kết quả đó thuộc thiết bị thử của họ. Hóa đơn thật vẫn phụ thuộc effort, lần trúng cache, vòng công cụ, và cuộc gọi có dùng batch hay không.

Cách đọc benchmark

Bảng dưới đây là bảng được in trên trang ra mắt. Dấu gạch là ô trống trên trang đó. Biểu đồ chi phí của Terminal-Bench 4.0 và CursorBench 4.0 dùng GPT-5.6 Sol vì OpenAI chưa công bố GPT-6 Sol ở hai mục đó. Bài viết này không chép một điểm GPT-5.6 Sol trên biểu đồ vào cột GPT-6 Sol. Modelflare không chạy lại các bài kiểm tra.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4% —
FrontierCode v1.1, Main 46.2% (max); 52.1% (xhigh) 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% —
GDPval-AA v2.1 1844 1449 1846 1487
AA-Briefcase v1.1 1811 1359 1822 1483
Humanity's Last Exam, có công cụ 64.5% 54.9% 67.7% —
OSWorld 2.1, partial 80.1% 57.0% 81.8% —
Chartography, không công cụ 61.6% 15.6% 64.4% 53.6%

Chú thích phải đứng cạnh điểm. Opus 5.5 trên Terminal-Bench 4.0 ở xhigh, và trang ra mắt gọi đó là điểm cao nhất của mô hình ấy. Trên FrontierCode, Sonnet 5.5 ở max thấp hơn xhigh. Trang ra mắt giải thích rằng max thường chạy rà soát mã hơn, sau khi phần rà soát bị tách cho nhiều tác nhân con thì đã có hết thời gian chờ hoặc sửa vượt phạm vi tác vụ, và benchmark này phạt thay đổi ngoài phạm vi. Artificial Analysis chạy GDPval-AA và AA-Briefcase trên một bản triển khai trước phát hành có lỗi có thể làm xấu đầu ra có cấu trúc. Trang ra mắt nói lỗi đó sau đã được sửa, và nếu có ảnh hưởng thì hướng là đánh giá Sonnet 5.5 thấp hơn thực tế. Các ô GPT-6 Sol của GDPval-AA, AA-Briefcase và Chartography còn một ghi chú nữa: OpenAI đã sửa một lỗi làm hại hiểu hình ảnh, và những điểm bên ngoài đó có thể chưa được cập nhật.

Biểu đồ chi phí trên cùng trang là một cách đọc khác. Medium effort là mặc định trong ứng dụng Claude. Trên vài benchmark, Sonnet 5.5 ở Low hoặc Medium vượt điểm tốt nhất của Sonnet 5 với khoảng một phần mười chi phí mỗi tác vụ. High effort là mặc định trên Claude Platform. Trang ra mắt viết rằng trên FrontierCode ở High, điểm cao hơn Sonnet 5 cùng mức khoảng 10 điểm, chi phí mỗi tác vụ khoảng một phần mười lăm, và ngang điểm tốt nhất của GPT-6 Sol với khoảng một phần năm chi phí. Trên CursorBench ở Low, nó vượt điểm tốt nhất của Sonnet 5 với chi phí chưa tới một phần mười. Trên AA-Briefcase ở Medium, nó vượt điểm tốt nhất của Sonnet 5 với khoảng một phần chín chi phí. 55.5% và 1844 được in là các điểm trong bảng. Các câu về chi phí là một thiết bị thử khác. Trích dẫn khách hàng được chọn trên trang ra mắt có thể gợi ý nên phát lại gì. Chúng không thuộc bảng này.

Trang ra mắt còn viết đây là Sonnet đầu tiên thắng Pokémon Red chỉ từ ảnh chụp màn hình. Đó là lời kể sản phẩm của nhà cung cấp, không phải một dòng trong bảng trên.

Giá và nhóm của Modelflare

Trong phản hồi giá ngày 30 tháng 9 năm 2026, claude-sonnet-5-5 có input_price 2 và completion_ratio 5, nên đầu ra là $10. cache_ratio là 0.1, nên đọc cache là $0.20. create_cache_ratio là 1.25, nên ghi cache trong danh mục là $2.50. Dòng này không có billing_mode và không có giá ghi riêng cho 1 giờ. Đừng nhân $4 của mức 1 giờ chính thức, hoặc nửa giá batch, với hệ số nhóm rồi coi tích đó là khoản đã ghi nhận. Bản ghi sử dụng mới là khoản tính phí.

Loại endpoint là anthropic và openai. Nhóm được chọn trên khóa API. Bốn nhóm công khai gọi cùng một ID mô hình.

Bảng giá

Nhóm Hệ số Đầu vào / 1M Đọc cache / 1M Ghi cache danh mục / 1M Đầu ra / 1M Mô tả danh mục ngày đó
claude-award 0.25 $0.50 $0.05 $0.625 $2.50 Định tuyến ưu tiên giá cho development, test và tải linh hoạt, nhạy với ngân sách và có thể thử lại
claude-stable 0.315 $0.63 $0.063 $0.7875 $3.15 Development hằng ngày, dự án dài hơn và production khi sự ổn định quan trọng
claude-premium 0.5 $1.00 $0.10 $1.25 $5.00 Ưu tiên tính liên tục và request thành công, tính 50% giá niêm yết chính thức
claude-tmp-cheap 0.06 $0.12 $0.012 $0.15 $0.60 Tuyến khuyến mại có thời hạn

Phép tính là đơn giá danh mục nhân hệ số nhóm. Trên claude-stable, $0.63 là $2 × 0.315, và ghi cache $0.7875 là $2.50 × 0.315. Phần mô tả là chữ trong định nghĩa nhóm. Đó không phải thỏa thuận sẵn sàng đã đo.

Cùng phản hồi còn liệt kê claude-first-topup không công khai, hệ số 0.03, mô tả là mở khóa khi một lần nạp đạt $50. Nó không phải nhóm công khai có thể chọn, nên không có dòng ở trên. Khi một khóa còn có nhóm fallback, request rời nhóm chiến dịch được tính theo nhóm thực sự phục vụ nó.

Ba ví dụ tính

Mỗi hình dạng là 100,000 token của loại đầu vào được nêu cộng 5,000 token đầu ra. Các dòng cache giả định bản ghi sử dụng thực sự phân loại những token đó là đọc hoặc ghi. Với số tiền nhỏ, làm tròn hạn mức có thể làm dịch con số đã ghi.

Yêu cầu Giá niêm yết claude-award claude-stable claude-premium claude-tmp-cheap
100,000 đầu vào chưa cache, 5,000 đầu ra $0.2500 $0.0625 $0.07875 $0.1250 $0.0150
100,000 đọc cache, 5,000 đầu ra $0.0700 $0.0175 $0.02205 $0.0350 $0.0042
100,000 ghi cache danh mục, 5,000 đầu ra $0.3000 $0.0750 $0.0945 $0.1500 $0.0180

Giá niêm yết ở dòng đầu là 0.1 × $2 + 0.005 × $10. Mỗi ô nhóm là $0.25 đó nhân hệ số. Dòng thứ ba dùng giá ghi danh mục $2.50, tức mức 5 phút chính thức, chứ không phải $4 của 1 giờ. Trang trực tiếp là trang giá claude-sonnet-5-5. Toàn bộ danh mục là Mô hình và giá.

Khi một lần thất bại đắt, danh mục mô tả claude-premium là tuyến ưu tiên tính liên tục. Với production hằng ngày và dự án dài hơn, danh mục mô tả claude-stable là mặc định loại đó. Development và test có thể thử lại dùng claude-award. claude-tmp-cheap là tuyến khuyến mại có thời hạn, hệ số 0.06. Chọn nhóm theo chi phí của thất bại, đừng chỉ nhìn hệ số, và đọc hệ số cùng mô tả đó.

Cách gọi trên Modelflare

Tạo khóa trên một trong bốn nhóm trong bảng. Gửi đúng ID mô hình claude-sonnet-5-5. URL gốc chuẩn là https://modelflare.dev/v1. Cùng API đó cũng được đăng tại https://cf.modelflare.dev/v1 và https://origin.modelflare.dev/v1. Tên miền gốc là site chuẩn.

Messages API là lối vào để đặt effort. Yêu cầu dưới đây để suy nghĩ ở chế độ thích ứng và đặt effort là medium. max_tokens phải chừa chỗ cho khối suy nghĩ.

export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"

curl -sS https://modelflare.dev/v1/messages \
  -H "x-api-key: $MODELFLARE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 1024,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Hãy rà soát kế hoạch migration này và liệt kê ba giả định cần bổ sung kiểm thử nhất."
      }
    ]
  }'

Chat Completions cũng được liệt kê trên ID này. Ví dụ này chỉ gửi văn bản và không đặt reasoning_effort.

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "messages": [
      {
        "role": "user",
        "content": "Hãy rà soát kế hoạch migration này và liệt kê ba giả định cần bổ sung kiểm thử nhất."
      }
    ]
  }'

Muốn chọn effort thì dùng yêu cầu Messages ở trên. Gateway hiện biến reasoning_effort của Chat Completions thành ngân sách suy nghĩ thủ công có budget_tokens, và Sonnet 5.5 từ chối ngân sách thủ công. Khi bỏ effort, mặc định của Claude API là high. Khác biệt giữa hai lối vào nằm ở So sánh Responses API và Chat Completions. Cách lượng dùng khớp hóa đơn nằm ở Theo dõi chi phí AI API.

Chuyển từ Sonnet 5

Trang cập nhật liệt kê năm thay đổi khiến mã đang chạy trên Sonnet 5 trả về 400, cùng một thay đổi để yêu cầu vẫn thành công nhưng hình dạng phản hồi đổi.

Yêu cầu trả về 400

thinking: {"type": "disabled"}
thinking: {"type": "enabled", "budget_tokens": N}
thinking: {"type": "between_tools"} khi effort là xhigh hoặc max
tool_choice: {"type": "any"}
tool_choice: {"type": "tool", "name": "..."}
temperature, top_p, top_k đặt lệch khỏi giá trị mặc định
loại công cụ computer_20251124 trên Claude API và Google Cloud
công cụ cố vấn dùng Opus 4.8, Opus 4.7 hoặc Sonnet 5 làm cố vấn

Để tắt suy nghĩ trước, gửi between_tools và giữ effort ở high hoặc thấp hơn. Giữ tool_choice ở auto hoặc none. Để tham số công cụ đúng schema, bật strict, hoặc chuyển schema sang đầu ra có cấu trúc, và nói trong prompt khi nào dùng công cụ. Trên Claude API và Google Cloud, computer use chuyển sang computer_toolset_20260801. Amazon Bedrock vẫn nhận computer_20251124. Công cụ cố vấn nhận Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5, hoặc chính Sonnet 5.5. Nội dung cố vấn trả về đã mã hóa, và client không đọc được văn bản.

Tài khoản tạo từ 31 tháng 8 năm 2026, 00:00 UTC, trở đi còn một 400 nữa trên Claude API, Amazon Bedrock và Google Cloud: phát lại khối suy nghĩ của Sonnet 5.5 sau khi system prompt, danh sách công cụ hoặc một tin nhắn sớm hơn đã đổi thì yêu cầu thất bại. Giữ hội thoại chỉ nối thêm. Khi bắt buộc đổi chỉ dẫn, dùng tin nhắn hệ thống giữa hội thoại.

Hành vi đổi dù phản hồi thành công

Khi bỏ effort, API chạy ở high. Cùng một từ không mua được lượng suy nghĩ như trên Sonnet 5. Trang cập nhật yêu cầu quét lại effort, đừng chép cấu hình cũ. Vòng công cụ có phạm vi rõ có thể bắt đầu ở medium, vòng dài hơn hoặc khó hơn có thể lên high. Hội thoại nhạy độ trễ có thể bắt đầu ở medium hoặc low.

Chữ tiến độ dài hơn một hai câu giữa các lần gọi công cụ quay vào khối suy nghĩ. Khi display mặc định là omitted, văn bản của những khối đó trống, nên giao diện im giữa các công cụ trong khi yêu cầu vẫn thành công. Đặt display khi sản phẩm cần những dòng đó. Với between_tools, đoạn chữ đó quay lại.

Khối suy nghĩ ghi mô hình đã tạo ra nó. Sonnet 5.5 đọc khối suy nghĩ của Sonnet 5, Opus 4.8, Haiku 4.5 và các mô hình sớm hơn. Nó không đọc khối của Opus 5, Opus 5.5, Fable hoặc Mythos. Không mô hình nào khác đọc khối suy nghĩ của Sonnet 5.5. Khối mà mô hình đích không đọc được bị bỏ trước khi mô hình thấy, và khối bị bỏ không bị tính phí. Khối do Sonnet 5.5 tạo còn gắn với tài khoản đã tạo ra nó. Phát lại từ một tài khoản không liên kết thì khối bị bỏ, và yêu cầu vẫn thành công.

Từ chối và fallback

Yêu cầu bị từ chối trả về HTTP 200 với stop_reason là "refusal". Các hạng mục trang cập nhật nêu là cyber, bio, frontier_llm, reasoning_extraction và general_harms. Trang ra mắt viết năng lực an ninh mạng của nó đã gần Opus 5, nên đây là Sonnet đầu tiên mang lớp bảo vệ an ninh mạng cùng loại. Tác vụ an ninh mạng rủi ro cao hơn fallback về Sonnet 5. Bảo vệ sinh học trùng Sonnet 5. Phát triển phần mềm thường ngày và hầu hết công việc khoa học sự sống nằm ngoài hai lớp bảo vệ hẹp đó.

Trang cập nhật viết fallback mặc định ở bản beta của Claude API thử lại cyber và frontier_llm trên Sonnet 5, và không thử lại bio, reasoning_extraction hoặc general_harms. Đó là hành vi Anthropic ghi trong tài liệu. Tuyến Modelflare này có làm cùng kiểu fallback hay không thì tên mô hình trên phản hồi trả lời. Đếm từ chối tách khỏi lỗi truyền. Việc một lần từ chối có bị tính phí hay không còn tùy hạng mục. Trang ra mắt cũng viết Sonnet 5.5 có thể dùng với không lưu giữ dữ liệu.

Việc cần đối chiếu trước khi chuyển lưu lượng

  1. Ghim claude-sonnet-5-5. Cũng kiểm tra tên mô hình trên kết quả đã hoàn tất. Fallback bảo vệ có thể trả lời bằng Sonnet 5.
  2. Xác nhận nhóm của khóa là một trong bốn nhóm công khai trong bảng, và chọn theo chi phí của thất bại.
  3. Phát lại một tập không chứa thông tin nhạy cảm ở low, medium, high, xhigh và max. Ghi thành công, độ trễ, đầu vào, lần đọc cache, lần ghi cache, đầu ra và khoản tính phí.
  4. Đặt effort trong output_config.effort của yêu cầu Messages. Đừng dùng reasoning_effort của Chat Completions để đặt mức suy nghĩ cho mô hình này.
  5. Sửa các client vẫn gửi disabled, lựa chọn công cụ cưỡng bức, ngân sách suy nghĩ thủ công hoặc computer_20251124 trước khi tăng lưu lượng.
  6. Giữ các hội thoại phát lại khối suy nghĩ ở dạng chỉ nối thêm.
  7. Đếm từ chối HTTP 200 tách khỏi lỗi truyền.
  8. Định giá một prompt ngắn và một prompt đáng lẽ trúng cache, rồi đọc số đã ghi. Giá ghi 1 giờ chính thức và nửa giá batch theo bản ghi sử dụng.
  9. Giữ công việc phức tạp, mở, cần phán đoán kéo dài trên claude-opus-5-5. claude-sonnet-5 vẫn dùng được.

Nguồn

Đối chiếu ngày 30 tháng 9 năm 2026. Modelflare không tái hiện độc lập các benchmark.