Claude Sonnet 5.5:规格、价格与 Modelflare 接入

依据 Anthropic 2026 年 9 月 28 日的发布页和模型页,整理 claude-sonnet-5-5 的规格、官网标价和基准读法,并记录 2026 年 9 月 30 日 Modelflare 价格接口中的公开分组与用户价格。

Claude Sonnet 5.5 于 2026 年 9 月 28 日发布。API 模型 ID 是 claude-sonnet-5-5。它是 Claude 5.5 系列的第二款。Anthropic 把它放在 Opus 5.5 旁边:范围清楚的日常任务、修 bug,以及文档、幻灯片和表格,用这一款;复杂、开放、需要持续判断的工作,仍用 Opus 5.5。官网标价与 Sonnet 5 相同,每百万输入 token $2,每百万输出 token $10,缓存读取 $0.20。

本文把三层分开。规格和破坏性变更来自模型页、更新说明和迁移指南。基准表抄自发布页,Modelflare 没有重跑这些评测。分组和用户价格来自 2026 年 9 月 30 日读取的 GET https://modelflare.dev/api/pricing。厂商关于“最多便宜 30%”“快 30% 以上”的说法,描述的是他们自己的测试装置。

核查后的结论

按官网标价,Sonnet 5.5 与 Sonnet 5 是同一张价格卡,输入和输出都是 Opus 5.5 的一半。发布页印出的编程和知识工作行上,它明显高于 Sonnet 5。Terminal-Bench 4.0 的 70.6% 高于 Opus 5.5 在该表中的 66.4%。CursorBench 4.0 的 55.5% 与 GDPval-AA v2.1 的 1844,都紧挨着 Opus 5.5,并低于它。Anthropic 同时写明,在他们自己的使用和外部测试里,复杂、开放、需要持续判断的工作仍是 Opus 5.5 更强。

2026 年 9 月 30 日,Modelflare 价格接口已经有 claude-sonnet-5-5。单位价格与官网的输入、输出、缓存读取和 5 分钟缓存写入一致。公开分组是 claude-award、claude-stable、claude-premium 和 claude-tmp-cheap。2026 年 9 月 29 日的主站公告写的是当时开放的 claude-award 和 claude-stable。到这次读取时,公开分组已经多了后两个。

已经公开的规格

项目 Claude Sonnet 5.5
Claude API ID claude-sonnet-5-5
Amazon Bedrock ID anthropic.claude-sonnet-5-5
Google Cloud、Microsoft Foundry、Claude Platform on AWS claude-sonnet-5-5
发布日期 2026 年 9 月 28 日
退役承诺 不早于 2027 年 9 月 28 日
上下文 / 同步最大输出 1M / 128K tokens
批量 API 最大输出 300K tokens,beta 头 output-300k-2026-03-24
输入 → 输出 文本和图片 → 文本
思考 自适应,默认开启
Claude API 的默认 effort high
Claude 应用与 Claude Code 的默认 effort medium
effort 取值 low、medium、high、xhigh、max
可靠知识截止 2026 年 6 月
可缓存提示的最短长度 512 tokens
分词器 与 Sonnet 5 相同,同一段文本的 token 数相同

模型页把延迟档写成 Fast,这是相对当前 Claude 产品线的比较,不是一个 tokens/秒的测量值。关闭预先思考的最低档是 thinking: {"type": "between_tools"},只在 low、medium 和 high 上接受。xhigh 和 max 要改回自适应思考。temperature、top_p 或 top_k 设成非默认值会返回 400。

Haiku 5.5 在发布页上写的是随后几周推出。本文不给一个尚未出现的 ID 写价格。

官网价格

单位是美元 / 每百万 tokens。Sonnet 5.5 这一列来自模型页。Opus 5.5 这一列来自同一发布页的对比表。更新说明写明,Sonnet 5.5 的价格与 Sonnet 5 相同,包含提示缓存和批量。批量折扣是输入和输出的 50%。

每 1M tokens Sonnet 5.5 发布页上的 Opus 5.5
输入 $2 $4
输出 $10 $20
缓存读取 $0.20 $0.20
缓存写入 5 分钟 $2.50;1 小时 $4 $5
批量输入 / 输出 标价的 50% 这张表没有给出

发布页把 Opus 5.5 的缓存写入印成一个 $5,没有拆开 5 分钟和 1 小时。Sonnet 5.5 的模型页把两档分开。相对 Opus 5.5 的输入和输出,这张卡是一半。缓存读取两款都是 $0.20。

Anthropic 还有两条工作负载说法:同样的工作通常更省 token,多数任务最多便宜 30%;输出生成比 Sonnet 5 快 30% 以上。成本图上还有若干“大约十分之一”“大约五分之一”“大约十五分之一”的单任务成本比较。这些都是他们测试装置里的结果。真实账单仍取决于 effort、缓存命中、工具轮次和有没有走批量。

基准应该怎么读

下表就是发布页印出的那一张。破折号是发布页自己的空格。Terminal-Bench 4.0 和 CursorBench 4.0 的成本图改用了 GPT-5.6 Sol,因为 OpenAI 没有公开 GPT-6 Sol 的这两项。本文不把图上的 GPT-5.6 Sol 填进 GPT-6 Sol 这一列。Modelflare 没有重跑。

基准 Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4% —
FrontierCode v1.1,Main 46.2%(max);52.1%(xhigh) 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% —
GDPval-AA v2.1 1844 1449 1846 1487
AA-Briefcase v1.1 1811 1359 1822 1483
Humanity's Last Exam,有工具 64.5% 54.9% 67.7% —
OSWorld 2.1,partial 80.1% 57.0% 81.8% —
Chartography,无工具 61.6% 15.6% 64.4% 53.6%

脚注要和分数放在一起看。Opus 5.5 的 Terminal-Bench 4.0 是 xhigh,发布页称这是该模型的最高分。FrontierCode 上,Sonnet 5.5 的 max 低于 xhigh。发布页的解释是:max 更常运行代码审查,审查被拆到多个子代理之后,出现过超时,也出现过超出任务范围的修改,而这项评测会惩罚超范围改动。GDPval-AA 和 AA-Briefcase 由 Artificial Analysis 跑在一个预发布部署上,该部署有一个可能压低结构化输出的缺陷,发布页说这个缺陷后来已修复,若有影响,方向是低估 Sonnet 5.5。GPT-6 Sol 列上的 GDPval-AA、AA-Briefcase 和 Chartography 还带另一条说明:OpenAI 修复过一个损害图像理解的缺陷,这些外部分数当时未必已经更新。

同一页的成本图用的是另一种读法。Medium effort 是 Claude 应用里的默认值。在若干基准上,Low 或 Medium 的 Sonnet 5.5 以大约十分之一的单任务成本超过 Sonnet 5 的最好成绩。High effort 是 Claude Platform 的默认值。发布页写,FrontierCode 在 High 上比同一档的 Sonnet 5 高大约 10 分,单任务成本大约是十五分之一,并与 GPT-6 Sol 的最好成绩相当,成本大约是五分之一。CursorBench 在 Low 上超过 Sonnet 5 的最好成绩,成本不到十分之一。AA-Briefcase 在 Medium 上超过 Sonnet 5 的最好成绩,成本大约是九分之一。表里的 55.5% 和 1844 是发布页印出的点,成本句是另一套装置。发布页上的客户引语是挑选过的证词,可以提示该重放什么,不属于这张表。

发布页还写到,它是第一款只看截图就通过 Pokémon Red 的 Sonnet。这是厂商的产品叙述,不是上表的一行。

Modelflare 的价格和分组

2026 年 9 月 30 日的价格响应里,claude-sonnet-5-5 的 input_price 是 2,completion_ratio 是 5,所以输出是 $10。cache_ratio 是 0.1,所以缓存读取是 $0.20。create_cache_ratio 是 1.25,所以目录里的缓存写入是 $2.50。这一行没有 billing_mode,也没有单独的 1 小时写入价。官网的 1 小时 $4 和批量五折,都不要乘上分组倍率之后当成已经入账的金额。入账看用量记录。

端点类型是 anthropic 和 openai。分组写在 API 密钥上。四个公开分组调用的是同一个模型 ID。

价格表

分组 倍率 输入 / 1M 缓存读取 / 1M 目录缓存写入 / 1M 输出 / 1M 当天的目录说明
claude-award 0.25 $0.50 $0.05 $0.625 $2.50 价格优先,适合预算敏感、可以重试的开发、测试和弹性任务
claude-stable 0.315 $0.63 $0.063 $0.7875 $3.15 看重稳定性的个人开发、较长期项目和生产应用
claude-premium 0.5 $1.00 $0.10 $1.25 $5.00 优先连续性和请求成功,按官网标价的 50% 计
claude-tmp-cheap 0.06 $0.12 $0.012 $0.15 $0.60 限时优惠路由

计算方式是目录单位价格乘以分组倍率。claude-stable 的 $0.63 是 $2 × 0.315,缓存写入 $0.7875 是 $2.50 × 0.315。目录说明是分组定义里的文字,不是已经测得的可用性协议。

同一份响应还列出未公开的 claude-first-topup,倍率 0.03,定义写成单笔充值达到 50 美元后解锁。它不在公开可选分组里,所以上表没有这一行。密钥如果还配置了回退分组,请求离开活动分组之后,按实际承接的分组计费。

三个算例

形状是 10 万个相应类别的输入 token,加 5,000 个输出 token。缓存行假定用量记录真的把这些 token 计成读取或写入。金额很小时,额度取整也可能让入账数字移动。

请求 官网标价 claude-award claude-stable claude-premium claude-tmp-cheap
10 万未缓存输入,5,000 输出 $0.2500 $0.0625 $0.07875 $0.1250 $0.0150
10 万缓存读取,5,000 输出 $0.0700 $0.0175 $0.02205 $0.0350 $0.0042
10 万目录缓存写入,5,000 输出 $0.3000 $0.0750 $0.0945 $0.1500 $0.0180

第一行的官网标价是 0.1 × $2 + 0.005 × $10。分组列是这个 $0.25 乘以倍率。第三行用的是目录里的 $2.50 写入价,对应官网的 5 分钟档,不是 1 小时的 $4。实时页面是 claude-sonnet-5-5 价格页。总表是模型与价格。

失败一次的代价很高时,目录把 claude-premium 写成连续性优先。日常生产和较长期项目,目录把 claude-stable 写成默认的那一类。可以重试的开发和测试,用 claude-award。claude-tmp-cheap 是限时优惠路由,倍率 0.06。选择分组看失败成本,不要只看倍率。

在 Modelflare 上怎么调用

创建密钥时选上表里的一个分组。模型 ID 必须精确发送 claude-sonnet-5-5。规范基址是 https://modelflare.dev/v1。同一套 API 也在 https://cf.modelflare.dev/v1 和 https://origin.modelflare.dev/v1。根域名是规范站点。

Messages API 是设置 effort 的那条入口。下面这个请求把思考留在自适应,把 effort 设为 medium。max_tokens 要给思考块留出位置。

export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"

curl -sS https://modelflare.dev/v1/messages \
  -H "x-api-key: $MODELFLARE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 1024,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "审这份迁移计划,列出最需要补测试的三个假设。"
      }
    ]
  }'

Chat Completions 也列在这个 ID 上。这个例子只发文本,不带 reasoning_effort。

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "messages": [
      {
        "role": "user",
        "content": "审这份迁移计划,列出最需要补测试的三个假设。"
      }
    ]
  }'

要指定 effort,用上面的 Messages 请求。当前网关把 Chat Completions 的 reasoning_effort 写成带 budget_tokens 的手动思考,而 Sonnet 5.5 会拒绝手动预算。省略 effort 时,Claude API 的默认值是 high。两种入口的差别见 Responses API 与 Chat Completions 对比。用量怎么对上账单,见 AI API 成本追踪。

从 Sonnet 5 迁过来

更新说明列出五处会让原来跑在 Sonnet 5 上的代码返回 400 的变更,另有一处请求仍然成功、响应形状变了。

会返回 400 的请求

thinking: {"type": "disabled"}
thinking: {"type": "enabled", "budget_tokens": N}
thinking: {"type": "between_tools"} 且 effort 为 xhigh 或 max
tool_choice: {"type": "any"}
tool_choice: {"type": "tool", "name": "..."}
temperature、top_p、top_k 设为非默认值
Claude API 与 Google Cloud 上的工具类型 computer_20251124
顾问工具使用 Opus 4.8、Opus 4.7 或 Sonnet 5 作为顾问

关闭预先思考时,发送 between_tools,effort 保持在 high 或更低。tool_choice 继续用 auto 或 none。要得到符合 schema 的工具参数,把 strict 打开,或改用结构化输出,并在提示里写明何时调用工具。计算机操作在 Claude API 和 Google Cloud 上改用 computer_toolset_20260801。Amazon Bedrock 仍接受原来的 computer_20251124。顾问工具接受 Mythos 5.1、Fable 5.1、Mythos 5、Fable 5、Opus 5.5、Opus 5,或 Sonnet 5.5 自己。顾问返回的内容是加密的,客户端读不到正文。

2026 年 8 月 31 日 00:00 UTC 及之后创建的账号,在 Claude API、Amazon Bedrock 和 Google Cloud 上还有一处 400:重放 Sonnet 5.5 的思考块时,如果系统提示、工具列表或更早的消息已经改过,请求会失败。对话保持只追加。指令必须改时,用对话中途的系统消息。

请求成功,行为仍然变了

省略 effort 时,API 跑在 high。同一个词在 Sonnet 5 上的思考量对不上,更新说明要求重新做 effort 扫描,不要把旧配置抄过来。范围清楚的工具循环可以从 medium 开始,更长或更难的再升到 high。延迟敏感的对话从 medium 或 low 开始。

工具调用之间超过一两句的进度文字,回到思考块里。默认 display 为 omitted 时,这些块的文本是空的,界面会在工具之间变静,请求本身仍然成功。需要这些进度行时,设置 display。使用 between_tools 时,这段文字会回来。

思考块记着产生它的模型。Sonnet 5.5 能读 Sonnet 5、Opus 4.8、Haiku 4.5 和更早模型的思考块。它不读 Opus 5、Opus 5.5、Fable 或 Mythos 的思考块。其他模型也不读 Sonnet 5.5 的思考块。目标模型读不了的块会在模型看到之前被丢掉,丢掉的块不计费。Sonnet 5.5 产生的思考块还绑在产生它的账号上。换一个没有关联的账号重放时,块会被丢掉,请求仍然成功。

拒答和回退

被拒绝的请求以 HTTP 200 返回,stop_reason 为 "refusal"。更新说明里的类别包括 cyber、bio、frontier_llm、reasoning_extraction 和 general_harms。发布页写明,它的网络安全能力已经接近 Opus 5,因此这是第一款带上同类网络安全防护的 Sonnet。更高风险的网络安全任务会回退到 Sonnet 5。生物防护与 Sonnet 5 相同。常规软件开发和多数生命科学工作不在这两条窄防护里。

更新说明里的 Claude API beta 默认回退,会把 cyber 和 frontier_llm 转到 Sonnet 5,不重试 bio、reasoning_extraction 和 general_harms。那是 Anthropic 文档里的行为。Modelflare 这条路由有没有同一种回退,以响应里的模型名为准。拒答和传输错误要分开处理。计费是否发生,还要看拒答类别。发布页同时写明,Sonnet 5.5 可以提供零数据保留。

切换流量前要核对的事

  1. 固定 claude-sonnet-5-5。完成结果里的模型名也要核对,防护回退时,作答的模型可以是 Sonnet 5。
  2. 确认密钥分组是上表四个公开分组之一,并按失败成本来选。
  3. 用同一份不含敏感信息的集合,分别在 low、medium、high、xhigh 和 max 上回放。记录成功率、延迟、输入、缓存读取、缓存写入、输出和费用。
  4. effort 放在 Messages 请求的 output_config.effort 里。不要用 Chat Completions 的 reasoning_effort 来设置这一款的思考档。
  5. 原来发送 disabled、强制工具选择、手动思考预算或 computer_20251124 的客户端,先改再放量。
  6. 重放思考块的对话保持只追加。
  7. 把 HTTP 200 的拒答和传输失败分开计数。
  8. 用一条短提示和一条会命中缓存的提示核对入账金额。官网的 1 小时写入价和批量五折,都以用量记录为准。
  9. 复杂、开放、需要持续判断的任务继续用 claude-opus-5-5。claude-sonnet-5 继续可用。

来源

核对日期:2026 年 9 月 30 日。Modelflare 没有独立复现基准。