Claude Sonnet 5.5: especificações, preço e acesso na Modelflare

Relato com fontes sobre claude-sonnet-5-5: especificações publicadas, preços oficiais por token, como ler a tabela de benchmarks de 28 de setembro de 2026 e os grupos e preços de utilizador da Modelflare devolvidos em 30 de setembro de 2026.

A Anthropic lançou o Claude Sonnet 5.5 em 28 de setembro de 2026. O ID do modelo na API é claude-sonnet-5-5. É o segundo modelo da família Claude 5.5. A Anthropic coloca-o ao lado do Opus 5.5: as tarefas do dia a dia de âmbito claro, as correções de bugs e os documentos, slides e folhas de cálculo ficam aqui; o trabalho complexo, aberto e que precisa de julgamento sustentado continua no Opus 5.5. O preço de tabela coincide com o do Sonnet 5, a $2 por milhão de tokens de entrada, $10 por milhão de tokens de saída e $0.20 por milhão de tokens de leitura de cache.

Este artigo mantém três camadas separadas. A especificação e as alterações que quebram a compatibilidade vêm da página do modelo, da página de novidades e do guia de migração. A tabela de benchmarks foi copiada da página de lançamento. A Modelflare não voltou a executar essas avaliações. Os grupos e os preços de utilizador vêm de GET https://modelflare.dev/api/pricing, lido em 30 de setembro de 2026. Afirmações do fornecedor como "até 30% mais barato" e "mais de 30% mais rápido" descrevem o próprio harness da Anthropic.

O que as fontes sustentam

No preço de tabela publicado, o Sonnet 5.5 é a mesma ficha de preços que o Sonnet 5. A entrada e a saída são metade do Opus 5.5. Nas linhas de programação e de trabalho de conhecimento impressas na página de lançamento, fica claramente acima do Sonnet 5. O Terminal-Bench 4.0, com 70.6%, fica acima dos 66.4% que essa página imprime para o Opus 5.5. O CursorBench 4.0, com 55.5%, e o GDPval-AA v2.1, com 1844, ficam junto do Opus 5.5 e abaixo dele. A Anthropic também diz que, no próprio uso e em testes externos, o Opus 5.5 continua mais forte no trabalho complexo, aberto e que precisa de julgamento sustentado.

Em 30 de setembro de 2026, a resposta de preços da Modelflare já continha claude-sonnet-5-5. Os preços unitários coincidem com as tarifas oficiais de entrada, saída, leitura de cache e escrita de cache de 5 minutos. Os grupos públicos são claude-award, claude-stable, claude-premium e claude-tmp-cheap. O aviso do site principal de 29 de setembro de 2026 nomeava os grupos abertos nesse dia, claude-award e claude-stable. Nesta leitura, a lista pública já incluía também os dois últimos.

Especificação publicada

Item Claude Sonnet 5.5
ID da Claude API claude-sonnet-5-5
ID do Amazon Bedrock anthropic.claude-sonnet-5-5
Google Cloud, Microsoft Foundry, Claude Platform on AWS claude-sonnet-5-5
Data de lançamento 28 de setembro de 2026
Compromisso de retirada Não antes de 28 de setembro de 2027
Contexto / saída máxima síncrona 1M / 128K tokens
Saída máxima da Batch API 300K tokens, cabeçalho beta output-300k-2026-03-24
Entrada para saída Texto e imagens para texto
Pensamento Adaptativo, ligado por predefinição
Effort predefinido na Claude API high
Effort predefinido nas apps Claude e no Claude Code medium
Valores de effort low, medium, high, xhigh, max
Corte de conhecimento fiável junho de 2026
Prompt mínimo que pode ir para cache 512 tokens
Tokenizador O mesmo do Sonnet 5, pelo que o mesmo texto tem o mesmo número de tokens

A página do modelo etiqueta a latência como Fast. É uma comparação dentro da linha atual da Claude, não um valor medido de tokens por segundo. A definição mais baixa que desliga o pensamento prévio é thinking: {"type": "between_tools"}, aceite apenas em low, medium e high. xhigh e max voltam ao pensamento adaptativo. Definir temperature, top_p ou top_k fora do valor predefinido devolve 400.

A página de lançamento diz que o Haiku 5.5 chega nas semanas seguintes. Este artigo não põe preço num ID que ainda não está disponível.

Preços oficiais

As quantias são dólares dos Estados Unidos por milhão de tokens. A coluna do Sonnet 5.5 é a página do modelo. A coluna do Opus 5.5 é a tabela de comparação da mesma página de lançamento. A página de novidades diz que o Sonnet 5.5 tem os mesmos preços que o Sonnet 5, incluindo a cache de prompts e o processamento Batch. O desconto de Batch é 50% na entrada e na saída.

Por 1M de tokens Sonnet 5.5 Opus 5.5 na página de lançamento
Entrada $2 $4
Saída $10 $20
Leitura de cache $0.20 $0.20
Escrita de cache 5 minutos $2.50; 1 hora $4 $5
Entrada / saída de Batch 50% do preço de tabela Não consta nessa tabela

A página de lançamento imprime um único valor de escrita de cache do Opus 5.5, $5, sem separar 5 minutos e 1 hora. A página do modelo do Sonnet 5.5 separa os dois. Face à entrada e à saída do Opus 5.5, esta ficha é metade. A leitura de cache é $0.20 nos dois.

A Anthropic publica ainda duas afirmações de carga de trabalho: o mesmo trabalho costuma gastar menos tokens, e a maioria das tarefas custa até 30% menos; a geração de saída é mais de 30% mais rápida do que o Sonnet 5. Os gráficos de custo acrescentam comparações por tarefa de cerca de um décimo, um quinto e um quinze avos. Esses resultados pertencem ao harness deles. Uma fatura real continua a depender do effort, dos acertos de cache, das rondas de ferramentas e de a chamada ter usado Batch.

Como ler os benchmarks

A tabela abaixo é a que a página de lançamento imprime. Um travessão é uma célula vazia dessa página. Os gráficos de custo do Terminal-Bench 4.0 e do CursorBench 4.0 usam o GPT-5.6 Sol porque a OpenAI não tinha publicado o GPT-6 Sol nesses dois. Este artigo não copia um ponto do gráfico do GPT-5.6 Sol para a coluna do GPT-6 Sol. A Modelflare não voltou a executar os testes.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4% —
FrontierCode v1.1, Main 46.2% (max); 52.1% (xhigh) 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% —
GDPval-AA v2.1 1844 1449 1846 1487
AA-Briefcase v1.1 1811 1359 1822 1483
Humanity's Last Exam, com ferramentas 64.5% 54.9% 67.7% —
OSWorld 2.1, partial 80.1% 57.0% 81.8% —
Chartography, sem ferramentas 61.6% 15.6% 64.4% 53.6%

As notas de rodapé ficam ao lado das pontuações. O Opus 5.5 no Terminal-Bench 4.0 está em xhigh, a que a página de lançamento chama a pontuação mais alta desse modelo. No FrontierCode, o Sonnet 5.5 em max pontua abaixo de xhigh. A página de lançamento explica que max executa mais vezes uma revisão de código e que, ao repartir a revisão por vários subagentes, apareceram tempos de espera e também alterações fora do âmbito da tarefa, que esta avaliação penaliza. A Artificial Analysis executou o GDPval-AA e o AA-Briefcase numa implantação anterior à publicação que tinha um defeito capaz de baixar as saídas estruturadas. A página de lançamento diz que o defeito foi corrigido depois e que, se houve efeito, a direção foi subestimar o Sonnet 5.5. As células do GPT-6 Sol para GDPval-AA, AA-Briefcase e Chartography trazem outra nota: a OpenAI tinha corrigido um defeito que prejudicava a compreensão de imagens, e essas pontuações externas talvez ainda não tivessem sido atualizadas.

Os gráficos de custo da mesma página são outra leitura. O effort Medium é a predefinição nas apps Claude. Em vários benchmarks, o Sonnet 5.5 em Low ou Medium supera a melhor pontuação do Sonnet 5 a cerca de um décimo do custo por tarefa. O effort High é a predefinição na Claude Platform. A página de lançamento diz que, no FrontierCode em High, pontua cerca de 10 pontos acima do Sonnet 5 na mesma definição, a cerca de um quinze avos do custo por tarefa, e que iguala a melhor pontuação do GPT-6 Sol a cerca de um quinto do custo. No CursorBench em Low supera a melhor pontuação do Sonnet 5 a menos de um décimo do custo. No AA-Briefcase em Medium supera a melhor pontuação do Sonnet 5 a cerca de um nono do custo. Os 55.5% e os 1844 impressos são os pontos da tabela. As frases de custo são outro harness. As citações de clientes selecionadas na página de lançamento podem indicar o que convém reproduzir. Não fazem parte desta tabela.

A página de lançamento também diz que esta é a primeira Sonnet a vencer o Pokémon Red só com capturas de ecrã. É a narrativa de produto do fornecedor, não uma linha da tabela acima.

Preços e grupos na Modelflare

Na resposta de preços de 30 de setembro de 2026, claude-sonnet-5-5 tem input_price 2 e completion_ratio 5, pelo que a saída é $10. cache_ratio é 0.1, pelo que uma leitura de cache é $0.20. create_cache_ratio é 1.25, pelo que a escrita de cache do catálogo é $2.50. A linha não tem billing_mode nem um preço separado de escrita de 1 hora. Não multiplique os $4 oficiais de 1 hora, nem o meio preço de Batch, por um rácio de grupo e não trate o produto como a cobrança registada. O registo de utilização é a cobrança.

Os tipos de endpoint são anthropic e openai. O grupo escolhe-se na chave de API. Os quatro grupos públicos chamam o mesmo ID de modelo.

Tabela de preços

Grupo Rácio Entrada / 1M Leitura de cache / 1M Escrita de cache do catálogo / 1M Saída / 1M Descrição do catálogo nesse dia
claude-award 0.25 $0.50 $0.05 $0.625 $2.50 Encaminhamento com prioridade ao preço para desenvolvimento, testes e cargas flexíveis, sensíveis ao orçamento e passíveis de nova tentativa
claude-stable 0.315 $0.63 $0.063 $0.7875 $3.15 Desenvolvimento individual, projetos de maior duração e aplicações de produção em que a estabilidade importa
claude-premium 0.5 $1.00 $0.10 $1.25 $5.00 Prioridade à continuidade e ao sucesso do pedido, a 50% do preço de tabela oficial
claude-tmp-cheap 0.06 $0.12 $0.012 $0.15 $0.60 Rota promocional por tempo limitado

A aritmética é o preço unitário do catálogo vezes o rácio do grupo. Em claude-stable, $0.63 é $2 × 0.315, e a escrita de cache de $0.7875 é $2.50 × 0.315. A descrição é o texto da definição do grupo. Não é um acordo medido de disponibilidade.

A mesma resposta também lista o claude-first-topup não público, com rácio 0.03, descrito como desbloqueado quando um único carregamento atinge $50. Não é um grupo público selecionável, por isso não tem linha acima. Quando uma chave tem também grupos de fallback, um pedido que sai do grupo da campanha é faturado no grupo que o serve.

Três exemplos

Cada forma são 100,000 tokens da classe de entrada indicada mais 5,000 tokens de saída. As linhas de cache pressupõem que o registo de utilização classifica mesmo esses tokens como leitura ou como escrita. Em quantias pequenas, o arredondamento da quota pode mover o valor registado.

Pedido Preço de tabela claude-award claude-stable claude-premium claude-tmp-cheap
100,000 de entrada sem cache, 5,000 de saída $0.2500 $0.0625 $0.07875 $0.1250 $0.0150
100,000 de leitura de cache, 5,000 de saída $0.0700 $0.0175 $0.02205 $0.0350 $0.0042
100,000 de escrita de cache do catálogo, 5,000 de saída $0.3000 $0.0750 $0.0945 $0.1500 $0.0180

O preço de tabela da primeira linha é 0.1 × $2 + 0.005 × $10. Cada célula de grupo é esses $0.25 vezes o rácio. A terceira linha usa o preço de escrita do catálogo de $2.50, o escalão oficial de 5 minutos, e não os $4 de 1 hora. A página em tempo real é a página de preços de claude-sonnet-5-5. O catálogo completo é Modelos e preços.

Quando uma falha sai cara, o catálogo descreve claude-premium como a rota de continuidade. Para a produção do dia a dia e os projetos mais longos, o catálogo descreve claude-stable como esse tipo de predefinição. O desenvolvimento e os testes que admitem nova tentativa usam claude-award. claude-tmp-cheap é a rota promocional por tempo limitado, com rácio 0.06. Escolha o grupo pelo custo da falha e leia o rácio junto com essa descrição, não apenas o rácio.

Como o chamar na Modelflare

Crie uma chave num dos quatro grupos da tabela. Envie o ID do modelo claude-sonnet-5-5 exatamente. O URL de base canónico é https://modelflare.dev/v1. A mesma API também está publicada em https://cf.modelflare.dev/v1 e em https://origin.modelflare.dev/v1. O domínio de raiz é o site canónico.

A Messages API é a entrada que define o effort. O pedido abaixo deixa o pensamento em adaptativo e define o effort como medium. max_tokens tem de deixar espaço para os blocos de pensamento.

export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"

curl -sS https://modelflare.dev/v1/messages \
  -H "x-api-key: $MODELFLARE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 1024,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Reveja este plano de migração e liste as três hipóteses que mais precisam de um teste."
      }
    ]
  }'

As Chat Completions também estão listadas neste ID. Este exemplo envia apenas texto e não define reasoning_effort.

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "messages": [
      {
        "role": "user",
        "content": "Reveja este plano de migração e liste as três hipóteses que mais precisam de um teste."
      }
    ]
  }'

Para escolher um effort, use o pedido Messages acima. O gateway converte hoje o reasoning_effort das Chat Completions num orçamento manual de pensamento com budget_tokens, e o Sonnet 5.5 rejeita um orçamento manual. Quando o effort é omitido, a predefinição da Claude API é high. A diferença entre as duas entradas está em Responses API vs Chat Completions. Como a utilização corresponde à fatura está em Acompanhamento de custos da API de IA.

Migrar a partir do Sonnet 5

A página de novidades lista cinco alterações que fazem o código que já corria no Sonnet 5 devolver 400, mais uma alteração que deixa o pedido bem-sucedido e muda a forma da resposta.

Pedidos que devolvem 400

thinking: {"type": "disabled"}
thinking: {"type": "enabled", "budget_tokens": N}
thinking: {"type": "between_tools"} com effort xhigh ou max
tool_choice: {"type": "any"}
tool_choice: {"type": "tool", "name": "..."}
temperature, top_p ou top_k fora do valor predefinido
tipo de ferramenta computer_20251124 na Claude API e no Google Cloud
ferramenta advisor a usar Opus 4.8, Opus 4.7 ou Sonnet 5 como advisor

Para desligar o pensamento prévio, envie between_tools e mantenha o effort em high ou abaixo. Mantenha tool_choice em auto ou none. Para obter uma entrada de ferramenta válida face ao schema, ative strict, ou passe o schema para saídas estruturadas, e diga no prompt quando a ferramenta se aplica. Na Claude API e no Google Cloud, o uso de computador passa para computer_toolset_20260801. O Amazon Bedrock continua a aceitar computer_20251124. A ferramenta advisor aceita Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5, ou o próprio Sonnet 5.5. O conteúdo do advisor volta cifrado, e o cliente não consegue ler o texto.

As contas criadas em 31 de agosto de 2026, 00:00 UTC, ou depois, têm mais um 400 na Claude API, no Amazon Bedrock e no Google Cloud: reproduzir um bloco de pensamento do Sonnet 5.5 depois de uma alteração ao prompt de sistema, à lista de ferramentas ou a uma mensagem anterior falha. Mantenha a conversa apenas com acréscimos. Quando as instruções tiverem de mudar, use uma mensagem de sistema a meio da conversa.

Comportamento que muda numa resposta bem-sucedida

Quando o effort é omitido, a API corre em high. A mesma palavra não compra a mesma quantidade de pensamento que comprava no Sonnet 5. A página de novidades diz para varrer de novo o effort, em vez de copiar a definição antiga. Um ciclo de ferramentas de âmbito claro pode começar em medium, e um mais longo ou mais difícil pode subir para high. Um chat sensível à latência pode começar em medium ou em low.

O texto de progresso com mais de uma frase ou duas entre chamadas de ferramentas volta dentro dos blocos de pensamento. Com o display predefinido em omitted, o texto desses blocos está vazio, por isso a interface fica em silêncio entre ferramentas enquanto o pedido continua a ter sucesso. Defina display quando o produto precisar dessas linhas. Com between_tools, esse texto volta.

Um bloco de pensamento regista o modelo que o produziu. O Sonnet 5.5 lê blocos de pensamento do Sonnet 5, do Opus 4.8, do Haiku 4.5 e de modelos anteriores. Não lê blocos do Opus 5, do Opus 5.5, do Fable nem do Mythos. Nenhum outro modelo lê os blocos de pensamento do Sonnet 5.5. Um bloco que o modelo de destino não consegue ler é descartado antes de o modelo o ver, e um bloco descartado não é faturado. Um bloco que o Sonnet 5.5 produz fica também ligado à conta que o produziu. Reproduzi-lo a partir de uma conta não associada descarta o bloco, e o pedido continua a ter sucesso.

Recusa e fallback

Um pedido recusado devolve HTTP 200 com stop_reason em "refusal". As categorias nomeadas na página de novidades são cyber, bio, frontier_llm, reasoning_extraction e general_harms. A página de lançamento diz que a capacidade de cibersegurança se aproxima do Opus 5, por isso esta é a primeira Sonnet a sair com essa classe de proteções de cibersegurança. As tarefas de cibersegurança de maior risco recuam para o Sonnet 5. As proteções biológicas coincidem com as do Sonnet 5. O desenvolvimento de software habitual e a maior parte do trabalho de ciências da vida ficam fora dessas duas proteções estreitas.

A página de novidades diz que o fallback predefinido da beta da Claude API volta a tentar cyber e frontier_llm no Sonnet 5, e não volta a tentar bio, reasoning_extraction nem general_harms. Esse é o comportamento documentado pela Anthropic. Se esta rota da Modelflare faz o mesmo fallback, a resposta está no nome do modelo na resposta. Conte as recusas à parte das falhas de transporte. Se uma recusa é faturada depende da categoria. A página de lançamento também diz que o Sonnet 5.5 está disponível com retenção zero de dados.

Verificações antes de mudar o tráfego

  1. Fixe claude-sonnet-5-5. Verifique também o nome do modelo no resultado concluído. Um fallback da proteção pode responder como Sonnet 5.
  2. Confirme que o grupo da chave é um dos quatro grupos públicos da tabela, e escolha-o pelo custo da falha.
  3. Reproduza um conjunto sem dados sensíveis em low, medium, high, xhigh e max. Registe o sucesso, a latência, a entrada, as leituras de cache, as escritas de cache, a saída e a cobrança.
  4. Ponha o effort em output_config.effort no pedido Messages. Não use o reasoning_effort das Chat Completions para definir o nível de pensamento deste modelo.
  5. Altere os clientes que ainda enviam disabled, uma escolha forçada de ferramenta, um orçamento manual de pensamento ou computer_20251124 antes de aumentar o volume.
  6. Mantenha apenas com acréscimos as conversas que reproduzem blocos de pensamento.
  7. Conte as recusas HTTP 200 à parte das falhas de transporte.
  8. Calcule o preço de um prompt curto e de um prompt que devia acertar na cache, e depois leia o valor registado. O preço oficial de escrita de 1 hora e o meio preço de Batch seguem o registo de utilização.
  9. Deixe o trabalho complexo, aberto e que precisa de julgamento sustentado em claude-opus-5-5. claude-sonnet-5 continua disponível.

Fontes

Verificado em 30 de setembro de 2026. A Modelflare não reproduziu de forma independente os benchmarks.