Claude Sonnet 5.5: especificações, preço e acesso na Modelflare
Relato com fontes sobre claude-sonnet-5-5: especificações publicadas, preços oficiais por token, como ler a tabela de benchmarks de 28 de setembro de 2026 e os grupos e preços de utilizador da Modelflare devolvidos em 30 de setembro de 2026.
A Anthropic lançou o Claude Sonnet 5.5 em 28 de setembro de 2026. O ID do modelo na API é claude-sonnet-5-5. É o segundo modelo da família Claude 5.5. A Anthropic coloca-o ao lado do Opus 5.5: as tarefas do dia a dia de âmbito claro, as correções de bugs e os documentos, slides e folhas de cálculo ficam aqui; o trabalho complexo, aberto e que precisa de julgamento sustentado continua no Opus 5.5. O preço de tabela coincide com o do Sonnet 5, a $2 por milhão de tokens de entrada, $10 por milhão de tokens de saída e $0.20 por milhão de tokens de leitura de cache.
Este artigo mantém três camadas separadas. A especificação e as alterações que quebram a compatibilidade vêm da página do modelo, da página de novidades e do guia de migração. A tabela de benchmarks foi copiada da página de lançamento. A Modelflare não voltou a executar essas avaliações. Os grupos e os preços de utilizador vêm de GET https://modelflare.dev/api/pricing, lido em 30 de setembro de 2026. Afirmações do fornecedor como "até 30% mais barato" e "mais de 30% mais rápido" descrevem o próprio harness da Anthropic.
O que as fontes sustentam
No preço de tabela publicado, o Sonnet 5.5 é a mesma ficha de preços que o Sonnet 5. A entrada e a saída são metade do Opus 5.5. Nas linhas de programação e de trabalho de conhecimento impressas na página de lançamento, fica claramente acima do Sonnet 5. O Terminal-Bench 4.0, com 70.6%, fica acima dos 66.4% que essa página imprime para o Opus 5.5. O CursorBench 4.0, com 55.5%, e o GDPval-AA v2.1, com 1844, ficam junto do Opus 5.5 e abaixo dele. A Anthropic também diz que, no próprio uso e em testes externos, o Opus 5.5 continua mais forte no trabalho complexo, aberto e que precisa de julgamento sustentado.
Em 30 de setembro de 2026, a resposta de preços da Modelflare já continha claude-sonnet-5-5. Os preços unitários coincidem com as tarifas oficiais de entrada, saída, leitura de cache e escrita de cache de 5 minutos. Os grupos públicos são claude-award, claude-stable, claude-premium e claude-tmp-cheap. O aviso do site principal de 29 de setembro de 2026 nomeava os grupos abertos nesse dia, claude-award e claude-stable. Nesta leitura, a lista pública já incluía também os dois últimos.
Especificação publicada
| Item | Claude Sonnet 5.5 |
|---|---|
| ID da Claude API | claude-sonnet-5-5 |
| ID do Amazon Bedrock | anthropic.claude-sonnet-5-5 |
| Google Cloud, Microsoft Foundry, Claude Platform on AWS | claude-sonnet-5-5 |
| Data de lançamento | 28 de setembro de 2026 |
| Compromisso de retirada | Não antes de 28 de setembro de 2027 |
| Contexto / saída máxima síncrona | 1M / 128K tokens |
| Saída máxima da Batch API | 300K tokens, cabeçalho beta output-300k-2026-03-24 |
| Entrada para saída | Texto e imagens para texto |
| Pensamento | Adaptativo, ligado por predefinição |
| Effort predefinido na Claude API | high |
| Effort predefinido nas apps Claude e no Claude Code | medium |
| Valores de effort | low, medium, high, xhigh, max |
| Corte de conhecimento fiável | junho de 2026 |
| Prompt mínimo que pode ir para cache | 512 tokens |
| Tokenizador | O mesmo do Sonnet 5, pelo que o mesmo texto tem o mesmo número de tokens |
A página do modelo etiqueta a latência como Fast. É uma comparação dentro da linha atual da Claude, não um valor medido de tokens por segundo. A definição mais baixa que desliga o pensamento prévio é thinking: {"type": "between_tools"}, aceite apenas em low, medium e high. xhigh e max voltam ao pensamento adaptativo. Definir temperature, top_p ou top_k fora do valor predefinido devolve 400.
A página de lançamento diz que o Haiku 5.5 chega nas semanas seguintes. Este artigo não põe preço num ID que ainda não está disponível.
Preços oficiais
As quantias são dólares dos Estados Unidos por milhão de tokens. A coluna do Sonnet 5.5 é a página do modelo. A coluna do Opus 5.5 é a tabela de comparação da mesma página de lançamento. A página de novidades diz que o Sonnet 5.5 tem os mesmos preços que o Sonnet 5, incluindo a cache de prompts e o processamento Batch. O desconto de Batch é 50% na entrada e na saída.
| Por 1M de tokens | Sonnet 5.5 | Opus 5.5 na página de lançamento |
|---|---|---|
| Entrada | $2 | $4 |
| Saída | $10 | $20 |
| Leitura de cache | $0.20 | $0.20 |
| Escrita de cache | 5 minutos $2.50; 1 hora $4 | $5 |
| Entrada / saída de Batch | 50% do preço de tabela | Não consta nessa tabela |
A página de lançamento imprime um único valor de escrita de cache do Opus 5.5, $5, sem separar 5 minutos e 1 hora. A página do modelo do Sonnet 5.5 separa os dois. Face à entrada e à saída do Opus 5.5, esta ficha é metade. A leitura de cache é $0.20 nos dois.
A Anthropic publica ainda duas afirmações de carga de trabalho: o mesmo trabalho costuma gastar menos tokens, e a maioria das tarefas custa até 30% menos; a geração de saída é mais de 30% mais rápida do que o Sonnet 5. Os gráficos de custo acrescentam comparações por tarefa de cerca de um décimo, um quinto e um quinze avos. Esses resultados pertencem ao harness deles. Uma fatura real continua a depender do effort, dos acertos de cache, das rondas de ferramentas e de a chamada ter usado Batch.
Como ler os benchmarks
A tabela abaixo é a que a página de lançamento imprime. Um travessão é uma célula vazia dessa página. Os gráficos de custo do Terminal-Bench 4.0 e do CursorBench 4.0 usam o GPT-5.6 Sol porque a OpenAI não tinha publicado o GPT-6 Sol nesses dois. Este artigo não copia um ponto do gráfico do GPT-5.6 Sol para a coluna do GPT-6 Sol. A Modelflare não voltou a executar os testes.
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4% | — |
| FrontierCode v1.1, Main | 46.2% (max); 52.1% (xhigh) | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487 |
| AA-Briefcase v1.1 | 1811 | 1359 | 1822 | 1483 |
| Humanity's Last Exam, com ferramentas | 64.5% | 54.9% | 67.7% | — |
| OSWorld 2.1, partial | 80.1% | 57.0% | 81.8% | — |
| Chartography, sem ferramentas | 61.6% | 15.6% | 64.4% | 53.6% |
As notas de rodapé ficam ao lado das pontuações. O Opus 5.5 no Terminal-Bench 4.0 está em xhigh, a que a página de lançamento chama a pontuação mais alta desse modelo. No FrontierCode, o Sonnet 5.5 em max pontua abaixo de xhigh. A página de lançamento explica que max executa mais vezes uma revisão de código e que, ao repartir a revisão por vários subagentes, apareceram tempos de espera e também alterações fora do âmbito da tarefa, que esta avaliação penaliza. A Artificial Analysis executou o GDPval-AA e o AA-Briefcase numa implantação anterior à publicação que tinha um defeito capaz de baixar as saídas estruturadas. A página de lançamento diz que o defeito foi corrigido depois e que, se houve efeito, a direção foi subestimar o Sonnet 5.5. As células do GPT-6 Sol para GDPval-AA, AA-Briefcase e Chartography trazem outra nota: a OpenAI tinha corrigido um defeito que prejudicava a compreensão de imagens, e essas pontuações externas talvez ainda não tivessem sido atualizadas.
Os gráficos de custo da mesma página são outra leitura. O effort Medium é a predefinição nas apps Claude. Em vários benchmarks, o Sonnet 5.5 em Low ou Medium supera a melhor pontuação do Sonnet 5 a cerca de um décimo do custo por tarefa. O effort High é a predefinição na Claude Platform. A página de lançamento diz que, no FrontierCode em High, pontua cerca de 10 pontos acima do Sonnet 5 na mesma definição, a cerca de um quinze avos do custo por tarefa, e que iguala a melhor pontuação do GPT-6 Sol a cerca de um quinto do custo. No CursorBench em Low supera a melhor pontuação do Sonnet 5 a menos de um décimo do custo. No AA-Briefcase em Medium supera a melhor pontuação do Sonnet 5 a cerca de um nono do custo. Os 55.5% e os 1844 impressos são os pontos da tabela. As frases de custo são outro harness. As citações de clientes selecionadas na página de lançamento podem indicar o que convém reproduzir. Não fazem parte desta tabela.
A página de lançamento também diz que esta é a primeira Sonnet a vencer o Pokémon Red só com capturas de ecrã. É a narrativa de produto do fornecedor, não uma linha da tabela acima.
Preços e grupos na Modelflare
Na resposta de preços de 30 de setembro de 2026, claude-sonnet-5-5 tem input_price 2 e completion_ratio 5, pelo que a saída é $10. cache_ratio é 0.1, pelo que uma leitura de cache é $0.20. create_cache_ratio é 1.25, pelo que a escrita de cache do catálogo é $2.50. A linha não tem billing_mode nem um preço separado de escrita de 1 hora. Não multiplique os $4 oficiais de 1 hora, nem o meio preço de Batch, por um rácio de grupo e não trate o produto como a cobrança registada. O registo de utilização é a cobrança.
Os tipos de endpoint são anthropic e openai. O grupo escolhe-se na chave de API. Os quatro grupos públicos chamam o mesmo ID de modelo.
Tabela de preços
| Grupo | Rácio | Entrada / 1M | Leitura de cache / 1M | Escrita de cache do catálogo / 1M | Saída / 1M | Descrição do catálogo nesse dia |
|---|---|---|---|---|---|---|
claude-award |
0.25 | $0.50 | $0.05 | $0.625 | $2.50 | Encaminhamento com prioridade ao preço para desenvolvimento, testes e cargas flexíveis, sensíveis ao orçamento e passíveis de nova tentativa |
claude-stable |
0.315 | $0.63 | $0.063 | $0.7875 | $3.15 | Desenvolvimento individual, projetos de maior duração e aplicações de produção em que a estabilidade importa |
claude-premium |
0.5 | $1.00 | $0.10 | $1.25 | $5.00 | Prioridade à continuidade e ao sucesso do pedido, a 50% do preço de tabela oficial |
claude-tmp-cheap |
0.06 | $0.12 | $0.012 | $0.15 | $0.60 | Rota promocional por tempo limitado |
A aritmética é o preço unitário do catálogo vezes o rácio do grupo. Em claude-stable, $0.63 é $2 × 0.315, e a escrita de cache de $0.7875 é $2.50 × 0.315. A descrição é o texto da definição do grupo. Não é um acordo medido de disponibilidade.
A mesma resposta também lista o claude-first-topup não público, com rácio 0.03, descrito como desbloqueado quando um único carregamento atinge $50. Não é um grupo público selecionável, por isso não tem linha acima. Quando uma chave tem também grupos de fallback, um pedido que sai do grupo da campanha é faturado no grupo que o serve.
Três exemplos
Cada forma são 100,000 tokens da classe de entrada indicada mais 5,000 tokens de saída. As linhas de cache pressupõem que o registo de utilização classifica mesmo esses tokens como leitura ou como escrita. Em quantias pequenas, o arredondamento da quota pode mover o valor registado.
| Pedido | Preço de tabela | claude-award |
claude-stable |
claude-premium |
claude-tmp-cheap |
|---|---|---|---|---|---|
| 100,000 de entrada sem cache, 5,000 de saída | $0.2500 | $0.0625 | $0.07875 | $0.1250 | $0.0150 |
| 100,000 de leitura de cache, 5,000 de saída | $0.0700 | $0.0175 | $0.02205 | $0.0350 | $0.0042 |
| 100,000 de escrita de cache do catálogo, 5,000 de saída | $0.3000 | $0.0750 | $0.0945 | $0.1500 | $0.0180 |
O preço de tabela da primeira linha é 0.1 × $2 + 0.005 × $10. Cada célula de grupo é esses $0.25 vezes o rácio. A terceira linha usa o preço de escrita do catálogo de $2.50, o escalão oficial de 5 minutos, e não os $4 de 1 hora. A página em tempo real é a página de preços de claude-sonnet-5-5. O catálogo completo é Modelos e preços.
Quando uma falha sai cara, o catálogo descreve claude-premium como a rota de continuidade. Para a produção do dia a dia e os projetos mais longos, o catálogo descreve claude-stable como esse tipo de predefinição. O desenvolvimento e os testes que admitem nova tentativa usam claude-award. claude-tmp-cheap é a rota promocional por tempo limitado, com rácio 0.06. Escolha o grupo pelo custo da falha e leia o rácio junto com essa descrição, não apenas o rácio.
Como o chamar na Modelflare
Crie uma chave num dos quatro grupos da tabela. Envie o ID do modelo claude-sonnet-5-5 exatamente. O URL de base canónico é https://modelflare.dev/v1. A mesma API também está publicada em https://cf.modelflare.dev/v1 e em https://origin.modelflare.dev/v1. O domínio de raiz é o site canónico.
A Messages API é a entrada que define o effort. O pedido abaixo deixa o pensamento em adaptativo e define o effort como medium. max_tokens tem de deixar espaço para os blocos de pensamento.
export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 1024,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [
{
"role": "user",
"content": "Reveja este plano de migração e liste as três hipóteses que mais precisam de um teste."
}
]
}'
As Chat Completions também estão listadas neste ID. Este exemplo envia apenas texto e não define reasoning_effort.
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"messages": [
{
"role": "user",
"content": "Reveja este plano de migração e liste as três hipóteses que mais precisam de um teste."
}
]
}'
Para escolher um effort, use o pedido Messages acima. O gateway converte hoje o reasoning_effort das Chat Completions num orçamento manual de pensamento com budget_tokens, e o Sonnet 5.5 rejeita um orçamento manual. Quando o effort é omitido, a predefinição da Claude API é high. A diferença entre as duas entradas está em Responses API vs Chat Completions. Como a utilização corresponde à fatura está em Acompanhamento de custos da API de IA.
Migrar a partir do Sonnet 5
A página de novidades lista cinco alterações que fazem o código que já corria no Sonnet 5 devolver 400, mais uma alteração que deixa o pedido bem-sucedido e muda a forma da resposta.
Pedidos que devolvem 400
thinking: {"type": "disabled"}
thinking: {"type": "enabled", "budget_tokens": N}
thinking: {"type": "between_tools"} com effort xhigh ou max
tool_choice: {"type": "any"}
tool_choice: {"type": "tool", "name": "..."}
temperature, top_p ou top_k fora do valor predefinido
tipo de ferramenta computer_20251124 na Claude API e no Google Cloud
ferramenta advisor a usar Opus 4.8, Opus 4.7 ou Sonnet 5 como advisor
Para desligar o pensamento prévio, envie between_tools e mantenha o effort em high ou abaixo. Mantenha tool_choice em auto ou none. Para obter uma entrada de ferramenta válida face ao schema, ative strict, ou passe o schema para saídas estruturadas, e diga no prompt quando a ferramenta se aplica. Na Claude API e no Google Cloud, o uso de computador passa para computer_toolset_20260801. O Amazon Bedrock continua a aceitar computer_20251124. A ferramenta advisor aceita Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5, ou o próprio Sonnet 5.5. O conteúdo do advisor volta cifrado, e o cliente não consegue ler o texto.
As contas criadas em 31 de agosto de 2026, 00:00 UTC, ou depois, têm mais um 400 na Claude API, no Amazon Bedrock e no Google Cloud: reproduzir um bloco de pensamento do Sonnet 5.5 depois de uma alteração ao prompt de sistema, à lista de ferramentas ou a uma mensagem anterior falha. Mantenha a conversa apenas com acréscimos. Quando as instruções tiverem de mudar, use uma mensagem de sistema a meio da conversa.
Comportamento que muda numa resposta bem-sucedida
Quando o effort é omitido, a API corre em high. A mesma palavra não compra a mesma quantidade de pensamento que comprava no Sonnet 5. A página de novidades diz para varrer de novo o effort, em vez de copiar a definição antiga. Um ciclo de ferramentas de âmbito claro pode começar em medium, e um mais longo ou mais difícil pode subir para high. Um chat sensível à latência pode começar em medium ou em low.
O texto de progresso com mais de uma frase ou duas entre chamadas de ferramentas volta dentro dos blocos de pensamento. Com o display predefinido em omitted, o texto desses blocos está vazio, por isso a interface fica em silêncio entre ferramentas enquanto o pedido continua a ter sucesso. Defina display quando o produto precisar dessas linhas. Com between_tools, esse texto volta.
Um bloco de pensamento regista o modelo que o produziu. O Sonnet 5.5 lê blocos de pensamento do Sonnet 5, do Opus 4.8, do Haiku 4.5 e de modelos anteriores. Não lê blocos do Opus 5, do Opus 5.5, do Fable nem do Mythos. Nenhum outro modelo lê os blocos de pensamento do Sonnet 5.5. Um bloco que o modelo de destino não consegue ler é descartado antes de o modelo o ver, e um bloco descartado não é faturado. Um bloco que o Sonnet 5.5 produz fica também ligado à conta que o produziu. Reproduzi-lo a partir de uma conta não associada descarta o bloco, e o pedido continua a ter sucesso.
Recusa e fallback
Um pedido recusado devolve HTTP 200 com stop_reason em "refusal". As categorias nomeadas na página de novidades são cyber, bio, frontier_llm, reasoning_extraction e general_harms. A página de lançamento diz que a capacidade de cibersegurança se aproxima do Opus 5, por isso esta é a primeira Sonnet a sair com essa classe de proteções de cibersegurança. As tarefas de cibersegurança de maior risco recuam para o Sonnet 5. As proteções biológicas coincidem com as do Sonnet 5. O desenvolvimento de software habitual e a maior parte do trabalho de ciências da vida ficam fora dessas duas proteções estreitas.
A página de novidades diz que o fallback predefinido da beta da Claude API volta a tentar cyber e frontier_llm no Sonnet 5, e não volta a tentar bio, reasoning_extraction nem general_harms. Esse é o comportamento documentado pela Anthropic. Se esta rota da Modelflare faz o mesmo fallback, a resposta está no nome do modelo na resposta. Conte as recusas à parte das falhas de transporte. Se uma recusa é faturada depende da categoria. A página de lançamento também diz que o Sonnet 5.5 está disponível com retenção zero de dados.
Verificações antes de mudar o tráfego
- Fixe
claude-sonnet-5-5. Verifique também o nome do modelo no resultado concluído. Um fallback da proteção pode responder como Sonnet 5. - Confirme que o grupo da chave é um dos quatro grupos públicos da tabela, e escolha-o pelo custo da falha.
- Reproduza um conjunto sem dados sensíveis em
low,medium,high,xhighemax. Registe o sucesso, a latência, a entrada, as leituras de cache, as escritas de cache, a saída e a cobrança. - Ponha o effort em
output_config.effortno pedido Messages. Não use oreasoning_effortdas Chat Completions para definir o nível de pensamento deste modelo. - Altere os clientes que ainda enviam
disabled, uma escolha forçada de ferramenta, um orçamento manual de pensamento oucomputer_20251124antes de aumentar o volume. - Mantenha apenas com acréscimos as conversas que reproduzem blocos de pensamento.
- Conte as recusas HTTP 200 à parte das falhas de transporte.
- Calcule o preço de um prompt curto e de um prompt que devia acertar na cache, e depois leia o valor registado. O preço oficial de escrita de 1 hora e o meio preço de Batch seguem o registo de utilização.
- Deixe o trabalho complexo, aberto e que precisa de julgamento sustentado em
claude-opus-5-5.claude-sonnet-5continua disponível.
Fontes
Verificado em 30 de setembro de 2026. A Modelflare não reproduziu de forma independente os benchmarks.
- Página de lançamento, 28 de setembro de 2026: https://www.anthropic.com/claude-sonnet-5-5
- Página do modelo: https://platform.claude.com/docs/en/models/sonnet-5-5/overview
- Novidades: https://platform.claude.com/docs/en/models/sonnet-5-5/whats-new-sonnet-5-5
- Guia de migração: https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide
- API de preços da Modelflare: https://modelflare.dev/api/pricing
- Página de preços: https://modelflare.dev/pricing/claude-sonnet-5-5