Claude Sonnet 5.5 : spécifications, prix et accès Modelflare

Compte rendu sourcé de claude-sonnet-5-5 : spécifications publiées, prix officiels des tokens, lecture du tableau de benchmarks du 28 septembre 2026, et groupes ainsi que prix utilisateur Modelflare renvoyés le 30 septembre 2026.

Anthropic a publié Claude Sonnet 5.5 le 28 septembre 2026. L’ID de modèle de l’API est claude-sonnet-5-5. C’est le deuxième modèle de la famille Claude 5.5. Anthropic le place à côté d’Opus 5.5 : les tâches quotidiennes au périmètre net, les corrections de bugs, ainsi que les documents, les diapositives et les tableurs vont ici ; le travail complexe, ouvert et qui exige un jugement suivi reste sur Opus 5.5. Le prix catalogue est celui de Sonnet 5, à $2 par million de tokens d’entrée, $10 par million de tokens de sortie et $0.20 par million de tokens en lecture de cache.

Cet article tient trois couches séparées. La spécification et les changements incompatibles viennent de la page du modèle, de la page des nouveautés et du guide de migration. Le tableau de benchmarks est copié depuis la page de lancement. Modelflare n’a pas rejoué ces évaluations. Les groupes et les prix utilisateur viennent de GET https://modelflare.dev/api/pricing, lu le 30 septembre 2026. Des formules du fournisseur telles que « jusqu’à 30% de moins » et « 30%+ plus rapide » décrivent le harness propre d’Anthropic.

Conclusions après vérification

Au prix catalogue publié, Sonnet 5.5 est la même grille que Sonnet 5. L’entrée et la sortie valent la moitié d’Opus 5.5. Sur les lignes de programmation et de travail de connaissance imprimées par la page de lancement, il est nettement au-dessus de Sonnet 5. Terminal-Bench 4.0 à 70.6% est au-dessus des 66.4% imprimés là pour Opus 5.5. CursorBench 4.0 à 55.5% et GDPval-AA v2.1 à 1844 se tiennent juste à côté d’Opus 5.5, et en dessous. Anthropic écrit aussi que, dans son propre usage et dans les tests externes, Opus 5.5 reste plus fort pour le travail complexe, ouvert et qui exige un jugement suivi.

Le 30 septembre 2026, la réponse de tarifs de Modelflare contenait déjà claude-sonnet-5-5. Les prix unitaires correspondent aux tarifs officiels d’entrée, de sortie, de lecture de cache et d’écriture de cache sur 5 minutes. Les groupes publics sont claude-award, claude-stable, claude-premium et claude-tmp-cheap. L’annonce du site principal du 29 septembre 2026 nommait les groupes ouverts ce jour-là, claude-award et claude-stable. À cette lecture, la liste publique comprenait aussi les deux derniers.

Spécification publiée

Élément Claude Sonnet 5.5
ID de la Claude API claude-sonnet-5-5
ID Amazon Bedrock anthropic.claude-sonnet-5-5
Google Cloud, Microsoft Foundry, Claude Platform on AWS claude-sonnet-5-5
Date de publication 28 septembre 2026
Engagement de retrait Pas avant le 28 septembre 2027
Contexte / sortie synchrone maximale 1M / 128K tokens
Sortie maximale de la Batch API 300K tokens, en-tête bêta output-300k-2026-03-24
Entrée vers sortie Texte et images vers du texte
Réflexion Adaptative, active par défaut
Effort par défaut sur la Claude API high
Effort par défaut dans les applications Claude et Claude Code medium
Valeurs d’effort low, medium, high, xhigh, max
Coupure fiable des connaissances juin 2026
Prompt minimal pouvant être mis en cache 512 tokens
Tokenizer Identique à Sonnet 5, le même texte a le même nombre de tokens

La page du modèle qualifie la latence de Fast. C’est une comparaison à l’intérieur de la gamme Claude actuelle, pas un débit mesuré en tokens par seconde. Le réglage le plus bas qui coupe la réflexion préalable est thinking: {"type": "between_tools"}, accepté seulement à low, medium et high. xhigh et max doivent revenir à la réflexion adaptative. Régler temperature, top_p ou top_k hors de la valeur par défaut renvoie 400.

La page de lancement écrit que Haiku 5.5 suivra dans les semaines qui viennent. Cet article ne donne pas de prix à un ID qui n’est pas encore disponible.

Prix officiels

Les montants sont en dollars des États-Unis par million de tokens. La colonne Sonnet 5.5 est la page du modèle. La colonne Opus 5.5 est le tableau de comparaison de la même page de lancement. La page des nouveautés écrit que Sonnet 5.5 a les mêmes prix que Sonnet 5, cache de prompt et traitement par lot compris. La remise Batch est de 50% sur l’entrée et la sortie.

Par 1M de tokens Sonnet 5.5 Opus 5.5 sur la page de lancement
Entrée $2 $4
Sortie $10 $20
Lecture de cache $0.20 $0.20
Écriture de cache 5 minutes $2.50 ; 1 heure $4 $5
Entrée / sortie Batch 50% du prix catalogue Non imprimé dans ce tableau

La page de lancement imprime un seul chiffre d’écriture de cache pour Opus 5.5, $5, sans séparer 5 minutes et 1 heure. La page du modèle de Sonnet 5.5 sépare les deux paliers. Face à l’entrée et à la sortie d’Opus 5.5, cette grille vaut la moitié. La lecture de cache est de $0.20 pour les deux.

Anthropic publie aussi deux énoncés de charge : le même travail consomme en général moins de tokens, et la plupart des tâches coûtent jusqu’à 30% de moins ; la génération de sortie est 30%+ plus rapide que Sonnet 5. Les graphiques de coût ajoutent des comparaisons par tâche à environ un dixième, un cinquième et un quinzième. Ces résultats appartiennent à leur harness. Une facture réelle dépend encore de l’effort, des succès de cache, des tours d’outils et du fait que l’appel ait utilisé Batch.

Comment lire les benchmarks

Le tableau ci-dessous est celui qu’imprime la page de lancement. Un tiret est une cellule vide de cette page. Les graphiques de coût de Terminal-Bench 4.0 et de CursorBench 4.0 utilisent GPT-5.6 Sol, parce qu’OpenAI n’avait pas publié GPT-6 Sol sur ces deux-là. Cet article ne copie pas un point de graphique de GPT-5.6 Sol dans la colonne GPT-6 Sol. Modelflare n’a pas rejoué les tests.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4% —
FrontierCode v1.1, Main 46.2% (max); 52.1% (xhigh) 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% —
GDPval-AA v2.1 1844 1449 1846 1487
AA-Briefcase v1.1 1811 1359 1822 1483
Humanity's Last Exam, avec outils 64.5% 54.9% 67.7% —
OSWorld 2.1, partial 80.1% 57.0% 81.8% —
Chartography, sans outils 61.6% 15.6% 64.4% 53.6%

Les notes appartiennent à côté des scores. Opus 5.5 sur Terminal-Bench 4.0 est à xhigh, et la page de lancement appelle cela le score le plus haut de ce modèle. Sur FrontierCode, Sonnet 5.5 à max est en dessous de xhigh. La page de lancement explique que max lance plus souvent une revue de code ; une fois la revue répartie sur plusieurs sous-agents, un dépassement de délai et des modifications hors de la tâche se sont produits, et cette évaluation pénalise les modifications hors périmètre. Artificial Analysis a exécuté GDPval-AA et AA-Briefcase sur un déploiement de préversion qui avait un défaut pouvant abaisser la sortie structurée. La page de lancement écrit que le défaut a été corrigé ensuite et qu’un effet, s’il y en a un, sous-estimerait Sonnet 5.5. Les cellules GPT-6 Sol de GDPval-AA, AA-Briefcase et Chartography portent une note de plus : OpenAI avait corrigé un défaut qui nuisait à la compréhension des images, et ces scores externes n’avaient pas forcément déjà été mis à jour à ce moment-là.

Les graphiques de coût de la même page sont une autre lecture. L’effort Medium est la valeur par défaut dans les applications Claude. Sur plusieurs benchmarks, Sonnet 5.5 à Low ou Medium dépasse le meilleur score de Sonnet 5 pour environ un dixième du coût par tâche. L’effort High est la valeur par défaut sur la Claude Platform. La page de lancement écrit que, sur FrontierCode à High, le score est d’environ 10 points au-dessus de Sonnet 5 au même réglage, pour environ un quinzième du coût par tâche, et qu’il rejoint le meilleur score de GPT-6 Sol pour environ un cinquième du coût. Sur CursorBench à Low, il dépasse le meilleur score de Sonnet 5 pour moins d’un dixième du coût. Sur AA-Briefcase à Medium, il dépasse le meilleur score de Sonnet 5 pour environ un neuvième du coût. Les 55.5% et 1844 imprimés sont les points du tableau. Les phrases de coût viennent d’un autre harness. Les citations de clients sélectionnées sur la page de lancement sont des témoignages choisis ; elles peuvent indiquer quoi rejouer, et elles ne font pas partie de ce tableau.

La page de lancement écrit aussi que c’est le premier Sonnet à terminer Pokémon Red à partir des seules captures d’écran. C’est le récit produit du fournisseur, pas une ligne du tableau ci-dessus.

Prix et groupes Modelflare

Dans la réponse de tarifs du 30 septembre 2026, claude-sonnet-5-5 a un input_price de 2 et un completion_ratio de 5, donc la sortie est $10. Le cache_ratio est 0.1, donc une lecture de cache est $0.20. Le create_cache_ratio est 1.25, donc l’écriture de cache du catalogue est $2.50. La ligne n’a pas de billing_mode et pas de prix distinct pour l’écriture d’une heure. Ne multipliez pas le prix officiel de $4 pour une heure, ni le demi-tarif Batch, par un ratio de groupe pour traiter le produit comme le montant déjà comptabilisé. Le montant comptabilisé est celui de l’enregistrement d’usage.

Les types de points de terminaison sont anthropic et openai. Le groupe se choisit sur la clé d’API. Les quatre groupes publics appellent le même ID de modèle.

Tableau des prix

Groupe Ratio Entrée / 1M Lecture de cache / 1M Écriture de cache du catalogue / 1M Sortie / 1M Description du catalogue ce jour-là
claude-award 0.25 $0.50 $0.05 $0.625 $2.50 Priorité au prix, pour le développement, les tests et les tâches élastiques, sensibles au budget et réessayables
claude-stable 0.315 $0.63 $0.063 $0.7875 $3.15 Développement individuel, projets plus longs et production, là où la stabilité compte
claude-premium 0.5 $1.00 $0.10 $1.25 $5.00 Priorité à la continuité et au succès de la requête, facturé à 50% du prix catalogue officiel
claude-tmp-cheap 0.06 $0.12 $0.012 $0.15 $0.60 Route promotionnelle à durée limitée

Le calcul est le prix unitaire du catalogue multiplié par le ratio de groupe. Pour claude-stable, $0.63 vaut $2 × 0.315, et l’écriture de cache de $0.7875 vaut $2.50 × 0.315. La description est le texte de la définition du groupe. Ce n’est pas un accord de disponibilité mesuré.

La même réponse liste aussi le groupe non public claude-first-topup, au ratio 0.03, décrit comme déverrouillé lorsqu’une recharge unique atteint $50. Ce n’est pas un groupe public sélectionnable, donc il n’a pas de ligne ci-dessus. Si une clé a aussi des groupes de repli, une requête qui quitte le groupe de campagne est facturée sur le groupe qui la sert réellement.

Trois exemples chiffrés

Chaque forme compte 100,000 tokens de la classe d’entrée nommée plus 5,000 tokens de sortie. Les lignes de cache supposent que l’enregistrement d’usage classe vraiment ces tokens comme une lecture ou une écriture. Sur de petits montants, l’arrondi du quota peut déplacer le chiffre comptabilisé.

Requête Prix catalogue claude-award claude-stable claude-premium claude-tmp-cheap
100,000 d’entrée non cachée, 5,000 de sortie $0.2500 $0.0625 $0.07875 $0.1250 $0.0150
100,000 de lecture de cache, 5,000 de sortie $0.0700 $0.0175 $0.02205 $0.0350 $0.0042
100,000 d’écriture de cache du catalogue, 5,000 de sortie $0.3000 $0.0750 $0.0945 $0.1500 $0.0180

Le prix catalogue de la première ligne est 0.1 × $2 + 0.005 × $10. Chaque cellule de groupe est ces $0.25 multipliés par le ratio. La troisième ligne utilise le prix d’écriture du catalogue de $2.50, le palier officiel de 5 minutes, et non les $4 d’une heure. La page en direct est la page de prix de claude-sonnet-5-5. Le catalogue complet est Modèles et prix.

Lorsqu’un seul échec coûte cher, le catalogue décrit claude-premium comme la voie qui met la continuité en premier. Pour la production quotidienne et les projets plus longs, le catalogue décrit claude-stable comme le choix par défaut de ce genre. Le développement et les tests réessayables utilisent claude-award. claude-tmp-cheap est la route promotionnelle à durée limitée, au ratio 0.06. Choisissez le groupe selon le coût d’un échec, pas selon le ratio seul.

Appel sur Modelflare

Créez la clé sur l’un des quatre groupes du tableau. Envoyez l’ID de modèle claude-sonnet-5-5 exactement. L’URL de base canonique est https://modelflare.dev/v1. La même API est aussi publiée sur https://cf.modelflare.dev/v1 et https://origin.modelflare.dev/v1. Le nom d’hôte racine est le site canonique.

La Messages API est l’entrée qui règle l’effort. La requête ci-dessous laisse la réflexion adaptative et règle l’effort sur medium. max_tokens doit laisser de la place aux blocs de réflexion.

export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"

curl -sS https://modelflare.dev/v1/messages \
  -H "x-api-key: $MODELFLARE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 1024,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Examine ce plan de migration et liste les trois hypothèses qui ont le plus besoin d’un test complémentaire."
      }
    ]
  }'

Chat Completions est aussi listé sur cet ID. Cet exemple n’envoie que du texte et ne règle pas reasoning_effort.

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "messages": [
      {
        "role": "user",
        "content": "Examine ce plan de migration et liste les trois hypothèses qui ont le plus besoin d’un test complémentaire."
      }
    ]
  }'

Pour choisir un effort, utilisez la requête Messages ci-dessus. La passerelle transforme aujourd’hui le reasoning_effort de Chat Completions en un budget de réflexion manuel avec budget_tokens, et Sonnet 5.5 refuse un budget manuel. Si l’effort est omis, la valeur par défaut de la Claude API est high. La différence entre les deux entrées est traitée dans Responses API et Chat Completions. La façon dont l’usage rejoint la facture est traitée dans Suivi des coûts de l’API d’IA.

Migration depuis Sonnet 5

La page des nouveautés liste cinq changements qui font renvoyer 400 à du code déjà en cours sur Sonnet 5, plus un changement qui laisse la requête réussie et modifie la forme de la réponse.

Requêtes qui renvoient 400

thinking: {"type": "disabled"}
thinking: {"type": "enabled", "budget_tokens": N}
thinking: {"type": "between_tools"} avec effort xhigh ou max
tool_choice: {"type": "any"}
tool_choice: {"type": "tool", "name": "..."}
temperature, top_p ou top_k réglés hors de la valeur par défaut
type d’outil computer_20251124 sur la Claude API et Google Cloud
outil conseiller utilisant Opus 4.8, Opus 4.7 ou Sonnet 5 comme conseiller

Pour couper la réflexion préalable, envoyez between_tools et gardez l’effort à high ou en dessous. tool_choice reste auto ou none. Pour des paramètres d’outil conformes au schéma, activez strict, ou passez à la sortie structurée, et indiquez dans le prompt quand appeler l’outil. Sur la Claude API et Google Cloud, l’usage de l’ordinateur passe à computer_toolset_20260801. Amazon Bedrock accepte encore le computer_20251124 d’origine. L’outil conseiller accepte Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5, ou Sonnet 5.5 lui-même. Le contenu du conseiller revient chiffré, et le client ne peut pas lire le texte.

Les comptes créés le 31 août 2026, 00:00 UTC, ou après, ont un 400 de plus sur la Claude API, Amazon Bedrock et Google Cloud : rejouer un bloc de réflexion de Sonnet 5.5 échoue si le prompt système, la liste d’outils ou un message antérieur a changé. La conversation reste en ajout seul. Lorsque les instructions doivent changer, utilisez un message système au milieu de la conversation.

Comportement qui change alors que la requête réussit

Lorsque l’effort est omis, l’API tourne à high. Le même mot n’achète pas la même quantité de réflexion que sur Sonnet 5. La page des nouveautés demande de balayer l’effort de nouveau, au lieu de recopier l’ancien réglage. Une boucle d’outils au périmètre net peut commencer à medium, et une boucle plus longue ou plus difficile peut monter à high. Une conversation sensible à la latence peut commencer à medium ou low.

Le texte de progression de plus d’une phrase ou deux entre les appels d’outils revient à l’intérieur des blocs de réflexion. Avec le display par défaut à omitted, le texte de ces blocs est vide, l’interface devient silencieuse entre les outils, et la requête elle-même réussit encore. Réglez display lorsque ces lignes de progression sont nécessaires. Avec between_tools, ce texte revient.

Un bloc de réflexion retient le modèle qui l’a produit. Sonnet 5.5 lit les blocs de réflexion de Sonnet 5, Opus 4.8, Haiku 4.5 et des modèles antérieurs. Il ne lit pas les blocs d’Opus 5, d’Opus 5.5, de Fable ni de Mythos. Aucun autre modèle ne lit les blocs de réflexion de Sonnet 5.5. Un bloc que le modèle cible ne peut pas lire est écarté avant que le modèle le voie, et un bloc écarté n’est pas facturé. Un bloc produit par Sonnet 5.5 reste en outre attaché au compte qui l’a produit. Le rejouer depuis un compte non lié écarte le bloc, et la requête réussit encore.

Refus et repli

Une requête refusée revient en HTTP 200, avec stop_reason réglé sur "refusal". Les catégories nommées sur la page des nouveautés sont cyber, bio, frontier_llm, reasoning_extraction et general_harms. La page de lancement écrit que la capacité en cybersécurité est proche d’Opus 5, donc c’est le premier Sonnet livré avec cette classe de protections de cybersécurité. Les tâches de cybersécurité à risque plus élevé retombent sur Sonnet 5. Les protections biologiques sont celles de Sonnet 5. Le développement logiciel ordinaire et la plus grande partie du travail en sciences de la vie sont hors de ces deux protections étroites.

La page des nouveautés écrit que le repli par défaut en bêta de la Claude API rejoue cyber et frontier_llm sur Sonnet 5, et ne rejoue pas bio, reasoning_extraction ni general_harms. C’est le comportement documenté par Anthropic. Que cette route Modelflare exécute le même repli se lit sur le nom de modèle de la réponse. Comptez les refus à part des échecs de transport. Qu’un refus soit facturé dépend de sa catégorie. La page de lancement écrit aussi que Sonnet 5.5 peut être fourni sans conservation des données.

Vérifications avant de déplacer le trafic

  1. Fixez claude-sonnet-5-5. Vérifiez aussi le nom de modèle du résultat terminé. Un repli de protection peut répondre en tant que Sonnet 5.
  2. Confirmez que le groupe de la clé est l’un des quatre groupes publics du tableau, et choisissez-le selon le coût d’un échec.
  3. Rejouez un même ensemble sans données sensibles à low, medium, high, xhigh et max. Notez le succès, la latence, l’entrée, les lectures de cache, les écritures de cache, la sortie et le montant.
  4. Placez l’effort dans output_config.effort de la requête Messages. N’utilisez pas le reasoning_effort de Chat Completions pour régler le niveau de réflexion de ce modèle.
  5. Modifiez les clients qui envoient encore disabled, un choix d’outil forcé, un budget de réflexion manuel ou computer_20251124, avant d’augmenter le volume.
  6. Gardez en ajout seul les conversations qui rejouent des blocs de réflexion.
  7. Comptez les refus en HTTP 200 à part des échecs de transport.
  8. Tarifez un prompt court et un prompt qui devrait toucher le cache, puis lisez le montant comptabilisé. Le prix officiel d’écriture sur une heure et le demi-tarif Batch suivent l’enregistrement d’usage.
  9. Laissez le travail complexe, ouvert et qui exige un jugement suivi sur claude-opus-5-5. claude-sonnet-5 reste disponible.

Sources

Vérifié le 30 septembre 2026. Modelflare n’a pas reproduit les benchmarks de façon indépendante.