GPT-6.1 Sol : spécifications, prix et accès Modelflare

Compte rendu sourcé de gpt-6.1-sol : spécifications publiées, prix de contexte court et long, lecture des comparaisons de lancement du 29 septembre 2026, et groupes ainsi que prix utilisateur Modelflare renvoyés le 30 septembre 2026.

OpenAI a publié GPT-6.1 Sol le 29 septembre 2026. L’ID de modèle de l’API est gpt-6.1-sol. La page de lancement le décrit comme une mise à niveau de gpt-6-sol : proche de gpt-6-astra pour la programmation complexe, l’usage de l’ordinateur et le travail professionnel, à un cinquième des prix standard d’entrée et de sortie d’Astra. La lecture de cache est à $0.10 par million de tokens, soit 5% de l’entrée standard et la moitié de la lecture de cache de gpt-6-sol. Pour la recherche scientifique la plus difficile, la page de lancement recommande encore Astra. gpt-6-sol reste disponible.

Cet article tient trois couches séparées. La spécification et les prix viennent de la page de lancement et de la page du modèle d’OpenAI. Les comparaisons de benchmarks recopient les écarts, les coûts et les conditions que la page de lancement énonce vraiment. Modelflare ne les a pas rejoués. Les groupes et les prix utilisateur viennent de GET https://modelflare.dev/api/pricing, lu le 30 septembre 2026. Une formule du fournisseur telle que « environ un cinquième du coût » décrit le harness propre d’OpenAI.

Conclusions après vérification

Le prix catalogue de contexte court est, par million de tokens, $2 d’entrée, $0.10 de lecture de cache, $2.50 d’écriture de cache et $10 de sortie. Au-dessus de 272,000 tokens d’entrée, l’entrée et le cache sont doublés et la sortie est multipliée par 1.5 pour toute la requête, soit $4 / $0.20 / $5 / $15. La ligne de prix Modelflare du même jour écrit cette même paire dans deux paliers de pricing_rules. Les request_rules de cette ligne sont vides, donc les prix unitaires du catalogue ne sont pas multipliés une seconde fois par Fast, Batch, Flex ou un supplément régional.

Les groupes publics sélectionnables sont openai-award (0.03) et openai-stable (0.08). openai-premium est un groupe public, et ce modèle n’y est pas rattaché. La ligne du modèle nomme aussi openai-enterprise et le groupe non public openai-first-topup. La réponse publique ne contient pas de ratio enterprise, donc cet article n’imprime pas de prix utilisateur enterprise.

Spécification publiée

Élément GPT-6.1 Sol
ID de modèle gpt-6.1-sol
Publication 29 septembre 2026, OpenAI API
Fenêtre de contexte 1,050,000 tokens
Entrée maximale 922,000 tokens
Sortie maximale 128,000 tokens
Entrée vers sortie Texte et images vers du texte
Coupure des connaissances 30 avril 2026
reasoning.effort low, medium (par défaut), high, xhigh, max
Efforts non acceptés none, minimal
Appel d’outils Responses API
Chat Completions Pris en charge, sans outils
Points de terminaison listés Chat Completions, Responses, Batch
Indiqués comme non pris en charge sur la page du modèle Realtime, Assistants, affinage, Embeddings, génération d’images, vidéo, voix

La page du modèle écrit aussi que le modèle prend en charge la résidence des données aux États-Unis et dans l’UE, et que Fast n’est pas disponible avec la résidence des données dans l’UE. La ligne de prix Modelflare lue pour cet article n’a pas d’interrupteur de résidence. La résidence se lit sur la page du modèle, et elle reste distincte d’un paramètre de passerelle.

L’entrée maximale de 922,000 s’aligne sur la fenêtre de contexte de 1,050,000 et sur la sortie maximale de 128,000 : 1,050,000 − 128,000 = 922,000. Les tokens de raisonnement occupent le contexte et sont facturés comme des tokens de sortie. max_output_tokens plafonne ensemble les tokens de raisonnement, la sortie visible et les tokens de formatage. Lorsque ce plafond est atteint, le statut de la réponse est incomplete, et la raison est max_output_tokens.

Prix officiels

Contexte court et contexte long

Les montants sont en dollars des États-Unis par million de tokens. Le palier court est la page du modèle. Le palier long est la règle qui y est énoncée : au-dessus de 272,000 tokens d’entrée, l’entrée et le cache sont doublés, la sortie est multipliée par 1.5, et toute la requête utilise le palier long. Les colonnes Sol et Astra viennent des pricing_rules de ces modèles dans la réponse de tarifs Modelflare du même jour. Leurs paliers courts correspondent aux prix catalogue publiés.

Par 1M de tokens 6.1 court 6.1 long Sol court Sol long Astra court Astra long
Entrée $2 $4 $2 $4 $10 $20
Lecture de cache $0.10 $0.20 $0.20 $0.40 $1 $2
Écriture de cache $2.50 $5 $2.50 $5 $12.50 $25
Sortie $10 $15 $10 $15 $50 $75

L’entier 272,000 reste sur le palier court : la condition de la ligne de prix est input_context_tokens <= 272000. À partir de 272,001, le palier long s’applique, y compris aux 272,000 premiers tokens. La lecture de cache de 6.1 est la moitié de celle de Sol. L’entrée et la sortie standard sont un cinquième d’Astra. La lecture de cache n’est pas un cinquième d’Astra. La lecture de cache d’Astra en contexte court est $1.

Autres paliers officiels

La page du modèle énonce trois autres multiplicateurs officiels : Fast vaut 2× Standard, Batch et Flex sont 50% sous Standard, et le traitement régional ajoute 10% là où il est disponible. La page de lancement dit aussi qu’Ultrafast sera proposé dans Codex dans les jours qui viennent, avec jusqu’à 8× la génération de tokens de la vitesse standard. Sur la ligne de prix Modelflare du 30 septembre 2026, request_rules est vide, has_request_rules est false, et il n’y a pas d’ID de modèle Ultrafast. Un appel Modelflare se budgète avec les deux paliers ci-dessus. Qu’un multiplicateur officiel ait atteint une facture se lit sur l’enregistrement d’usage.

Comment lire les benchmarks

La page de lancement publie des écarts et des coûts, pas un tableau de scores absolus que l’on pourrait recopier. Le tableau ci-dessous ne garde que les comparaisons que la page énonce. Les phrases de coût décrivent le harness d’OpenAI. Modelflare n’a pas rejoué les tests.

Évaluation Comparaison énoncée sur la page de lancement Condition
DeepSWE v1.1 À égalité avec Astra ; 6.4 points de pourcentage au-dessus du meilleur score de Sol Effort de raisonnement plus bas, à environ un cinquième du coût
GDP.pdf Au-dessus d’Opus 5.5 avec replis ; proche d’Astra Sur les réglages de raisonnement testés ; moins de la moitié du coût d’Opus, environ un cinquième du coût d’Astra
AutomationBench 2.2 points de pourcentage au-dessus d’Opus 5.5 ; 4.8 points de pourcentage au-dessus de Sol au même réglage medium ; environ un tiers du coût d’Opus
OSWorld 2.0, jeu hors ligne 7 points de pourcentage au-dessus de Sol ; à 2.1 points de pourcentage ou moins d’Astra max ; partial reward, v2026.08.08 ; moins de la moitié du coût de Sol, environ un septième du coût d’Astra
Terminal-Bench Science 0.1 Plus du double du score de Sol ; Astra reste le plus haut, à 68.1% max ; coût moyen par tâche $5.47 pour 6.1, $23.21 pour Opus 5.5, $23.80 pour Astra
Exactitude factuelle Part des réponses avec au moins une erreur factuelle, de 11.4% à 7.7% low ; écart avec Astra d’au plus 1.9 points de pourcentage

L’échantillon de factualité est fait de conversations désidentifiées dans lesquelles un utilisateur avait signalé une erreur antérieure. La page de lancement écrit que ces prompts sont volontairement difficiles et ne représentent pas le trafic ordinaire. Les dollars de Terminal-Bench Science sont le coût moyen par tâche publié par OpenAI, pas un prix de groupe Modelflare. Les 68.1% d’Astra restent le score scientifique le plus haut, et la page de lancement dit de laisser la recherche scientifique la plus difficile sur Astra.

Les tests d’alignement de la même page ajoutent une série de taux d’échec volontairement difficiles. Lorsque l’outil de recherche est en panne, la part des réponses à effort max qui ne le disent pas à l’utilisateur est de 2.1% pour 6.1, 4.9% pour Sol, 1.5% pour Astra et 28.7% pour Luna. La page de lancement écrit qu’aucune tentative de contourner un réviseur de sûreté automatique n’a été observée, comme pour Astra et Sol. Le détail est dans l’addendum de la carte système de GPT-6.1 Sol. Ces taux ne sont pas des taux d’échec sur le trafic ordinaire.

Prix et groupes Modelflare

Le 30 septembre 2026, gpt-6.1-sol a un input_price de 2, un completion_ratio de 5, un cache_ratio de 0.05 et un create_cache_ratio de 1.25. billing_mode est tiered_expr. Les prix unitaires du palier court sont $2 d’entrée, $0.10 de lecture de cache, $2.50 d’écriture de cache et $10 de sortie. Le palier long est $4 / $0.20 / $5 / $15. Les types de points de terminaison sont openai, openai-response et openai-response-compact.

Les groupes publics sélectionnables qui incluent ce modèle sont les deux ci-dessous. Le groupe se choisit sur la clé. Les deux groupes appellent le même ID de modèle.

Tableau des prix

Groupe Ratio Palier Entrée / 1M Lecture de cache / 1M Écriture de cache / 1M Sortie / 1M
openai-award 0.03 Entrée ne dépassant pas 272,000 $0.06 $0.003 $0.075 $0.30
openai-award 0.03 Entrée au-dessus de 272,000, requête entière $0.12 $0.006 $0.15 $0.45
openai-stable 0.08 Entrée ne dépassant pas 272,000 $0.16 $0.008 $0.20 $0.80
openai-stable 0.08 Entrée au-dessus de 272,000, requête entière $0.32 $0.016 $0.40 $1.20

La description du catalogue pour openai-award est la priorité au prix, pour le développement, les tests et les tâches élastiques, sensibles au budget et réessayables, avec une protection énoncée de 65% de succès de cache par jour pour les requêtes éligibles et une compensation du manque. La description de openai-stable est le développement individuel, les projets plus longs et la production, là où la stabilité compte, avec la protection énoncée à 75% par jour. Les deux phrases sont le texte de la définition du groupe. Cet article n’a pas mesuré le taux de succès à part.

La ligne du modèle liste aussi openai-enterprise. La même réponse publique n’a pas de ratio pour ce groupe dans group_definitions ni dans group_ratio, donc le tableau ci-dessus le laisse de côté. Le groupe non public openai-first-topup a le ratio 0.015, décrit comme déverrouillé lorsqu’une recharge unique atteint $20. Ce n’est pas un groupe public sélectionnable. Si une clé a aussi des groupes de repli, une requête qui quitte le groupe de campagne est facturée sur le groupe qui la sert. Le groupe public openai-premium a le ratio 0.13, et les enable_groups de ce modèle ne l’incluent pas.

Trois exemples chiffrés

Les deux premières lignes tombent dans le palier court. La troisième ligne compte 280,000 tokens d’entrée, donc toute la requête utilise le palier long. La ligne de cache suppose que l’enregistrement d’usage compte ces tokens d’entrée comme un succès de cache.

Requête Prix catalogue openai-award openai-stable
100,000 d’entrée non cachée, 5,000 de sortie $0.2500 $0.0075 $0.0200
100,000 de lecture de cache, 5,000 de sortie $0.0600 $0.0018 $0.0048
280,000 d’entrée non cachée, 10,000 de sortie $1.2700 $0.0381 $0.1016

La première ligne est 0.1 × $2 + 0.005 × $10 = $0.25. La deuxième est 0.1 × $0.10 + 0.005 × $10 = $0.06. La troisième est 0.28 × $4 + 0.01 × $15 = $1.27, et les cellules de groupe multiplient par 0.03 ou 0.08. Appliquer les prix unitaires du palier court à ces 280,000 tokens donnerait $0.0198 sur award, ce qui n’est pas le prix de cette ligne. La page en direct est la page de prix de gpt-6.1-sol. Le catalogue complet est Modèles et prix.

Le développement et les tests réessayables utilisent openai-award. Pour la production quotidienne et les projets plus longs, le catalogue décrit openai-stable comme le choix par défaut de ce genre. Les deux ratios sont 3% et 8% des prix catalogue des paliers court et long. Ils ne sont pas 3% et 8% d’un prix déjà multiplié pour Fast, Batch, Flex ou un supplément régional.

Appel sur Modelflare

Créez une clé sur openai-award ou openai-stable. Envoyez l’ID de modèle gpt-6.1-sol exactement. L’URL de base canonique est https://modelflare.dev/v1. La même API est aussi publiée sur https://cf.modelflare.dev/v1 et https://origin.modelflare.dev/v1. Le nom d’hôte racine est le site canonique.

L’appel d’outils utilise Responses. L’effort par défaut est déjà medium. La requête ci-dessous le fixe explicitement.

export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"

curl -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6.1-sol",
    "reasoning": {"effort": "medium"},
    "input": "Examine ce plan de migration et liste les trois hypothèses qui ont le plus besoin d’un test complémentaire."
  }'

Chat Completions peut envoyer du texte sans outils. Le nom du champ est reasoning_effort.

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6.1-sol",
    "reasoning_effort": "medium",
    "messages": [
      {
        "role": "user",
        "content": "Examine ce plan de migration et liste les trois hypothèses qui ont le plus besoin d’un test complémentaire."
      }
    ]
  }'

POST /v1/responses/compact est listé sur ce modèle. C’est une opération de compactage sur gpt-6.1-sol, pas un second ID de modèle. L’entrée image utilise le tableau de contenu ordinaire d’un message utilisateur. La différence entre les deux entrées est traitée dans Responses API et Chat Completions. La façon dont l’usage rejoint la facture est traitée dans Suivi des coûts de l’API d’IA.

Différences de requête par rapport à GPT-6 Sol

Les prix catalogue d’entrée et de sortie du palier court correspondent à gpt-6-sol, et la lecture de cache passe de $0.20 à $0.10. La sortie du palier long est $15 pour les deux, et la lecture de cache du palier long passe de $0.40 à $0.20. gpt-6-sol reste dans le catalogue. Ses groupes publics à cette lecture incluent openai-premium, que 6.1 n’a pas. Lors du passage à 6.1, fixez le nom de modèle du résultat terminé. Un résultat qui atterrit sur un autre ID n’est pas ce passage.

Formes qui échouent

reasoning.effort: none
reasoning.effort: minimal
requête Chat Completions qui porte tools

none et minimal renvoient HTTP 400. En venant de gpt-6-sol ou de gpt-6-luna, qui acceptent tous deux none, comparez de nouveau à low et retirez none de la requête. Les outils, l’usage de l’ordinateur, la recherche de fichiers et la recherche web passent par Responses. Chat Completions porte les requêtes qui n’ont pas d’outils.

Vérifications avant de déplacer le trafic

  1. Fixez gpt-6.1-sol. Le nom de modèle du résultat terminé doit être cet ID aussi.
  2. Estimez le prix public sur openai-award ou openai-stable, et choisissez le groupe de la clé selon le coût d’un échec.
  3. Rejouez un même ensemble sans données sensibles à low, medium, high, xhigh et max. none et minimal renvoient 400.
  4. Placez les outils sur Responses. L’exemple Chat Completions ne porte pas d’outils.
  5. Tarifez un prompt à 272,000 tokens d’entrée et un à 272,001. Le second utilise les prix unitaires du palier long pour toute la requête.
  6. Budgétez avec les deux paliers du catalogue. Fast, Batch, Flex et le supplément régional de la page du modèle suivent le montant qui apparaît vraiment sur l’enregistrement d’usage.
  7. Lisez le nombre de tokens de cache sur l’enregistrement d’usage avant d’utiliser l’exemple de cache ci-dessus.
  8. Laissez la recherche scientifique la plus difficile sur gpt-6-astra. gpt-6-sol reste disponible.

Sources

Vérifié le 30 septembre 2026. Modelflare n’a pas reproduit les benchmarks de façon indépendante.