GPT-6.1 Sol: especificações, preço e acesso na Modelflare

Relato com fontes sobre gpt-6.1-sol: especificações publicadas, preços de contexto curto e longo, como ler as comparações de lançamento de 29 de setembro de 2026 e os grupos e preços de utilizador da Modelflare devolvidos em 30 de setembro de 2026.

A OpenAI lançou o GPT-6.1 Sol em 29 de setembro de 2026. O ID do modelo na API é gpt-6.1-sol. A página de lançamento descreve-o como uma atualização de gpt-6-sol: perto de gpt-6-astra em programação complexa, uso de computador e trabalho profissional, a um quinto dos preços padrão de entrada e de saída da Astra. A entrada em cache é $0.10 por milhão de tokens, 5% da entrada padrão e metade da leitura de cache de gpt-6-sol. Para a investigação científica mais difícil, a página de lançamento continua a apontar para a Astra. gpt-6-sol continua disponível.

Este artigo mantém três camadas separadas. A especificação e os preços vêm da página de lançamento e da página do modelo da OpenAI. As comparações de benchmarks copiam as diferenças, os custos e as condições que a página de lançamento declara de facto. A Modelflare não as voltou a executar. Os grupos e os preços de utilizador vêm de GET https://modelflare.dev/api/pricing, lido em 30 de setembro de 2026. Uma frase do fornecedor como "cerca de um quinto do custo" descreve o próprio harness da OpenAI.

O que as fontes sustentam

O preço de tabela de contexto curto é $2 de entrada, $0.10 de leitura de cache, $2.50 de escrita de cache e $10 de saída por milhão de tokens. Acima de 272,000 tokens de entrada, a entrada e a cache duplicam e a saída é multiplicada por 1.5 para o pedido inteiro, o que dá $4 / $0.20 / $5 / $15. A linha de preços da Modelflare desse mesmo dia escreve esse mesmo par em dois escalões de pricing_rules. request_rules nessa linha está vazio, por isso os preços unitários do catálogo não voltam a ser multiplicados por Fast, Batch, Flex nem por um prémio regional.

Os grupos públicos selecionáveis são openai-award (0.03) e openai-stable (0.08). openai-premium é um grupo público, e este modelo não está associado a ele. A linha do modelo também nomeia openai-enterprise e o openai-first-topup não público. A resposta pública não inclui um rácio de enterprise, por isso este artigo não imprime um preço de utilizador de enterprise.

Especificação publicada

Item GPT-6.1 Sol
ID do modelo gpt-6.1-sol
Lançamento 29 de setembro de 2026, OpenAI API
Janela de contexto 1,050,000 tokens
Entrada máxima 922,000 tokens
Saída máxima 128,000 tokens
Entrada para saída Texto e imagens para texto
Corte de conhecimento 30 de abril de 2026
reasoning.effort low, medium (predefinido), high, xhigh, max
Efforts que não são aceites none, minimal
Chamada de ferramentas Responses API
Chat Completions Suportado, sem ferramentas
Endpoints listados Chat Completions, Responses, Batch
Indicado como não suportado na página do modelo Realtime, Assistants, fine-tuning, embeddings, geração de imagens, vídeo, fala

A página do modelo também diz que o modelo suporta residência de dados nos Estados Unidos e na UE, e que o Fast não está disponível com a residência de dados da UE. A linha de preços da Modelflare lida para este artigo não tem um interruptor de residência. Leia a residência na página do modelo e mantenha-a separada de um parâmetro do gateway.

A entrada máxima de 922,000 alinha-se com a janela de contexto de 1,050,000 e com a saída máxima de 128,000: 1,050,000 − 128,000 = 922,000. Os tokens de raciocínio ocupam contexto e são faturados como tokens de saída. max_output_tokens limita ao mesmo tempo os tokens de raciocínio, a saída visível e os tokens de formatação. Quando esse teto é atingido, o estado da resposta é incomplete e o motivo é max_output_tokens.

Preços oficiais

Contexto curto e contexto longo

As quantias são dólares dos Estados Unidos por milhão de tokens. O escalão curto é a página do modelo. O escalão longo é a regra ali declarada: acima de 272,000 tokens de entrada, a entrada e a cache duplicam, a saída é multiplicada por 1.5, e o pedido inteiro usa o escalão longo. As colunas de Sol e de Astra vêm das pricing_rules desses modelos na resposta de preços da Modelflare do mesmo dia. Os escalões curtos coincidem com os preços de tabela publicados.

Por 1M de tokens 6.1 curto 6.1 longo Sol curto Sol longo Astra curto Astra longo
Entrada $2 $4 $2 $4 $10 $20
Leitura de cache $0.10 $0.20 $0.20 $0.40 $1 $2
Escrita de cache $2.50 $5 $2.50 $5 $12.50 $25
Saída $10 $15 $10 $15 $50 $75

O inteiro 272,000 fica no escalão curto: a condição da linha de preços é input_context_tokens <= 272000. A partir de 272,001 aplica-se o escalão longo, incluindo os primeiros 272,000 tokens. A leitura de cache do 6.1 é metade da do Sol. A entrada e a saída padrão são um quinto das da Astra. A leitura de cache não é um quinto da da Astra. A leitura de cache de contexto curto da Astra é $1.

Outros escalões oficiais

A página do modelo declara mais três multiplicadores oficiais: Fast é 2× Standard, Batch e Flex ficam 50% abaixo de Standard, e o processamento regional acrescenta 10% onde está disponível. A página de lançamento também diz que o Ultrafast será oferecido no Codex nos dias seguintes, com até 8× a geração de tokens da velocidade padrão. Na linha de preços da Modelflare de 30 de setembro de 2026, request_rules está vazio, has_request_rules é false, e não há um ID de modelo Ultrafast. Faça o orçamento de uma chamada da Modelflare com os dois escalões acima. Se um multiplicador oficial já chegou a uma fatura, a resposta está no registo de utilização.

Como ler os benchmarks

A página de lançamento publica diferenças e custos, não uma tabela de pontuações absolutas que se possa copiar. A tabela abaixo conserva apenas as comparações que a página declara. As frases de custo descrevem o harness da OpenAI. A Modelflare não voltou a executar os testes.

Avaliação Comparação declarada na página de lançamento Condição
DeepSWE v1.1 Iguala a Astra; 6.4 pontos percentuais acima da melhor pontuação do Sol Menor reasoning effort, a cerca de um quinto do custo
GDP.pdf Acima do Opus 5.5 com fallbacks; aproxima-se da Astra Nos ajustes de raciocínio que foram testados; menos de metade do custo do Opus, cerca de um quinto do custo da Astra
AutomationBench 2.2 pontos percentuais acima do Opus 5.5; 4.8 pontos percentuais acima do Sol na mesma definição medium; cerca de um terço do custo do Opus
OSWorld 2.0, conjunto offline 7 pontos percentuais acima do Sol; a 2.1 pontos percentuais ou menos da Astra max; partial reward, v2026.08.08; menos de metade do custo do Sol, cerca de um sétimo do custo da Astra
Terminal-Bench Science 0.1 Mais do que duplica a pontuação do Sol; a Astra continua a mais alta, em 68.1% max; custo médio por tarefa $5.47 para o 6.1, $23.21 para o Opus 5.5, $23.80 para a Astra
Factualidade A parcela de respostas com pelo menos um erro factual baixa de 11.4% para 7.7% low; a 1.9 pontos percentuais ou menos da Astra

A amostra de factualidade são conversas desidentificadas em que um utilizador tinha assinalado um erro anterior. A página de lançamento diz que estes prompts são difíceis de propósito e não são tráfego típico. Os dólares do Terminal-Bench Science são o custo médio por tarefa publicado pela OpenAI, não um preço de grupo da Modelflare. Os 68.1% da Astra continuam a ser a pontuação científica mais alta, e a página de lançamento diz para deixar a investigação científica mais difícil na Astra.

Os testes de alinhamento da mesma página acrescentam um conjunto de taxas de falha difíceis de propósito. Quando a ferramenta de pesquisa está avariada, a parcela de respostas de effort max que não o dizem ao utilizador é 2.1% para o 6.1, 4.9% para o Sol, 1.5% para a Astra e 28.7% para a Luna. A página de lançamento diz que não se observou nenhuma tentativa de contornar um revisor automático de segurança, tal como na Astra e no Sol. O detalhe está na adenda da system card do GPT-6.1 Sol. Estas taxas não são taxas de falha do tráfego ordinário.

Preços e grupos na Modelflare

Em 30 de setembro de 2026, gpt-6.1-sol tem input_price 2, completion_ratio 5, cache_ratio 0.05 e create_cache_ratio 1.25. billing_mode é tiered_expr. Os preços unitários do escalão curto são $2 de entrada, $0.10 de leitura de cache, $2.50 de escrita de cache e $10 de saída. O escalão longo é $4 / $0.20 / $5 / $15. Os tipos de endpoint são openai, openai-response e openai-response-compact.

Os grupos públicos selecionáveis que incluem este modelo são os dois abaixo. O grupo escolhe-se na chave. Os dois grupos chamam o mesmo ID de modelo.

Tabela de preços

Grupo Rácio Escalão Entrada / 1M Leitura de cache / 1M Escrita de cache / 1M Saída / 1M
openai-award 0.03 Entrada até 272,000 $0.06 $0.003 $0.075 $0.30
openai-award 0.03 Entrada acima de 272,000, pedido inteiro $0.12 $0.006 $0.15 $0.45
openai-stable 0.08 Entrada até 272,000 $0.16 $0.008 $0.20 $0.80
openai-stable 0.08 Entrada acima de 272,000, pedido inteiro $0.32 $0.016 $0.40 $1.20

A descrição de catálogo de openai-award é encaminhamento com prioridade ao preço para desenvolvimento, testes e cargas flexíveis, sensíveis ao orçamento e passíveis de nova tentativa, com uma proteção diária declarada de 65% de acertos de cache para os pedidos elegíveis e compensação se ficar aquém. A descrição de openai-stable é desenvolvimento individual, projetos de maior duração e aplicações de produção em que a estabilidade importa, com a proteção declarada a 75% diários. As duas frases são o texto da definição do grupo. Este artigo não mediu à parte a taxa de acerto.

A linha do modelo também lista openai-enterprise. A mesma resposta pública não tem rácio para esse grupo em group_definitions nem em group_ratio, por isso a tabela acima deixa-o de fora. O openai-first-topup não público tem rácio 0.015, descrito como desbloqueado quando um único carregamento atinge $20. Não é um grupo público selecionável. Quando uma chave tem também grupos de fallback, um pedido que sai do grupo da campanha é faturado no grupo que o serve. O openai-premium público tem rácio 0.13, e os enable_groups deste modelo não o incluem.

Três exemplos

As duas primeiras linhas caem no escalão curto. A terceira linha são 280,000 tokens de entrada, por isso o pedido inteiro usa o escalão longo. A linha de cache pressupõe que o registo de utilização conta esses tokens de entrada como um acerto de cache.

Pedido Preço de tabela openai-award openai-stable
100,000 de entrada sem cache, 5,000 de saída $0.2500 $0.0075 $0.0200
100,000 de leitura de cache, 5,000 de saída $0.0600 $0.0018 $0.0048
280,000 de entrada sem cache, 10,000 de saída $1.2700 $0.0381 $0.1016

A primeira linha é 0.1 × $2 + 0.005 × $10 = $0.25. A segunda é 0.1 × $0.10 + 0.005 × $10 = $0.06. A terceira é 0.28 × $4 + 0.01 × $15 = $1.27, e as células de grupo multiplicam por 0.03 ou 0.08. Aplicar os preços unitários do escalão curto a esses 280,000 tokens daria $0.0198 em award, que não é o preço desta linha. A página em tempo real é a página de preços de gpt-6.1-sol. O catálogo completo é Modelos e preços.

O desenvolvimento e os testes que admitem nova tentativa usam openai-award. Para a produção do dia a dia e os projetos mais longos, o catálogo descreve openai-stable como esse tipo de predefinição. Os dois rácios são 3% e 8% dos preços de catálogo do escalão curto e do escalão longo. Não são 3% e 8% de um preço que já tenha sido multiplicado por Fast, Batch, Flex ou um prémio regional.

Como o chamar na Modelflare

Crie uma chave em openai-award ou em openai-stable. Envie o ID do modelo gpt-6.1-sol exatamente. O URL de base canónico é https://modelflare.dev/v1. A mesma API também está publicada em https://cf.modelflare.dev/v1 e em https://origin.modelflare.dev/v1. O domínio de raiz é o site canónico.

A chamada de ferramentas usa Responses. O effort predefinido já é medium. O pedido abaixo define-o de forma explícita.

export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"

curl -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6.1-sol",
    "reasoning": {"effort": "medium"},
    "input": "Reveja este plano de migração e liste as três hipóteses que mais precisam de um teste."
  }'

As Chat Completions podem enviar texto sem ferramentas. O nome do campo é reasoning_effort.

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6.1-sol",
    "reasoning_effort": "medium",
    "messages": [
      {
        "role": "user",
        "content": "Reveja este plano de migração e liste as três hipóteses que mais precisam de um teste."
      }
    ]
  }'

POST /v1/responses/compact está listado neste modelo. É uma operação de compactação sobre gpt-6.1-sol, não um segundo ID de modelo. A entrada de imagem usa o array de conteúdo habitual numa mensagem de utilizador. A diferença entre as duas entradas está em Responses API vs Chat Completions. Como a utilização corresponde à fatura está em Acompanhamento de custos da API de IA.

Diferenças de pedido em relação ao GPT-6 Sol

Os preços de tabela de entrada e de saída do escalão curto coincidem com gpt-6-sol, e a leitura de cache passa de $0.20 para $0.10. A saída do escalão longo é $15 nos dois, e a leitura de cache do escalão longo passa de $0.40 para $0.20. gpt-6-sol continua no catálogo. Os grupos públicos dele nesta leitura incluem openai-premium, que o 6.1 não tem. Ao mudar para o 6.1, fixe o nome do modelo no resultado concluído. Um resultado que cai noutro ID não é esta mudança.

Formas que falham

reasoning.effort: none
reasoning.effort: minimal
tools num pedido de Chat Completions

none e minimal devolvem HTTP 400. Ao migrar de gpt-6-sol ou de gpt-6-luna, que aceitam none, compare de novo em low e retire none do pedido. As ferramentas, o uso de computador, a pesquisa de ficheiros e a pesquisa na web passam pelas Responses. As Chat Completions levam os pedidos que não têm ferramentas.

Verificações antes de mudar o tráfego

  1. Fixe gpt-6.1-sol. O nome do modelo no resultado concluído também tem de ser esse ID.
  2. Estime o preço público em openai-award ou em openai-stable, e escolha o grupo da chave pelo custo da falha.
  3. Reproduza um conjunto sem dados sensíveis em low, medium, high, xhigh e max. none e minimal devolvem 400.
  4. Ponha as ferramentas nas Responses. O exemplo de Chat Completions não leva ferramentas.
  5. Calcule o preço de um prompt com 272,000 tokens de entrada e de outro com 272,001. O segundo usa os preços unitários do escalão longo para o pedido inteiro.
  6. Faça o orçamento com os dois escalões do catálogo. Fast, Batch, Flex e o prémio regional da página do modelo seguem o valor que aparece mesmo no registo de utilização.
  7. Leia a contagem de tokens em cache no registo de utilização antes de usar o exemplo de cache acima.
  8. Deixe a investigação científica mais difícil em gpt-6-astra. gpt-6-sol continua disponível.

Fontes

Verificado em 30 de setembro de 2026. A Modelflare não reproduziu de forma independente os benchmarks.