GPT-6.1 Sol:规格、价格与 Modelflare 接入
依据 OpenAI 2026 年 9 月 29 日的发布页和模型页,整理 gpt-6.1-sol 的规格、短上下文与长上下文标价和基准读法,并记录 2026 年 9 月 30 日 Modelflare 价格接口中的公开分组与用户价格。
OpenAI 于 2026 年 9 月 29 日发布 GPT-6.1 Sol。API 模型 ID 是 gpt-6.1-sol。发布页把它写成 gpt-6-sol 的升级:在复杂编程、电脑操作和专业工作上接近 gpt-6-astra,标准输入和输出标价是 Astra 的五分之一。缓存读取是每百万 token $0.10,是标准输入的 5%,也是 gpt-6-sol 缓存读取的一半。最难的科学研究,发布页仍建议用 Astra。gpt-6-sol 继续可用。
本文把三层分开。规格和价格来自 OpenAI 的发布页和模型页。基准比较抄自发布页写明的差值、成本和条件,Modelflare 没有重跑。分组和用户价格来自 2026 年 9 月 30 日读取的 GET https://modelflare.dev/api/pricing。厂商的“大约五分之一成本”描述的是他们自己的测试装置。
核查后的结论
短上下文的官网标价是每百万 token 输入 $2、缓存读取 $0.10、缓存写入 $2.50、输出 $10。输入超过 272,000 token 时,输入和缓存按 2 倍、输出按 1.5 倍,覆盖整次请求,也就是 $4 / $0.20 / $5 / $15。同一天的 Modelflare 价格行用两档 pricing_rules 写出了同一组数字。这一行的 request_rules 是空的,所以目录单位价格不再乘 Fast、Batch、Flex 或区域加价。
公开可选分组是 openai-award(0.03)和 openai-stable(0.08)。openai-premium 是公开分组,但这条模型没有挂上。模型行还列出 openai-enterprise 和未公开的 openai-first-topup。公开响应没有给出 enterprise 的倍率,本文不写它的用户价格。
已经公开的规格
| 项目 | GPT-6.1 Sol |
|---|---|
| 模型 ID | gpt-6.1-sol |
| 发布 | 2026 年 9 月 29 日,OpenAI API |
| 上下文窗口 | 1,050,000 tokens |
| 最大输入 | 922,000 tokens |
| 最大输出 | 128,000 tokens |
| 输入 → 输出 | 文本和图片 → 文本 |
| 知识截止 | 2026 年 4 月 30 日 |
reasoning.effort |
low、medium(默认)、high、xhigh、max |
| 不接受的 effort | none、minimal |
| 工具调用 | Responses API |
| Chat Completions | 支持,不带工具 |
| 列出的端点 | Chat Completions、Responses、Batch |
| 模型页写明不支持 | Realtime、Assistants、微调、Embeddings、图片生成、视频、语音 |
模型页还写明支持美国和欧盟数据驻留,并写明 Fast 不能和欧盟数据驻留一起用。Modelflare 这次读到的价格行没有驻留开关。按模型页的说明来理解驻留,不要把它当成网关上的一个参数。
最大输入 922,000 与上下文 1,050,000、最大输出 128,000 对得上:1,050,000 − 128,000 = 922,000。推理 token 占用上下文,并按输出 token 计费。max_output_tokens 限制的是推理 token、可见输出和格式 token 的合计。顶满时,响应状态是 incomplete,原因是 max_output_tokens。
官网价格
短上下文和长上下文
单位是美元 / 每百万 tokens。短档来自模型页。长档是模型页写明的规则:输入超过 272,000 token 时,输入和缓存 2 倍、输出 1.5 倍,整次请求都按长档计算。Sol 和 Astra 两列来自同一天 Modelflare 价格接口里这两款的 pricing_rules,短档与已经公开的官网标价一致。
| 每 1M tokens | 6.1 短 | 6.1 长 | Sol 短 | Sol 长 | Astra 短 | Astra 长 |
|---|---|---|---|---|---|---|
| 输入 | $2 | $4 | $2 | $4 | $10 | $20 |
| 缓存读取 | $0.10 | $0.20 | $0.20 | $0.40 | $1 | $2 |
| 缓存写入 | $2.50 | $5 | $2.50 | $5 | $12.50 | $25 |
| 输出 | $10 | $15 | $10 | $15 | $50 | $75 |
272,000 这个整数落在短档:价格行的条件是 input_context_tokens <= 272000。从 272,001 起用长档,而且前 272,000 token 也改按长档单价计算。6.1 的缓存读取是 Sol 的一半。标准输入和输出是 Astra 的五分之一。缓存读取不是 Astra 的五分之一,Astra 短档缓存读取是 $1。
官方文档里的其他档位
模型页另写了三档官方乘数:Fast 是标准价格的 2 倍,Batch 和 Flex 比标准价格低 50%,可用的区域处理加 10%。发布页还说,随后几天会在 Codex 里提供 Ultrafast,token 生成最多比标准速度高 8 倍。2026 年 9 月 30 日的 Modelflare 价格行里,request_rules 为空,has_request_rules 为 false,也没有 Ultrafast 这个模型 ID。做 Modelflare 预算时用上面两档。官方乘数是否已经进账单,以用量记录为准。
基准应该怎么读
发布页给出的是差值和成本,不是一张可以抄绝对分数的表。下表只保留页面写明的比较。成本句描述的是 OpenAI 的测试装置。Modelflare 没有重跑。
| 评测 | 发布页写明的比较 | 条件 |
|---|---|---|
| DeepSWE v1.1 | 与 Astra 持平;比 Sol 的最好成绩高 6.4 个百分点 | 更低的 reasoning effort,成本大约是五分之一 |
| GDP.pdf | 高于带 fallback 的 Opus 5.5;接近 Astra | 测过的 reasoning 档;相对 Opus 不到一半成本,相对 Astra 大约五分之一 |
| AutomationBench | 比 Opus 5.5 高 2.2 个百分点;比同一档的 Sol 高 4.8 个百分点 | medium;相对 Opus 大约三分之一成本 |
| OSWorld 2.0 离线集 | 比 Sol 高 7 个百分点;与 Astra 相差 2.1 个百分点以内 | max;partial reward,v2026.08.08;相对 Sol 不到一半成本,相对 Astra 大约七分之一 |
| Terminal-Bench Science 0.1 | 把 Sol 的分数提高到两倍以上;Astra 仍是最高分,68.1% | max;6.1 平均每任务 $5.47,Opus 5.5 为 $23.21,Astra 为 $23.80 |
| 事实性 | 含至少一处事实错误的回答,从 11.4% 降到 7.7% | low;与 Astra 的差距不超过 1.9 个百分点 |
事实性样本是用户曾经标出错误的脱敏对话。发布页写明,这些提示是故意挑难的,不代表普通流量。Terminal-Bench Science 的美元是 OpenAI 公布的单任务平均成本,不是 Modelflare 的分组价格。科学任务的最高分仍是 Astra 的 68.1%,发布页建议最难的科学研究继续用 Astra。
同一页的对齐测试也写了一组故意挑难的失败率。搜索工具已经坏掉时,max effort 下没有向用户说明的比例是 6.1 的 2.1%、Sol 的 4.9%、Astra 的 1.5%、Luna 的 28.7%。发布页写明没有观察到绕过自动安全审查的尝试,这一点与 Astra 和 Sol 相同。细节在 GPT-6.1 Sol 的系统卡附录里。这些失败率不是普通流量的故障率。
Modelflare 的价格和分组
2026 年 9 月 30 日,gpt-6.1-sol 的 input_price 是 2,completion_ratio 是 5,cache_ratio 是 0.05,create_cache_ratio 是 1.25。billing_mode 是 tiered_expr。短档单位价格是输入 $2、缓存读取 $0.10、缓存写入 $2.50、输出 $10。长档是 $4 / $0.20 / $5 / $15。端点类型是 openai、openai-response 和 openai-response-compact。
公开可选、并且挂了这个模型的分组是下面两个。分组写在密钥上,两个分组调用同一个模型 ID。
价格表
| 分组 | 倍率 | 档 | 输入 / 1M | 缓存读取 / 1M | 缓存写入 / 1M | 输出 / 1M |
|---|---|---|---|---|---|---|
openai-award |
0.03 | 输入不超过 272,000 | $0.06 | $0.003 | $0.075 | $0.30 |
openai-award |
0.03 | 输入超过 272,000,整单 | $0.12 | $0.006 | $0.15 | $0.45 |
openai-stable |
0.08 | 输入不超过 272,000 | $0.16 | $0.008 | $0.20 | $0.80 |
openai-stable |
0.08 | 输入超过 272,000,整单 | $0.32 | $0.016 | $0.40 | $1.20 |
openai-award 的目录说明是价格优先,适合预算敏感、可以重试的开发、测试和弹性任务,并为符合条件的请求写了每日 65% 的缓存命中保护,不足部分补偿。openai-stable 的说明是看重稳定性的个人开发、较长期项目和生产应用,对应的保护是每日 75%。这两句是分组定义里的文字。本文没有另测命中率。
模型行还列出 openai-enterprise。同一份公开响应的 group_definitions 和 group_ratio 没有这个分组的倍率,所以上表不写它。未公开的 openai-first-topup 倍率是 0.015,定义写成单笔充值达到 20 美元后解锁。它不在公开可选分组里。密钥如果还配置了回退分组,请求离开活动分组之后,按实际承接的分组计费。openai-premium 的公开倍率是 0.13,这条模型的 enable_groups 里没有它。
三个算例
前两行落在短档。第三行是 28 万输入 token,整单用长档。缓存行假定用量记录把这些输入计为缓存命中。
| 请求 | 官网标价 | openai-award |
openai-stable |
|---|---|---|---|
| 10 万未缓存输入,5,000 输出 | $0.2500 | $0.0075 | $0.0200 |
| 10 万缓存读取,5,000 输出 | $0.0600 | $0.0018 | $0.0048 |
| 28 万未缓存输入,10,000 输出 | $1.2700 | $0.0381 | $0.1016 |
第一行是 0.1 × $2 + 0.005 × $10 = $0.25。第二行是 0.1 × $0.10 + 0.005 × $10 = $0.06。第三行是 0.28 × $4 + 0.01 × $15 = $1.27,分组列再乘 0.03 或 0.08。如果误用短档单价去乘这 28 万 token,award 会得到 $0.0198,那不是这一行的价格。实时页面是 gpt-6.1-sol 价格页。总表是模型与价格。
可以重试的开发和测试用 openai-award。日常生产和较长期项目,目录把 openai-stable 写成那一类默认。两个倍率是短档和长档目录价的 3% 和 8%。它们不是 Fast、Batch、Flex 或区域加价之后的 3% 和 8%。
在 Modelflare 上怎么调用
创建密钥时选择 openai-award 或 openai-stable。模型 ID 必须精确发送 gpt-6.1-sol。规范基址是 https://modelflare.dev/v1。同一套 API 也在 https://cf.modelflare.dev/v1 和 https://origin.modelflare.dev/v1。根域名是规范站点。
工具调用用 Responses。默认 effort 已是 medium,下面把它写明。
export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6.1-sol",
"reasoning": {"effort": "medium"},
"input": "审这份迁移计划,列出最需要补测试的三个假设。"
}'
Chat Completions 可以发不带工具的文本。字段名是 reasoning_effort。
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6.1-sol",
"reasoning_effort": "medium",
"messages": [
{
"role": "user",
"content": "审这份迁移计划,列出最需要补测试的三个假设。"
}
]
}'
POST /v1/responses/compact 列在这个模型上。它是对 gpt-6.1-sol 的压缩操作,不是另一个模型 ID。图片输入使用用户消息上的内容数组。两种入口的差别见 Responses API 与 Chat Completions 对比。用量怎么对上账单,见 AI API 成本追踪。
和 GPT-6 Sol 的请求差别
短档的输入和输出标价与 gpt-6-sol 相同,缓存读取从 $0.20 降到 $0.10。长档的输出两款都是 $15,长档缓存读取从 $0.40 降到 $0.20。gpt-6-sol 仍在目录里,这次的公开分组比 6.1 多 openai-premium。换成 6.1 时要固定返回的模型名,完成结果落在别的 ID 上就不算这次切换。
会失败的写法
reasoning.effort: none
reasoning.effort: minimal
Chat Completions 请求里携带 tools
none 和 minimal 返回 HTTP 400。从支持 none 的 gpt-6-sol 或 gpt-6-luna 迁过来时,用 low 重新比较,不要把 none 留在请求里。工具、计算机操作、文件搜索和网页搜索走 Responses。Chat Completions 只承担没有工具的请求。
切换流量前要核对的事
- 固定
gpt-6.1-sol。完成结果里的模型名也要是这个 ID。 - 公开价格按
openai-award或openai-stable估算,并按失败成本来选密钥分组。 - 用同一份不含敏感信息的集合,分别在
low、medium、high、xhigh和max上回放。none和minimal会返回 400。 - 工具放在 Responses 上。Chat Completions 的例子不带工具。
- 分别给 272,000 和 272,001 个输入 token 的提示计价。后者整单使用长档单价。
- 预算使用目录里的两档。模型页上的 Fast、Batch、Flex 和区域加价,以用量记录里实际出现的金额为准。
- 先看用量记录里的缓存 token,再使用上面的缓存算例。
- 最难的科学研究继续用
gpt-6-astra。gpt-6-sol继续可用。
来源
核对日期:2026 年 9 月 30 日。Modelflare 没有独立复现基准。
- 发布页:https://openai.com/index/introducing-gpt-6-1-sol/
- 模型页:https://developers.openai.com/api/docs/models/gpt-6.1-sol
- GPT-6 指南中的 6.1 一节:https://developers.openai.com/api/docs/guides/latest-model
- 系统卡附录:https://deploymentsafety.openai.com/gpt-6-1-sol
- Modelflare 价格接口:https://modelflare.dev/api/pricing
- 价格页:https://modelflare.dev/pricing/gpt-6.1-sol