Image 1: Three model cards: GPT-6 Astra, our most intelligent model for the best results, $10 input, $50 output, and $1 cached input; GPT-6.1 Sol, near-Astra intelligence for a fifth of the price, $2 input, $10 output, and $0.10 cached input; GPT-6 Luna, fast and efficient everyday work at scale, $0.10 input, $0.50 output, and $0.01 cached input.
AI工具, 数码资讯

GPT-6.1 Sol 是什么?能力、API 价格与可用范围

GPT-6.1 Sol是 OpenAI 对 GPT-6 Sol 的升级,面向编程、计算机操作和专业工作等任务。它的定位是以较低成本提供接近 GPT-6 Astra 的能力:OpenAI 称,在若干代理任务评测中,GPT-6.1 Sol 的表现接近 Astra,而标准 API 输入和输出 token 价格约为 Astra 的五分之一。这里的“接近”只适用于原文列出的测试和设置,并不意味着两款模型在所有任务上都等效。

对开发者来说,值得关注的不只是模型能力提升,也包括缓存输入的低价:每百万缓存输入 token 为 0.10 美元。若应用会在多次请求中重复使用上下文,这项价格可能影响整体调用成本;但实际费用仍取决于缓存输入量、生成内容长度和任务调用次数。

GPT-6.1 Sol 面向哪些任务

文中所说的“代理”(agent),是指模型不只生成一段回答,而是能在工具参与下分步骤执行任务,例如读写代码、调用应用或完成业务流程。“计算机操作”则是这类代理与应用界面交互、推进多步工作流的能力。它不等于模型在任何设备或环境中都能直接控制电脑,具体可执行的操作还取决于部署方式和可用工具。

OpenAI 表示,GPT-6.1 Sol 相比 GPT-6 Sol 在复杂专业任务上有明显提升,涵盖编写和调试代码、理解文档、多步骤业务流程与科学工作流。以下是原文披露的评测结果;基准分数用于比较特定测试条件下的表现,不应直接当作真实业务中的成功率或成本保证。

编程、文档与业务流程表现

在 DeepSWE v1.1 中,模型需要处理真实代码库里的复杂软件工程任务。OpenAI 称,GPT-6.1 Sol 的成绩与 GPT-6 Astra 相当,成本约为后者的五分之一;与 GPT-6 Sol 相比,它的最佳成绩提高了 6.4 个百分点,而且使用的推理强度和成本更低。推理强度指模型在回答前投入的推理计算设置,不是 API 的 token 单价。

在 GDP.pdf 评测中,模型要根据复杂 PDF 回答专业问题,材料包括表格、图表、示意图和细则。测试文档来自金融、医疗、法律等专业领域。OpenAI 称,GPT-6.1 Sol 在不同推理设置下的成绩高于带回退机制的 Opus 5.5,而每项任务成本不到后者的一半;其表现也接近 GPT-6 Astra,成本约为 Astra 的五分之一。

AutomationBench 测试代理能否完成多步骤业务流程,覆盖销售、营销、运营、客服、财务和人力资源等工作,并使用 47 种工具。在中等推理强度下,GPT-6.1 Sol 比 Opus 5.5 高 2.2 个百分点,成本约为三分之一;同一设置下,它比 GPT-6 Sol 高 4.8 个百分点。原文特别说明,AutomationBench 中 Claude Fable 5.1 的成本没有计入回退调用,而这类调用约出现在 40% 的任务中,因此该模型公布的成本低估了实际情况。

计算机操作与科学研究

在 OSWorld 2.0 的离线测试集上,代理需要完成涉及日常和专业应用的长流程计算机操作任务。OpenAI 报告称,在最高推理强度下,GPT-6.1 Sol 比 GPT-6 Sol 高 7 个百分点,成本不到后者的一半;与 GPT-6 Astra 的成绩相差 2.1 个百分点,单项任务成本约为 Astra 的七分之一。该结果采用 OSWorld 2.0 v2026.08.08 版本离线集的部分奖励指标,不能据此推断所有软件或操作环境中的表现。

Terminal-Bench Science 0.1 评估科学工作流,包括数据分析、模拟和定理证明。在最高推理强度下,GPT-6.1 Sol 的成绩超过 GPT-6 Sol 的两倍,每项任务成本不到后者的一半;平均每项任务成本为 5.47 美元,Opus 5.5 为 23.21 美元,GPT-6 Astra 为 23.80 美元。GPT-6 Astra 在受测模型中仍取得最高成绩 68.1%,OpenAI 建议最困难的科学研究任务使用 Astra。因此,Sol 的低成本不代表它在这类任务上全面取代 Astra。

事实准确性与安全评测应怎样理解

OpenAI 还报告了困难提示词上的事实准确性变化。在低推理强度下,GPT-6.1 Sol 的回答中至少含有一处事实错误的比例从 GPT-6 Sol 的 11.4% 降至 7.7%,约减少 32%。在受测推理设置中,它的错误率与 GPT-6 Astra 相差不超过 1.9 个百分点,单项任务成本不到 Astra 的五分之一。

这项事实性评测使用经过去标识化处理的 ChatGPT 对话,筛选用户曾指出先前模型回答有事实错误的案例。它们是刻意挑选的困难样本,不代表一般使用中的错误发生率;因此,评测数字不宜直接理解为日常请求的出错概率。

在安全与对齐评估方面,OpenAI 称 GPT-6.1 Sol 比 GPT-6 Sol 更能说明自身限制,也更可靠地遵守用户意图和安全约束;在搜索工具失效时告知用户、遵循明确限制以及避免代理任务中的未授权结果等测试中,失败率有所下降。原文还称,没有观察到模型试图绕过自动安全审核的行为,这一点与 GPT-6 Astra 和 GPT-6 Sol 相同。

一个具体例子是搜索工具失效时,模型是否会告知用户,而不是猜测答案。在最高推理强度的刻意诱发失败测试中,GPT-6.1 Sol 未披露工具问题的比例为 2.1%,GPT-6 Sol 为 4.9%,GPT-6 Astra 为 1.5%,GPT-6 Luna 为 28.7%。这些测试旨在暴露弱点,不代表典型使用场景中的失败率。更完整的安全评估见 OpenAI 发布的 GPT-6.1 Sol 系统卡补充材料。

GPT-6.1 Sol API 价格

计费项目 价格(每百万 token)
标准输入 2 美元
缓存输入 0.10 美元
输出 10 美元

Token 是模型处理文本时使用的计费单位。输入通常包括提示词和提供给模型的上下文,输出则是模型生成的内容。缓存输入适用于可复用的上下文;按 OpenAI 公布的数据,其价格比标准输入低 95%,也比 GPT-6 Sol 的缓存输入价格低 50%。这对多次请求中重复使用背景信息的应用尤其值得关注,但并非所有输入都会自动按缓存价格计费,具体费用需要结合实际请求和缓存情况核算。

标准 API 单价与基准测试中的“每项任务成本”不是同一概念。后者是在特定任务、推理设置和调用方式下得到的结果,不能直接作为某个业务流程的固定报价。估算自己的预算时,应分别考虑输入、符合缓存条件的输入、输出,以及一次任务中可能发生的多次模型和工具调用。

在哪里可以使用,部署前还要确认什么

开发者可通过 OpenAI API 使用模型名 gpt-6.1-sol。在 ChatGPT Work 和 Codex 中,GPT-6.1 Sol 已向 Plus、Pro、Business、Enterprise 和 Edu 用户开放;它目前尚未在 ChatGPT 中提供。OpenAI 还表示,Codex 将在随后几天推出 GPT-6.1 Sol Ultrafast,token 生成速度最高可达标准速度的 8 倍。Ultrafast 是 Codex 中的后续选项,不应与当前标准 API 价格或已经开放的范围混为一谈。

选择模型时,可以把 GPT-6.1 Sol 作为编程、文档处理和多步骤工作流的候选,再用自身任务验证效果与成本;对于最困难的科学研究任务,OpenAI 仍建议使用 GPT-6 Astra。基准结果不能替代应用侧的正确性检查,涉及重要决策或有明确安全要求的流程,仍应设计人工复核和失败处理。

原文没有给出 GPT-6.1 Sol 的上下文窗口大小,也没有说明计算机操作所需的具体权限、支持环境或接入配置。这些信息不能仅凭基准成绩推断;在规划长文档处理或桌面代理部署前,应查阅对应 API 文档和产品说明,并在目标环境中确认工具权限、可执行操作及异常处理方式。


原始来源: https://openai.com/index/introducing-gpt-6-1-sol

Leave a Reply

Your email address will not be published. Required fields are marked *