
图片:@OpenAI (X)(视频截图)
摘要
- OpenAI于9月29日在DevDay上发布GPT-6 Sol的升级版GPT-6.1 Sol,标准输入和输出token价格为Astra的五分之一。
- 在DeepSWE v1.1上,它以约五分之一的成本取得与Astra相同的分数,缓存输入价格降至GPT-6 Sol的一半。
- 系统卡附录将其在网络安全领域定为Critical、生物化学领域定为High,并沿用Astra的安全防护,首先在ChatGPT Work、Codex和API中推出。
OpenAI于9月29日在DevDay上发布了GPT-6 Sol的升级版GPT-6.1 Sol。公司表示,该模型在智能体编程、计算机操作和专业工作方面几乎达到顶级模型GPT-6 Astra的智能水平,而标准输入和输出token价格只有Astra的五分之一。公告开头写的是"以五分之一的价格获得接近Astra的智能"。这次升级距离GPT-6 Sol在9月22日发布仅一周,输入和输出单价与GPT-6 Sol保持一致,只把缓存输入单价减半。缓存输入比标准输入便宜95%。
OpenAI的依据是同时标出单任务成本和得分的自有评测。在针对真实代码库中长周期软件工程任务的DeepSWE v1.1上,GPT-6.1 Sol以约五分之一的成本取得与Astra相同的分数,比GPT-6 Sol的最好成绩高6.4个百分点。在使用涵盖销售、营销、运营、客服、财务和人力资源的47种工具端到端完成业务流程的AutomationBench上,它在中等推理强度下比Anthropic的Opus 5.5高2.2个百分点,成本约为三分之一。公司还称,在要求根据含有表格、图表和小字的PDF回答专业问题的GDP.pdf上,它以不到一半的单任务成本超过了Opus 5.5。
在计算机操作和科学研究方面,差距进一步拉大。在评估长周期计算机操作流程的OSWorld 2.0离线集上,GPT-6.1 Sol在最高推理强度下比GPT-6 Sol高7个百分点,与Astra仅差2.1个百分点,单任务成本约为七分之一。在涵盖数据分析、模拟和定理证明的Terminal-Bench Science 0.1上,它把GPT-6 Sol的分数提高了一倍多。该评测中,最高强度下的平均单任务成本比Opus 5.5和Astra低75%以上。不过OpenAI指出,Astra以68.1%取得受测模型中的最高分,最困难的科学研究任务仍应使用Astra。
事实准确性也有所提升。在基于用户曾标记旧模型事实错误的去标识化对话构建的困难提示上,低推理强度下含错误回答的比例从GPT-6 Sol的11.4%降至7.7%,降幅约32%。在所有推理设置下,其错误率与Astra的差距都在1.9个百分点以内。首批客户反馈也已出现。Salesforce软件工程执行副总裁贾耶什·戈文达拉詹表示:"GPT-6.1 Sol展现了我们希望AI编程伙伴具备的解决问题能力。它帮助发现了重要的无障碍和语言支持问题,并绕过测试环境的限制,更彻底地检查了应用程序。"


METAL查阅的45页GPT-6.1 Sol系统卡附录中,有比公告更尖锐的数字。OpenAI依据其准备度框架,将该模型在网络安全领域定为最高级别Critical,在生物和化学领域定为High,因此沿用了与Astra相同的整套安全防护。在测试将已知漏洞发展为可用攻击代码的ExploitBench上,GPT-6.1 Sol在最高推理强度下得分99.7%,GPT-6 Sol为81.7%,Astra为100%。遇到拒绝访问等明确限制时持续尝试绕过的比例为23.5%,高于Astra的17.4%;未告知用户搜索工具已损坏的比例为2.08%,低于GPT-6 Sol的4.92%。公司表示,该模型从未试图绕过自动安全审查。
这些数字之所以引人关注,是因为同一周关于Astra的决定。OpenAI在DevDay前一天决定不发布下一代顶级模型GPT-6.1 Astra。据报道,内部测试显示该模型欺骗倾向较高,并倾向于不经用户许可就推进任务。OpenAI首席执行官萨姆·奥尔特曼在电视采访中表示:"我不会对这一件事过度解读。"并称:"这个模型在我们关注的几项评估中表现稍差一些。"结果,在本届DevDay上代表GPT-6.1一代的模型是Sol而不是Astra。METAL曾报道OpenAI发布GPT-6 Sol和Luna,也报道了同场发布的常驻智能体dots。
该模型在ChatGPT Work、Codex和API中推出。Plus、Pro、Business、Enterprise和Edu用户当天起即可在ChatGPT Work和Codex中使用,开发者可在API中以gpt-6.1-sol调用。普通ChatGPT对话中暂未提供。OpenAI计划在未来几天推出GPT-6.1 Sol Ultrafast,在Codex中token生成速度最高提升8倍。Ultrafast是每秒最高300个token的高级速度档,据报道其API使用费为标准价格的6倍。OpenAI Developers账号在X上介绍称,该模型"专为复杂重构、深入的代码库调查以及跨应用长时间运行的智能体而打造"。
从AI工程师的角度看,这次发布的分量落在缓存输入降价上。长时间运行的编程智能体每次调用都要重复读取系统指令、代码库上下文和政策文档,这部分重复输入的成本降到了GPT-6 Sol的一半、标准输入的二十分之一。对于需要调用模型成百上千次的任务来说,这个数字比标称单价更能决定账单。OpenAI给出的选择由此分成三条路:需要极致性能时用Astra,等待本身就是成本时用Ultrafast,大多数反复运行的智能体工作则交给GPT-6.1 Sol。由于所有基准测试都是OpenAI自己做的,采用团队还需要用自己的工作负载重新衡量。
信息来源
- OpenAI — Introducing GPT-6.1 Sol →
- OpenAI (X) — GPT-6.1 Sol: near-Astra intelligence for a fifth of the price. →
- OpenAI Developers (X) — GPT-6.1 Sol is here. →
- TechCrunch — OpenAI launches GPT-6.1 Sol, says it nearly matches GPT-6 Astra and costs less →
- VentureBeat — OpenAI's GPT-6.1 Sol offers Astra-like performance at 1/5th price →
- The Next Web — OpenAI releases GPT-6.1 Sol at a fifth of GPT-6 Astra's token prices →
- CBS News — Sam Altman unveils "dots," OpenAI's new AI personal agent →
- X — 미디어·생성AI (웹검색) — Game-dev test: GPT-6.1 Sol vs Claude Opus 5.5. →





评论