METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

OpenAI 发布 GPT-6 Sol 与 Luna

OpenAI 推出了两款以与 GPT-6 Astra 相近方法训练的模型。相比 GPT-5.6 的促销价,API 价格下调一半;在业务自动化评测中,每项任务的成本比 Claude Opus 5 低十倍以上。

OpenAI 发布 GPT-6 Sol 与 Luna

摘要

  • OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna,并上线 ChatGPT Work、Codex 与 API。
  • 两款模型的 API 价格相比 GPT-5.6 促销价下调 50%,缓存输入 token 的读取享有 90% 折扣。
  • 在 AutomationBench 1.0.6 中,GPT-6 Sol 得 33.2%,高于 Claude Opus 5 的 26.9%,而每项任务成本约为后者的 9%。
Introducing GPT-6 Sol and Luna

OpenAI 于 9 月 22 日发布了 GPT-6 Sol 与 GPT-6 Luna。两款模型以与本月初推出的 GPT-6 Astra 相近的方法训练,但这次发布瞄准的坐标不是性能本身,而是成本。公司表示,通过让缓存与推理更高效而省下的部分会直接让渡给用户和客户,两款模型的 API 价格相比 GPT-5.6 促销价下调了 50%。

差距在业务自动化评测中体现得最明显。AutomationBench 1.0.6 让智能体用 47 种工具,从头到尾完成销售、市场、运营、支持、财务与人力等工作,GPT-6 Sol 在 xhigh 设置下得到 33.2%。同一张表中,Claude Opus 5 在 max 设置下为 26.9%,每项任务成本是 Sol 的 11.1 倍。加了回退的 Claude Fable 5.1 分数更高,为 31.4%,但成本超过 Sol 的 8.9 倍,而且该数字并未计入约 40% 任务中发生的 Opus 5 回退成本。即便是 GPT-6 Astra,在 low 设置下也只有 30.3%,低于 Sol,成本却是 3.9 倍。

衡量长周期专业工作的 Agents' Last Exam V1 中,次序也类似。这项评测把计算机上完成的主要职业工作分为 55 个细分行业,GPT-6 Sol 在 max 设置下取得 56.4%。该成绩高于 Claude Opus 5 在同一评测中的最高分,而每项任务成本低 60%。

编程方面的数字更为紧凑。检验智能体能否产出可合并进真实代码库的改动的 FrontierCode 1.1 Main 中,Sol 大幅超越前作 GPT-5.6 Sol,与 Claude Fable 5.1 的 xhigh 设置相当。设置长周期软件工程任务的 DeepSWE 1.1 中,Sol 在 max 设置下得到 68.8%,与 Claude Fable 5 的最高分 69.9% 相差 1.1 个百分点,而每项任务成本低约 80%。GPT-6 Luna 在同一评测中得 66.6%,与 Claude Opus 5 和 Fable 5 的 medium 设置相当,每项任务成本比 Opus 5 低 93%,比 Fable 5 低 96%。

在直接操作计算机的任务上,两者几乎贴在一起。OSWorld 2.0 离线集合中,Sol 在 xhigh 设置下得到 60.5%,与 Claude Opus 5 在 medium 设置下的 60.3% 基本相同,每项任务成本低约 80%。GPT-6 Luna 在 max 设置下超过 GPT-5.6 Sol 的 medium 设置,成本只有十分之一。公司写道,计算机使用方面世界最好的模型依然是 GPT-6 Astra。

事实性由一项内部评测衡量,题目取自用户标记过错误的真实对话并做了匿名化处理。在这组专门诱发错误的题目上,GPT-6 Sol 的失误比前作减少约一半,GPT-6 Luna 在提高努力设置后也能达到 GPT-5.6 Sol 的水平,成本约为其百分之一。公司同时说明,这些题目并不代表错误本就少见的日常使用。

缓存在这次发布中的分量与价格相当。默认缓存命中率提高,让智能体复用更多上下文,缓存输入 token 的读取享有 90% 折扣。开发者可以在 Prompt Caching Dashboard 中查看输入有多少被缓存,并用诊断工具确认错过的缓存机会与需要修改之处。提高或降低推理努力、开启或关闭工具时,先前的上下文都会被保留,显式断点还能让开发者自行选择缓存前缀结束的位置。GitHub 表示,最近几个月里这些改进让数十亿次请求中需要重新处理的 prompt token 比例减少了一半以上。

表达方式也一并调整。Astra 上打磨过的对话方式被带入 Sol 与 Luna,减少术语与冗余细节,回答整体略短,公司称这在技术与编程对话中尤为明显。在对齐评测中,两款模型也优于 GPT-5.6 一代,就自身编程工作作出误导性陈述的比例下降。

OpenAI 在发布文中写道:"最苛刻、最重要的项目仍然需要 Astra 的完整深度,但工作发生在不同的规模、节奏与预算之中。"公司的官方开发者账号当天表示:"用 Sol 构建,用 Luna 扩展。"

两款模型当天在 ChatGPT Work 与 Codex 中向 Plus、Pro、Business、Enterprise 与 Edu 用户开放。Free 与 Go 用户可以在桌面应用中使用 GPT-6 Luna,两者尚未进入 Chat。API 名称为 gpt-6-sol 与 gpt-6-luna。据报道,企业工作区需要管理员先启用新模型才会出现在列表中,桌面应用的版本说明中写明其消耗的 token 少于同级的 GPT-5.6 模型。

METAL 确认,OpenAI 官方账号公开的视频时长 8 秒、画面为 1920×1080,该帖浏览量为 233 万次,点赞 3 万次。METAL 曾报道GPT-6 Astra 同时带着对齐改进与致命级网络能力评级面世,而这两款模型是把那一代的方法下放到更低档位的位置。

归结起来,这次发布争夺的不是新能力,而是同样能力的价格。表格中的每一项比较都把分数与每项任务成本成对放置,OpenAI 挑选的对手则是自家最高端模型与竞争对手的高端模型。这是一个信号:选择模型的依据正从单一的性能一行,转向分数与成本两条轴。

评论