
摘要
- OpenAI 于 10 月 7 日开始向所有 ChatGPT 用户推出 GPT-6。付费方案当天上线,Free 和 Go 方案次日上线,付费方案由 GPT-6 Sol 回答,免费方案由 GPT-6 Luna 回答。
- 新功能 Intelligent UI 会根据问题混合图形、图表、按钮和输入表单,在对话框内生成界面。借助原生组件库和编译器,界面会随着回答的生成逐步出现。
- GPT-6 在思考的同时就开始作答,公司表示,GPT-6 Instant 在网络搜索类问题上开始回答的时间平均比 GPT-5.6 Instant 早 44%。
OpenAI 于 10 月 7 日开始向所有 ChatGPT 用户推出 GPT-6。此举把上个月率先面向付费客户发布的 GPT-6 一代,扩展到每周使用 ChatGPT 的超过 12 亿人。此次推出还附带一项名为 Intelligent UI 的新功能。它不再只用文字作答,而是把图形、图表、可点击的按钮、输入表单等界面元素混合起来,直接放进对话框中。
推出顺序按订阅方案划分。发布当天,Plus、Pro、Business 和 Enterprise 方案的 Chat 标签页率先在全球上线,次日起扩展到 Free 和 Go 方案。Enterprise 的可用时间取决于公司管理员的设置。付费方案由 GPT-6 Sol 生成回答,Free 和 Go 方案则由 GPT-6 Luna 生成。OpenAI 表示,两款模型都针对日常对话做了调优。驱动 Work 和 Codex 的模型此次没有变化。据报道,此前 GPT-6 系列只能在 Work 和 Codex 中使用,而使用人数最多的 Chat 界面一直由 GPT-5.6 系列负责。
Intelligent UI 的核心在于由模型选择回答的形式。据 OpenAI 介绍,遇到比较类问题,它会把各项并排摆放;遇到需要解释的问题,它会画出可以点开查看的示意图。如果一段文字就是最有用的回答,它就直接用文字作答。发布文章以周日烤羊肉的安排为例。GPT-5.6 Instant 用表格列出了不同人数对应的肉量,而 GPT-6 Instant 则生成了一个改动客人数量就会立刻重新计算采购量的界面,以及一份八个步骤的烹饪清单。演示中还出现了把自驾游途经地点标在地图上的界面,以及可以按部件点开查看 7 速自行车结构的界面。
用户也可以要求当场做出所需的工具。OpenAI 举的例子包括展示储蓄如何增长的计算器、和朋友分摊晚餐费用的分账工具,以及在对话框里玩的游戏。在学习方面,它强调可以改变输入值来观察结果如何变化,或一步步解题的讲解方式。公司在 X 帖子中介绍说,Intelligent UI"让日常问题更直观,让复杂主题更易理解,并能当场提供适合当前任务的工具"。
其运作方式是固定部件与自由组装的结合。OpenAI 打造了一套支持流式传输的原生界面组件库,另外还做了一个在模型生成界面时即时处理界面的编译器。组件库为每个回答打下熟悉的设计基础,而如何组合这些部件由模型决定。得益于编译器,界面无需等整个回答完成,而是随着生成逐步出现。网页端和移动端能提供一致的体验,也要归功于这一结构。公司表示,在训练阶段,它按照清晰度、实用性和完整性来评估模型生成的界面,教会模型何时加入交互、何时文字就已足够。
OpenAI 也没有回避仍有工作要做。发布文章写道:"提升模型的设计判断力、扩大其可生成内容的范围,仍有工作要做。"尽管如此,公司仍将这项功能定位为人们与 ChatGPT 互动方式的重大转变。公司表示,ChatGPT 不再把所有问题塞进同一种对话形式,而是把界面、数据和操作结合起来,创造探索信息的新方式。
速度也一并做了调整。GPT-6 在完成思考之前就开始作答。推理模型问世后,用户可以把更难的问题交给模型,但必须等模型思考结束。OpenAI 表示,它训练模型考虑用户的等待时间,依据当时已掌握和找到的内容逐步构建回答,并让分几次给出的回答像一次写成的一样连贯、符合事实。
公司公布了两项数据。在汇集日常智能体任务的内部评估中,GPT-6 Extra High 与 GPT-5.6 Medium 在同一时间点开始作答,综合得分却高于 GPT-5.6 Extra High。在 METAL 查看的发布文章图表中,GPT-6 的曲线在每个开始作答的时间点上也都位于 GPT-5.6 之上。在需要网络搜索的问题上,GPT-6 Instant 开始回答的时间平均比 GPT-5.6 Instant 早 44%。图表注明,这一 44% 是在免费模型的真实线上流量中测得的。公司表示,模型在判断何时搜索、寻找支撑回答的信息方面也有所提升,但这两项数据都是 OpenAI 自行测得的内部评估结果。
安全训练以此前 Astra 的成果为基础。据 OpenAI 介绍,GPT-6 比 GPT-5.6 Sol 更能抵御绕过安全训练的尝试,尤其是跨多轮不断变换手法的攻击。针对网络攻击、生物威胁和暴力相关的高风险滥用,公司根据实际使用中的经验更新了防护措施。模型经过训练,能借助对话历史和上下文识别单条提示中看不出的风险,并减少对无害请求的不必要拒绝。公司的评估是,当缺乏回答所需的信息或工具时,模型会更清楚地说明这一点,详细结果载于系统卡。METAL 此前曾报道 OpenAI 的 GPT-6 Sol 和 Luna 发布以及 GPT-6 模型指南发布。


从 AI 工程师的角度看,这次发布的分量与其说在模型分数,不如说在界面的构建方式。OpenAI 没有让模型直接整段编写 HTML,而是让它从经过验证的组件清单中挑选、组装,再由编译器边流式输出边渲染结果。这是一种折中:既把设计约束住、避免每次都走样,又把形式的选择权交给模型。它与边思考边作答的功能也处在同一条轴线上。两者都让回答的第一个画面更早出现。OpenAI 在发布文章结尾写道:"不是人去适应软件,而是软件来适应人。"即使 12 亿人提出同一个问题,每个人也可能得到不同的界面,剩下的问题是,模型选择的形式究竟有多频繁真正胜过一段文字。





评论