
图片:METAL
摘要
- OpenAI 于 10 月 2 日发布官方模型指南,整理了如何按工作负载选择、指示和运行 GPT-6 系列三款模型。
- 指南将 Astra 用于最困难的推理,Sol 用于编程、研究和计算机操作,Luna 用于重复性工作,并表示缓存输入 token 最多可便宜 95%。
- 指南收录了 Harvey、Cognition、Hex 和 Invideo 使用 GPT-6 Astra 的案例,Invideo 表示其调色任务成功率提高约 3 倍。
OpenAI 于当地时间 10 月 2 日发布官方模型指南,整理了 GPT-6 系列三款模型分别适合什么工作以及该如何使用。指南依次介绍了如何为任务选择合适的模型、推理强度和速度,如何修改提示词、技能和代码仓库指令,如何引导持续数小时乃至数天的长时任务,以及在投入实际服务前应检查的事项。OpenAI 称 GPT-6 是其迄今最先进的模型系列,并将指南的适用范围设定为从把想法变成可运行原型,到跨越代码仓库、数据库和外部 API 的多步骤工作流。
模型选择分为三条路线。根据指南,GPT-6 Astra 适用于需要最高智能的最困难推理工作,GPT-6.1 Sol 适合复杂编程、研究和计算机操作。GPT-6 Luna 则用于目标明确的大规模日常重复工作,例如提取发票字段、对请求分类或生成结构化摘要。OpenAI 建议把模型选择和推理级别视为智能与价格之间的权衡,并针对每项任务比较各模型的定价。
推理强度分为四档。低档用于提取事实或小幅修改等常规任务,中档用于规划功能或比较方案等需要判断的工作,高档用于困难调试、深入分析或细致审查。指南写道,超高和最高档只应在高档不够用时测试,并且只有在改进足以抵消增加的时间和成本时才保留。在 API 中,对话中途更改推理强度不会破坏缓存。速度选项也有两种。Fast 模式适用于聊天应用或编程工具等重视响应时间的场景,以高于标准处理的每 token 成本换取更快、更稳定的响应;Ultrafast 则与推理强度无关,直接加快 token 生成速度,仅适用于 GPT-6 Astra。

指南将提示词缓存列为降低运营成本的关键手段。据 OpenAI 介绍,视模型不同,缓存输入 token 比未缓存输入 token 最多便宜 95%。要发挥这一优势,需要把稳定的指令和参考资料放在前面,把变化的任务细节放在后面,并保持工具定义一致。指南表示,估算完整工作流成本时应计入缓存写入成本和长上下文费率,并建议在较长对话中使用压缩功能,在保留继续所需状态的同时缩小上下文规模。部署前,指南建议运行具有代表性的任务,测量任务成功率、延迟以及每个成功任务的成本。
关于提示词的建议可以概括为更少、更清晰。OpenAI 开发者体验负责人 Eric Provencher 表示:"模型理解细微差别和模糊性的能力已大幅提升,因此过去有帮助的过度具体的指导,现在反而可能妨碍结果。"指南建议先写明想要的结果、结果面向的对象、相关背景与约束,以及完成的标准。技能描述应简短,并明确每项技能何时运行;辅助细节只在需要时加载,用指导取代僵化的流程。AGENTS.md 中应说明哪些文档和测试在什么时候相关,并明确授权安全的常规工作流,例如在不访问生产环境的情况下用一次性数据运行本地测试。
指南还要求把决策边界写成文档。也就是区分模型可以自行推进的操作和需要批准的操作,并用清晰的边界取代"凡事先问"的笼统规则。例如,摘要如何组织可以交由模型决定,但更改项目范围前应先确认。完成的定义应包括实施更改、运行、检查结果和修复失败的全过程。对于最终回复,指南建议采用简短交接形式,说明改了什么、检查了什么、还有什么待处理。
长时任务功能按 API 和 Codex 分别介绍。在 API 中,开发者可以通过 Responses WebSocket API 使用回合中引导功能,向正在工作的模型发送修正指令;指令会排队,不会取消正在运行的工具,也不会撤销已完成的操作。使用异步工具调用时,应用运行测试等较慢任务期间,模型可以继续处理无关工作。GPT-6.1 Sol 在 Responses API 中支持多智能体工作流,可将调查代码库不同部分等独立工作分配给子智能体,再把结果合并为一个回复。多智能体功能目前仍处于测试阶段。在 Codex 中,GPT-6 Astra 可以在工作过程中向用户提出澄清问题,用户也可以向进行中的任务输入新信息来调整方向。
计算机操作功能向三款模型全部开放。根据指南,GPT-6 Astra、GPT-6.1 Sol 和 GPT-6 Luna 可以直接操作网站和桌面应用,包括没有 API 的程序。这意味着从调查漏洞、修复代码,到在浏览器中打开产品确认修复是否生效,都可以在一个流程中交给模型完成。OpenAI 表示,能用 API 或已连接工具直接完成的工作就用这些方式,只有在需要读取屏幕、点击按钮或填写表单时才使用计算机操作。若要集成到自有应用中,指南建议浏览器使用 Playwright,桌面应用使用 PyAutoGUI。
指南还收录了四个在实际服务中使用 GPT-6 Astra 的企业案例。法律 AI 公司 Harvey 结合法院信息、判例、律所文件和律师偏好来定制起草文书。联合创始人 Gabe Pereyra 表示:"我们可以给模型更多上下文,产出结构越来越好的结果。"Cognition 在 Devin 中使用 GPT-6 Astra 测试软件并返回证据;在一个 iPhone 游戏案例中,Devin 提交了模拟器录屏,以及区分已通过检查和未测试领域的报告。Hex 把关于销售渠道表现的问题转化为包含地区细分的书面分析和交互式仪表板,并让模型再次检查数字是否合理。Invideo 表示,其调色任务成功率提高了约 3 倍,几位编辑一天内制作了约 50 个特效。
METAL 此前曾报道 OpenAI 发布 GPT-6.1 Sol,这份指南是 OpenAI 在 Sol 发布三天后亲自梳理三款模型用途的官方文件。METAL 查阅的指南原文附有模型卡图片,还收录了一位用 GPT-6 Astra 长时间重构异步工作进程的开发者,以及另一位用 Ultrafast 和实时引导修复 iPad 兼容性的开发者的经验。
从 AI 工程师和技术项目经理的角度看,这份指南转移的重心很明确。提升性能不再是写更长的提示词,而是决定交给模型什么、在哪里停下、什么算完成。成本管理也从挑选单一模型,变成组合缓存结构、推理强度和速度选项的设计问题,而 OpenAI 提出的衡量单位不是每 token 单价,而是每个成功任务的成本。在模型承担持续数天工作的阶段,写明边界和完成标准的指令文档,正在成为与代码同等重要的开发团队核心产出。





评论