
图片:METAL
摘要
- OpenAI 于 9 月 10 日推出公开测试版 Agents API,把 Codex 框架变成托管服务,由 OpenAI 负责会话、编排、上下文压缩与恢复。
- 不收额外费用,只按智能体实际消耗的 token 和工具计费;想在自有基础设施上运行沙箱的团队,可以从 Cloudflare、Oracle、Vercel 等九家合作方中选择执行环境。
- 数据驻留目前只支持美国,且不支持零数据留存。文档明确写道,即便把沙箱放在自有基础设施上,也不会因此符合零数据留存条件。
OpenAI 把驱动 Codex 的那套运行框架本身开放成了 API。9 月 10 日公布的 Agents API,是把 Codex 框架以 OpenAI 代为运营的形式交给应用的产品,目前所有开发者都能使用的公开测试版。公司表示,会话、编排、上下文压缩和恢复都由自己承担,应用只需要挑选工具和执行环境。
只要动手做过智能体的团队都清楚难点在哪里。调用模型并不难,难的是模型之外的部分。你需要一层单独的执行机制,能理解任务、保持上下文、调用工具、处理失败,还能在获得人工批准后接着往下走。OpenAI 把这一层称为 harness,并说明 Codex 应用、命令行工具和 IDE 扩展全都跑在同一套框架之上。
翻开文档会发现,这个产品只由四个概念搭成:把模型、指令、工具和 MCP 服务器捆在一起的智能体,负责读取文件、执行命令的环境,让工作延续下去的会话,以及在其中往来的事件与条目。创建会话后由 OpenAI 准备环境,投入任务就跑完一轮,进度可以用流式输出或 webhook 跟踪,你也可以在同一个会话里追加下一项任务,或者在任务运行途中改变方向。
托管框架替你做的事也一条条写得清楚。它在沙箱中执行命令和代码,按情况套用技能与指令,通过工具或 MCP 连上外部数据,在工作途中改变方向,把先前的工作压缩成摘要来管理上下文窗口,把任务拆开交给子智能体,还能让停下的会话从原处重新开始。官方示例把模型设为 GPT-6 Astra,并把同时运行的子智能体上限定为四个。
计费方式很简单。OpenAI 表示 Agents API 本身不收额外费用,只需支付智能体实际用掉的 token 和工具费用。由 OpenAI 托管的沙箱按标准容器费率计算;为了想在自有基础设施上运行的团队,公司写道已与 Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel 九家一起准备了执行环境选项。
关于"分数是框架做出来的"这一说法,已经有数字佐证。据 OpenAI 开发者文档,仅靠保留推理和压缩上下文这两项设置,GPT-5.6 Sol 在 ARC-AGI-3 上的成绩就从 13.3% 升到 38.3%,输出 token 还减少到六分之一。METAL 曾报道过同一套框架设置把 Astra 的分数抬到了什么程度,而这次的 API,正是让别人的应用里也能用上这套设置的产品。
先用上的公司用数字说明了效果。Ciridae 首席技术官 Jack Weissenberger 表示:"用上 Agents API 之后,我们的评测分数从 0.71 升到了 0.85。"他还说:"在过去的配置里观察和指挥子智能体相当麻烦,新的 API 让我们的延迟减少了 4 倍。"把案件审核流程迁过去的 SafetyKit 技术团队成员 Bhavyansh Sabharwal 写道,单件成本下降 60%,延迟也降低了,token 效率明显改善。
也有团队把理由归在架构本身。Hypha 首席工程师 Serhii Shchoholiev 表示:"在金融服务里,赢得客户信任比什么都重要。"他还说:"把智能体框架从沙箱中拆分开来之后,我们把失败的智能体响应减少了 86%。"物流公司 Nash.ai 联合创始人兼首席技术官 Aziz Alghunaim 解释说,管理数亿笔配送的长时运行智能体,需要的正是能撑住会话、恢复和多步执行的那一层。
把 Codex 框架嵌进产品的做法,早已走出了编程领域。据 OpenAI 开发者文档,Thrive Holdings 与 Crete 把 Codex 用在报税准备工作中,在试运行里处理了 7,000 份申报,准备时间缩短约三分之一。公司建议把智能体放进人们本来就在看的界面,比如安全分析师的调查队列、客服人员的账户历史页面、产品团队的任务看板,并一并公开了事故响应、Slack 机器人、数据分析、GitHub issue 调查、文档审阅五个示例应用。
公司自己写下的限制也在同一份文档里。Agents API 目前的数据驻留只支持美国,不支持零数据留存。文档明确写道,即便把沙箱放在自有基础设施上,也不会因此符合零数据留存条件。对那些必须先弄清数据留在哪里、留多久的机构来说,这一句话就决定了能不能采用。
从工程师的位置看,这次发布的核心不是功能清单,而是边界。过去由团队自己决定的事情里,也就是何时压缩上下文、哪些工作拆给子智能体、哪些动作需要人工批准,前两项转移到了平台一侧。交出去之后代码会变少,但能调的旋钮也跟着变少,智能体出问题时能翻看的那一层又远了一步。
OpenAI 减轻这种负担的办法,是把框架开源。公司说明,它把 Codex 框架、命令行工具、app server 和官方 SDK 放在公开仓库里,让开发者能直接查看并修改应用与模型之间的这一层。这意味着用托管 API 撞上瓶颈的团队,还可以在自己的基础设施上跑同一套框架,因此锁定程度比一般的托管服务要弱。
METAL 读过的官方文档,清楚写明了做智能体的公司还必须握住什么。OpenAI 拿走会话和恢复,留给应用的是工具、界面和审批流程。从现在起,智能体产品的差异不再取决于循环写得多好,而取决于你在这个循环上接了什么工具、接了什么审批。





评论