METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Asana 将浏览器智能体模型成本降低 76 倍

Asana 借助 Codex 中的 GPT-6 Astra 进行了 144 次实验,把 StackAI 浏览器智能体的单次运行成本降至 0.47 美元。节省的大部分并非来自更换模型,而是来自缓存浏览记录并分批删除截图的设计。

Asana 将浏览器智能体模型成本降低 76 倍

图片:METAL

摘要

  • OpenAI 于 10 月 9 日公布案例:Asana 以 GPT-6.1 Sol 为基准优化浏览器智能体,使模型成本降低 76 倍、运行时间缩短 5 倍。
  • Codex 中的 GPT-6 Astra 发现浏览记录未被缓存,并完成了 2 种记录上限、6 种策略、4 个模型各运行 3 次的 144 次实验。
  • 仅靠优化,模型 B 的成本就降低了 29 倍;在较大的记录上限下,Sol 在 18 次运行中全部给出正确答案。

工作管理公司 Asana 在测试环境中将其无代码浏览器智能体的模型成本降低了 76 倍。OpenAI 在 10 月 9 日发布的客户案例中表示,Asana 在 OpenAI 的编程智能体 Codex 中使用 GPT-6 Astra 进行实验,以 GPT-6.1 Sol 为基准优化了浏览器智能体的工作流程,单次运行的模型成本估算平均降至 0.47 美元,运行时间缩短至约 4 分钟,比原有生产配置便宜 76 倍、快 5 倍。

优化对象是 Asana 收购的 AI 平台 StackAI 的浏览器智能体。客户在 StackAI 上无需编写代码即可构建浏览网站、填写表单和收集信息的工作流程。在 Asana 的规模下,这类工作流程中的微小低效会累积成巨大成本。StackAI 首席技术官 Frank Hidalgo 博士负责让智能体更便宜、更快,并把调查、改进测试和结果比较交给了 Codex 中的 GPT-6 Astra。

Astra 首先发现的是缓存漏洞。智能体缓存了固定指令和工具定义,却没有缓存浏览过程中不断累积的页面文本和截图记录,因此每次请求都要按全价重新发送整段记录。智能体几乎每一步都会删除旧截图并截断文本,每次修改都会改变记录,所以仅缓存记录并不起作用。被删掉的信息还可能迫使智能体重新访问已经读过的页面。

Hidalgo 从 Astra 提出的修复方案中选了三项:将缓存扩展到浏览记录、增加保留的文本量,以及不再每一步都删除截图而是分批删除。Astra 先通过快速测试确定哪些变量重要,随后改写了原本并非为对照实验设计的代码,使同一套前端和后端可以并行运行多个设置不同的工作流程。

正式实验共 144 次运行:12 万和 48 万字符两种记录上限、6 种缓存与截图策略,在 4 个模型上各运行 3 次。4 个模型是 GPT-6.1 Sol 以及另一家前沿实验室的模型 A、B、C。模型 A 是 2025 年秋季发布的较小模型,价格为 Sol 的一半;原本用于生产的模型 B 及其更新版模型 C 与 Sol 价格相同。任务是从公开演示目录中为 32 本书各收集 6 个字段,模拟 Asana 客户在 StackAI 上实际运行的工作。效果最好的策略是让截图累积到 20 张后只保留最新一张。两次删除之间,前面的记录能长时间保持不变,缓存因此得以发挥作用。

成本在每个阶段都在下降。仅靠优化,模型 B 的单次成本就从至少 36.21 美元降至 1.24 美元,降低 29 倍;GPT-6.1 Sol 的优化版本又便宜 2.6 倍,为 0.47 美元。单看 Sol,在较大记录上限下,新的缓存与截图策略把成本从 1.97 美元降至 0.47 美元,降低 4 倍。由于 89% 的输入来自缓存、价格只有未缓存价格的 5%,每次调用便宜了约 3 倍。METAL 查看的原始图表显示,优化后的模型 C 也降至 0.66 美元、3.5 分钟。仅就运行时间而言,模型 C 比 Sol 的 4.0 分钟更快,76 倍差距的大部分来自记录管理的改进,而不是更换模型。

记录上限还决定了智能体能否给出答案。GPT-6.1 Sol 在较小上限下 18 次运行中只有 3 次给出答案,而在较大上限下 18 次全部给出正确答案。OpenAI 表示,优化后工作流程的所有运行都完成了任务并返回了正确答案。每个会话的请求、数据记录和结果都保存在 Asana 的软件交付平台 Command 中,结论经由工单和拉取请求进入生产环境。

아사나 브라우저 에이전트의 1회 비용과 실행 시간 비교 도표. 모델 B 개발 기준선 36.21달러·22.5분 이상에서 모델 B 최적화 1.24달러·4.7분, 모델 C 최적화 0.66달러·3.5분, GPT-6.1 Sol 최적화 0.47달러·4.0분으로 줄었다

Hidalgo 说:"如果手工完成,这需要一到两个月。借助 Codex 中的 GPT-6 Astra,大约只用了一周:我睡前设定目标,早上查看结果。"他表示:"过去,成本限制了我们能为客户的这类工作负载提供哪些模型。"他解释说,提高智能体效率后,公司可以在降低运营成本的同时提供更好、更快的模型。Asana 首席产品官 Arnab Bose 表示:"工程师设定方向,GPT-6 Astra 运行实验,结果通过 Command 进入生产。"他称这就是人与智能体组成的团队在实践中的样子。

METAL 此前曾报道 OpenAI 发布 GPT-6.1 Sol。Asana 已将此次改动应用到 StackAI 的浏览器导航中,并正在开发让类似实验更易重复的工具。今后计划把这类测试纳入平台的评估功能,让客户和内部团队在配置智能体时比较成本、运行时间和答案质量。Asana 还在产品功能发布前使用 Astra 进行测试:Astra 浏览平台、尝试不同输入,并向人工 QA 审核人员报告漏洞。Hidalgo 说:"发布速度不再是瓶颈,人的注意力才是。"这个案例表明,智能体成本的相当一部分并不取决于模型单价,而取决于如何累积和删减记录;而寻找这种设计的实验本身,也开始交给智能体来做。

评论