METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

OpenAI 公布 Parallel 的 Astra 采用案例

网络研究基础设施初创公司 Parallel 表示,GPT-6 Astra 将其长时间研究任务的耗时和成本都减半。提速的原因被归结为搜索次数更少、更精准。

OpenAI 公布 Parallel 的 Astra 采用案例

摘要

  • OpenAI 于 9 月 22 日公布了 Parallel 采用 GPT-6 Astra 的案例。
  • 在劳动力市场研究测试中,Astra 用时仅为此前模型的一半,代码成本降低约 50%。
  • 在 Parallel 的搜索能力排行榜上,Astra 也以 70.3 的搜索智能分数位列 24 个模型第一。
Parallel cut research time and cost in half with GPT‑6 Astra

OpenAI 于 9 月 22 日公布了为 AI 智能体打造网络研究基础设施的初创公司 Parallel 采用 GPT-6 Astra 的案例。Parallel 表示,将长时间研究任务交给 Astra 后,完成时间缩短到此前模型的一半,代码成本下降约 50%。据该公司介绍,产出质量保持不变。

Parallel 为通过搜索网络完成知识工作的智能体提供工具。根据 OpenAI 的案例页面,其工具的用途涵盖从为语音智能体提供网络依据,到为金融机构和法律客户开展研究,运作方式是将前沿模型与网络搜索结合。页面将该公司标注为北美初创企业,使用的产品为 API

问题出在耗时最长的研究任务上。此前要在这类任务上得到好答案,就得用更大的模型加上长时间推理,相应地耗费更多时间和资源。Parallel 技术团队成员 Devin Gupta 表示:"借助 Astra,我们证明了可以用更少的研究调用和更少的 token,以快得多的速度获得同样高质量的研究。"

测试任务是劳动力市场统计。Parallel 让智能体调查四个州六个月内的六项劳动力市场统计数据,智能体需要搜索多个网站、收集信息,并汇编成一份报告。Astra 用此前模型一半的时间完成了这项工作。

在工程师看来,更有意思的是提速的原因。Parallel 观察到,Astra 的搜索更有针对性,达到有用结果所需的步骤更少。Gupta 解释说:"Astra 发出的搜索查询更有针对性,并结合其世界知识,比以前的模型更专注于最终任务。"搜索调用减少,每次调用附带的延迟和 token 也随之减少,这与时间和成本同时减半的结果相吻合。

效率提升也改变了架构设计。据 OpenAI 介绍,Astra 可以把特定研究任务委派给子智能体,这让 Parallel 更容易由多个智能体同时处理原本需要依次进行的搜索。这是把顺序搜索的等待时间转化为并行工作的方式。

在 METAL 查看的案例页面 54 秒视频中,Gupta 把同一测试描述为跨多个州的统计,并将节省项表述为 token 成本。文字页面写的是四个州和代码成本降低。两者给出的幅度都是约 50%。

Parallel 看好 Astra 的依据也来自其自身测量。该公司于 9 月 16 日推出搜索能力排行榜,供开发者为使用网络搜索的应用挑选模型,首版比较了 24 个开源和闭源模型。在衡量三套公开基准准确率的搜索智能分数上,GPT-6 Astra 以 70.3 位居第一。结果为截至 9 月 15 日的快照。

同一张表也呈现了成本一侧的情况。在按成本对达到或超过中位准确率的模型排序的搜索效率排名中,GPT-5.6 Luna 以 55.0 分居首,成本约为 Astra 的十三分之一。DeepSeek V4.1 Flash 接入搜索后分数提高 45 分,增幅为所有模型之最,搜索智能以 65.3 排第三,搜索效率排第二。Parallel 写道,更高的准确率是否值得更高的成本,取决于具体应用。

这并不是第一个 Astra 客户案例。METAL 曾报道 OpenAI 前一天公布了 AI 视频工具公司 Higgsfield 采用 Astra 的案例;此前还报道过 9 月 17 日推出、配备自有法律搜索索引的 Astra for Law,其准确性检查通过率为 54.0%,高于仅使用网络搜索的 Astra 的 38.7%。案例页面底部还列有 9 月 16 日的 Hex 和 9 月 21 日的 V7 案例。

从 TPM 的角度看,这一案例传递的信息是:仅更换模型就能改变流水线的单位成本。Parallel 表示,它没有给更大的模型加上长时间推理,而是用一个搜索更少、更精准的模型,以一半的时间和成本得到了同样的质量。不过,案例页面没有写明用于对比的此前模型名称和测试次数。正如 Parallel 的排行榜所示,准确率第一和效率第一是不同的模型,因此留给构建智能体的团队的问题是:哪些任务交给 Astra,哪些任务交给更便宜的模型。

评论