METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

OpenAI 发布 Jump Trading Astra 案例

OpenAI 发布案例,介绍量化交易公司 Jump Trading 如何用 GPT-6 Astra 把长达数天的市场研究交给智能体。即便是智能体产出的交易信号,也被视为可能出错的输入,由人做最后验证。

OpenAI 发布 Jump Trading Astra 案例

摘要

  • OpenAI 于 10 月 6 日发布案例,介绍 Jump Trading 用 ChatGPT 和 GPT-6 Astra 把漫长而模糊的量化研究交给智能体。
  • Jump Trading 大语言模型研发负责人 Lucas Baker 表示,智能体如今可以连续运行数天、整合多种数据,并通过递归改进叠加成果。
  • 智能体产出的交易信号与其他信号一样被限定范围并接受审查,由人负责最终验证,以应对受监管行业的风险。
How Jump Trading is scaling quant research with ChatGPT

北美量化交易公司 Jump Trading 正在把连续运行数天的市场研究交给基于 OpenAI GPT-6 Astra 的智能体。OpenAI 于 10 月 6 日发布客户案例称,Jump Trading 正用 ChatGPT 和 GPT-6 Astra 处理更长、更模糊的研究问题。在公司负责大语言模型研发的 Lucas Baker 表示:“借助 GPT-6 系列,尤其是 GPT-6 Astra,OpenAI 在长周期任务上开启了新一级的自主性。”他解释说,过去需要人频繁介入的工作,如今变成了定义一个安全、受到良好监控的环境和清晰的目标。

Jump Trading 的工作是把资产价格预测得哪怕再准一点。公司利用市场数据、新闻、事件和多种另类数据构建预测模型。市场复杂、噪声多,且性质随时间变化,很难准确预料会发生什么。按 Baker 的说法,只要在大规模上比抛硬币稍微准一点,就足以成为成功的策略。公司的交易覆盖所有时间周期和所有资产类别。

规模体现在数据上。根据 Baker 与同事 Loren Puchalla Fiore 今年 4 月 25 日在 ICLR 2026 展会环节发表的摘要,Jump Trading 每天处理 TB 级市场数据,在全球数千个交易品种中寻找预测信号。其流水线从订单簿原始事件延伸到自然语言信号整合、模型训练和实盘执行,全部在严格的延迟约束下运行。公司在该环节介绍了用文本输入微调大语言模型以生成实盘交易信号的成果,以及把非结构化资料整合为供人类交易员和自动化策略共同使用的预测的多智能体系统。

AI 的用法在过去一年发生了巨大变化。据 OpenAI 案例介绍,曾经用来写代码片段或找小错误的工具,如今能独立构建整个代码库和服务。Baker 的团队认为,把 AI 当作同事时效果最好。研究人员确定核心问题、工作环境以及评估结果质量和意义的方法后,就能实时引导一个或多个智能体,决定分析重点和下一步要运行的任务。

GPT-6 Astra 带来的变化是叠加改进的能力。Baker 表示,智能体不再止步于发现有意义的改动,而是把这些成果合并、叠加,进行递归改进。在一个长时间运行的任务中,系统会自行分析结果,按最初提案中商定的标准加以判断,并在无需人逐轮审视的情况下调整方向。Baker 说:“你可以定义一项需要运行数天、需要从多种数据源提取信息、需要细致判断什么重要什么不重要、并且需要把一切相互关联起来的任务”,“这样的综合分析现在真的能运行了。”

金融是监管严格的行业,失误会带来资金和合规两方面的代价。Jump Trading 通过系统设计与边界、清晰的约束、便于操控和观察的基础设施,以及对变更的人工审查来应对这一风险。Baker 说:“有一个让智能体可以自由产出所需结果的安全环境,最后又有一个由人接受、进行关键验证的审查流程,这正是我们信心的来源。”即便智能体给出交易信号,也会像其他任何产出一样被限定范围并接受审查。它被当作一个通常有用但可能出错的信号,在经过严格审查和控制的执行环境中与其他所有信号整合。ICLR 摘要也谈到了幻觉风险管理、严格的时点正确性,以及确保实盘可靠性的评估方法。

从 AI 工程师的角度看,这个案例的核心与其说是模型,不如说是运行框架。Baker 的工作本身就是构建智能体、运行框架和基础设施,让研究人员更广、更深地探索想法。人的角色转向编写目标、评估指标和环境定义,执行与迭代则交给智能体。不过,GPT-6 Astra 运行时间最长的工作,目前仍要与定义任务的人定期核对。人不仅要确认提取哪些数据、运行多久、什么才重要,还要确认中间结果是否合理。METAL 此前曾报道 OpenAI 发布了税务公司 Basis 的 GPT-6 Astra 案例,也报道过 GPT-6 模型指南。

Baker 设想的下一步是“自动研究”(autoresearch)。即由智能体研究员对可度量系统进行递归改进,这种方式将成为量化研究员日常工作的一部分。人设定输入、环境、评估指标和优先级之后,其余部分交给由其他智能体协调的松散智能体编队,由它们决定如何探索想法、分配算力时间、整合有前景的发现。在 METAL 查看的 OpenAI 案例原文中,Baker 指出,2024 年早期智能体能无错写出一个文件就已令人印象深刻,2025 年从零构建整个代码库成为可能,2026 年多个智能体协作推进开放研究问题也已实现。他说:“如果你能解决一个千禧年难题,大概也能弄清量化金融中一些相当有趣的事实。”

这个案例显示的变化在于研究的单位。交给智能体的不再是一问一答,而是持续数天的实验,人则为这些实验划定边界、制定评分标准。Jump Trading 把任何单个信号都视为可能出错的输入,这套审查体系正是支撑这一转变的底座。问题正在从智能体能独自运行多久,转向人定下的标准能多精确地把握住那段漫长的运行。

评论