
摘要
- Prime Intellect于10月9日发布了用Rust从零重写的Prime Agent,迁移工作由Prime Agent调度2,000多个智能体在两周内完成。
- 这项工作使用了1万多个沙箱和2,000多亿个GLM-5.3令牌,人类负责搭建四类等价性检查。
- Rust版本51.9毫秒即可接受输入,比TypeScript版本快14.18倍,大型会话内存减少4.76倍。
开源AI研究公司Prime Intellect于10月9日发布了将编程智能体框架Prime Agent从TypeScript完全改用Rust重写的版本。重写工作本身由Prime Agent承担。据公司介绍,Prime Agent在两周内调度2,000多个智能体完整迁移了自身代码,过程中使用了1万多个Prime Sandboxes,以及自家推理服务Prime Inference的GLM-5.3端点上的2,000多亿个令牌。公司的X账号表示,智能体之间互相传递的消息达1.6万条。
成果体现在速度上。在公司公布的基准测试中,Rust版本从全新启动到可以接受输入耗时51.9毫秒,比TypeScript版本的736.1毫秒快14.18倍。再次启动时为41.4毫秒,快13.34倍;打开10MiB会话后整个进程树的内存从1,130.0MB降至237.3MB,减少4.76倍。安装体积从172.1MB降至59.6MB,智能体视图切换从78.0毫秒缩短至12.8毫秒。
Prime Intellect于8月推出Prime Agent,公司称此后下载量超过30万次,处理令牌超过8万亿个。METAL曾报道Prime Intellect发布自我改进型智能体框架Prime Agent。公司列举了迁移到Rust的理由:TypeScript的类型是可选的且在运行时消失,渲染和解析等CPU密集型工作在单一事件循环中与键盘输入争抢资源,而且每个进程都要承担JavaScript运行时和垃圾回收器的开销。
人类所做的是搭建验证机制。公司建立了四类等价性检查:在同一脚本模型下比较两个版本所渲染终端画面的TUI检查;在相同输入下比较会话记录及发往模型提供方请求的框架检查;逐一核对守护进程协议所有消息类型的协议检查;以及由智能体逐个审计功能并分为一致、部分、缺失的功能检查。公司表示,正因为有客观检查,智能体才能自行衡量进度并在合并前发现回归,从而减少了人工审查。
调度结构很简单。一个顶层智能体按依赖顺序拆分任务,它不编写任何产品代码,只负责监控和合并。每项任务配备四个智能体:编写规格和验证标准的规划者、在独立工作树中编写Rust代码的实现者、使用与实现者不同的模型并在独立上下文中对改动进行对抗式审查的审查者,以及在全新沙箱中编译并运行检查的验证者。公司在博客中写道"编写代码的智能体在评估该代码时会有偏见",以此说明将生成与验证交给不同智能体的原因。调度者和子智能体运行在两台8核按需CPU节点上,每台节点可同时承载100多个子智能体。
实现等价之后,第二个调度者用三天时间运行了改进基准成绩的循环。实验与审计记录超过144条,合并了69项以上提升性能的改动。公司刻意没有设定数字目标,并写道"固定的阈值往往会变成停止点"。每项改动都要经两个分别使用不同前沿模型的审查智能体确认其行为与TypeScript版本一致后才能合入。大部分收益来自三类改动:把工作移出启动和渲染路径、用事件驱动等待取代轮询循环、以及在大型会话加载完成后立即释放内存。

与其他框架的比较也一并公布。公司在4核、8GB沙箱上测得,Rust版本启动后首次显示画面仅需23.6毫秒,快于Claude Code v2.1.289的264.6毫秒、Codex CLI v0.160.0的296.8毫秒、Pi v1.0.3的306.3毫秒和Hermes Agent v0.21.5的1,715.3毫秒。启动后整个进程树内存为106.0MB,低于Claude Code的226.9MB和Codex CLI的344.4MB。测量基于不含推理时间的脚本模型,公司补充称,由于缺乏通用基准标准,与外部框架的比较应谨慎解读。
代码结构也发生了变化。代码被拆分为具有单向依赖图的9个crate,最大的源文件约2,500行,而TypeScript版本约为1.5万行。TypeScript版本中有4个文件超过5,000行,Rust版本中一个也没有。每个会话运行在独立的工作进程中,一个会话崩溃不会影响其他会话。此次发布还加入了原生Windows支持(测试版)和Homebrew安装,并继续保持开源。METAL核实的博客原文写道,自动化工作完成后,达到发布质量还需数周的后续工作,在这一阶段由人类发现问题、确定修改方向并审查所有结果。

这次发布的分量与其说在于速度数字,不如说在于工作方式。2,000多个智能体能在两周内把一款产品迁移到另一种语言,条件不仅是模型能力,还有人类事先搭建的四类客观检查。Prime Intellect表示将向用户开放此次重写所用的多智能体工作流。这一案例表明,想把大规模代码迁移交给智能体集群的开发团队,首先需要的是智能体能够自我评分的检查。





评论