
이미지: METAL LAB 생성
摘要
- 东北大学与斯坦福大学研究团队发布了采用MIT许可证的Python运行时Shepherd
- 该系统将智能体与环境的交互记录为类似Git的执行轨迹,可分叉并回退到过去的状态
- 研究团队称其分叉速度比Docker快5倍,提示词缓存复用率超过95%
- 개발 기관
- 노스이스턴대학교, 스탠퍼드대학교
- 라이선스
- MIT, PyPI 설치 가능(pip install shepherd-ai), Python 3.11+ 필요
- 포크 속도
- Docker 대비 5배 빠름
- 캐시 재사용률
- 95% 이상 프롬프트 캐시 재사용
- 성능 사례
- CooperBench 페어코딩 성공률 28.8%→54.7%, TerminalBench-2 34.2%→39.4%
东北大学与斯坦福大学研究团队发布了一款开源Python运行时Shepherd,可记录并回溯长时间运行的AI智能体的状态。例如编程智能体误判错误、错误地重写正常文件的情况下,以往只能选择继续打补丁向前推进,或从头重新开始。这两种方法都存在问题:前者会大幅增加token成本,后者则因非确定性特征而无法复现相同的执行过程。
Shepherd将智能体与环境之间的所有交互记录为带类型的事件,生成类似Git的执行轨迹。每次交互都被当作一次提交(commit)处理,但与Git不同的是,它不仅保存文件,还以写时复制(copy-on-write)方式同时保存智能体进程和文件系统状态。这样一来,回到特定时间点的操作只需一条分叉(fork)命令即可完成。
研究团队表示,Shepherd对智能体进程和文件系统进行分叉的速度比Docker快5倍,而且由于分叉点之前的提示词前缀保持不变,重放时可复用超过95%的提示词缓存。
通过元智能体进行干预
分叉功能的实现,也使得构建上层智能体成为可能——该智能体可以观察执行轨迹,并在问题被提交前进行干预。研究团队报告称,在应用实时监督的配对编程场景中,CooperBench的成功率从28.8%提升至54.7%。此外,基于分支探索的反事实优化在四个基准测试中相较现有方法最高提升11分,同时将执行时间最多缩短58%。在从选定时间点分叉rollout的Tree-RL训练中,TerminalBench-2得分从34.2%提升至39.4%。
Shepherd支持macOS上的Seatbelt和Linux上的Landlock(在具有权限的容器内)进行操作系统级权限强制,但目前仍处于早期alpha阶段,据悉尚不适合用于生产环境。



