
이미지: Ornith
摘要
- DeepReinforce团队发布采用自我改进循环机制的Ornith-1.5,共推出397B/35B MoE与9B Dense三种规格
- 开发团队称397B模型在Terminal-Bench 2.1上取得86.1分、DeepSWE取得56.0分,与Claude Opus 4.8(85.0分、59.0分)不相上下——目前尚无第三方复现
- 9B移动端量化版本可直接部署至iPhone和安卓设备,同时发布了GGUF、MLX的4位、6位、8位量化版本
- 공개일
- 2026년 8월 19일(자체 사이트 ornith.ai)
- 모델 구성
- 397B MoE·35B MoE·9B Dense 3종
- 397B 성적
- Terminal-Bench 2.1 86.1 · DeepSWE 56.0
- 비교 대상(Claude Opus 4.8)
- Terminal-Bench 2.1 85.0 · DeepSWE 59.0
- 35B 성적
- Terminal-Bench 2.1 68.5 · SWE-Bench Verified 79.0
- 9B 성적
- Terminal-Bench 2.1 47.0 · SWE-Bench Verified 70.6
- 전작
- Ornith-1.0, 큐원 3.5·젬마 4 기반 추가 학습으로 개발
- 학습 방식
- 과제 생성-발판 구성-풀이 생성 3단계 루프, GRPO로 강화학습
开源模型称跑分达到Claude Opus水平
开发团队于8月19日(当地时间)宣布,一款名为Ornith的开源模型在衡量终端多步骤任务执行能力的基准测试"Terminal-Bench 2.1"和衡量代码修改能力的"DeepSWE"上分别取得86.1分和56.0分。同一表格中,Anthropic的Claude Opus 4.8分别得分85.0和59.0。在Terminal-Bench上Ornith领先,但在DeepSWE上落后。
这些数据均为开发团队自行测量并发布的结果。表中作为对比对象列出的其他模型分数,同样是开发团队按自己的方式重新测量得出,目前尚无第三方复现的结果。发布页面同时注明,这些数据是五次独立运行的平均值。
打造Ornith的团队是DeepReinforce。该团队于8月19日在其官网发布新模型"Ornith-1.5",同时公布了这份成绩单,权重已上传至Hugging Face的"ornith-ai"组织。

从自行准备到自我进化的模型
Ornith-1.5并非首款发布的模型。前代Ornith-1.0以阿里巴巴Qwen 3.5和谷歌Gemma 4为基础,通过追加预训练(CPT)、中间训练及后处理训练打造而成。当时提出的概念是"自我脚手架搭建(self-scaffolding)"——模型在解题时自行搭建所需的工具和流程,即"脚手架",并在此基础上解题。
Ornith-1.5则更进一步。它不止步于搭建脚手架,而是完成了一个循环结构:自行生成待解决的任务本身,为该任务搭建相应脚手架,并生成解题过程(rollout)作为强化学习素材。这意味着模型不再依赖人工预先设定的题库和手工编写的评分工具,而是自行发现能力上的薄弱环节,并不断生成针对性的补强任务。

从397B到9B,三种规格的成绩单
Ornith-1.5共推出三种规格:3970亿(397B)参数MoE(混合专家)、350亿(35B)参数MoE、90亿(9B)参数密集型(Dense)模型。MoE结构在处理每个问题时只调用全部参数中的一部分"专家",因此相比同等规模的密集模型计算量更少。
开发团队公布的表格内容如下:
| 模型 | 参数结构 | Terminal-Bench 2.1 | 其他基准测试 |
|---|---|---|---|
| Ornith-1.5-397B | MoE | 86.1 | DeepSWE 56.0 |
| Ornith-1.5-35B | MoE(每Token激活3B) | 68.5 | SWE-Bench Verified 79.0 |
| Ornith-1.5-9B | Dense | 47.0 | SWE-Bench Verified 70.6 |
同一表格中作为对比对象列出的竞争模型得分如下。这些数据同样是开发团队在自有评测环境中测得的结果。
| 模型 | Terminal-Bench 2.1 | 其他基准测试 |
|---|---|---|
| Claude Opus 4.8 | 85.0 | DeepSWE 59.0 |
| GLM-5.2 | 82.7 | DeepSWE 46.2 |
| DeepSeek-V4-Flash-0731 | 82.7 | DeepSWE 54.4 |
| Gemma 4-31B | 43.4 | SWE-Bench Verified 52.0 |
| Muse Glimmer-30B | 51.7 | SWE-Bench Verified 76.0 |
Ornith团队表示,35B模型每Token仅激活30亿参数,却在智能体编程基准测试中大幅领先同规格的Qwen 3.6-35B,甚至超越了规模更大的密集模型Gemma 4-31B和Meta的Muse Glimmer-30B。

可装入智能手机的9B模型
90亿参数模型推出了体积缩小的量化版本"Ornith-1.5-9B-Mobile",可直接部署于iPhone和安卓设备。开发团队公布,这款小模型在Terminal-Bench 2.1上取得47.0分,在SWE-Bench Verified上取得70.6分,与规模大得多的Gemma 4-31B、Qwen 3.6-35B持平甚至更优。
Hugging Face上同时上传了三种规格的原始权重,以及GGUF、MLX格式的4位、6位、8位量化版本,可在Mac上通过MLX、在PC和Linux上通过GGUF直接下载运行。
在一轮训练中同时训练任务、脚手架与解题过程的方法
一个训练周期分三个阶段运转。首先,模型根据此前解决过的任务历史,自行提出触及尚未攻克领域的更高难度任务。其次,为该任务搭建或完善相应脚手架,即解题所需的指令、工具与解题策略。最后,在该脚手架基础上生成实际的解题过程。
这三个阶段各自获得奖励,评判标准有三:任务和脚手架是否实际可评分(有效性)、难度是否恰好处于模型当前实力勉强能解决的水平(前沿难度)、是否与此前训练所用的任务不重复(新颖性)。其中难度标准将目标成功率设定为0.2,即对五次尝试成功一次左右的任务给予最高奖励。当模型对某类任务变得熟练、成功率上升后,奖励自然减少,任务生成器便会被推向更难的问题。任务生成、脚手架生成、解题生成三者均通过名为GRPO的强化学习方式同步优化。
编者视角
此次发布正处于"递归自我改进(RSI)"成为今夏AI行业最常被提及关键词的浪潮之中。在有报道称谷歌联合创始人谢尔盖·布林在DeepMind内部施压要求将资源转向RSI方向之后,Sakana AI宣布将把递归自我改进应用于机器人运动的物理世界,Oumi也推出了能将生产日志自动转化为训练数据的平台。Ornith是这一趋势的延续,试图用开源模型的基准测试数据来支撑"模型自行编制题库"这一理念。
对比不同代际模型时值得关注的一点,是脚手架与自我改进之间的差异。如果说上一代模型只是在人工搭建的工具集上解题,那么这一代模型则能自行修改工具集本身,并同步调节问题难度。依赖固定脚手架的模型擅长处理熟悉类型的问题,却在遇到陌生的代码仓库结构时容易失效——这一弱点在智能体编程领域被反复指出。如果任务与脚手架协同进化的结构确实能弥补这一弱点,那么开放权重模型与闭源模型之间在编程智能体领域的差距很可能会进一步缩小。
国内开发团队值得关注的有两点。其一,据称如90亿参数移动版这样可下沉至端侧的规模模型,也取得了SWE-Bench Verified 70分左右的成绩。对于希望在无需服务器成本的情况下,在设备端内嵌代码辅助功能的团队而言,这是一个值得关注的规格。其二是训练方式本身。由于人工编制题库的成本得以降低,那些没有余力为特定代码库设计自有评测任务的团队,也有机会借鉴类似思路加以应用。
不过,目前所有的依据都仅来自开发团队的单方面发布。该消息发布后在Hacker News上获得200多票,海外科技媒体也纷纷转载,但这些报道同样都以同一份发布为依据。既然这是通过自我改进循环得出的分数,就必须等到社区将权重直接部署到推理引擎中、重新跑出相同数字之后,验证才算真正完成。




评论