
摘要
- Upstage推出自研旗舰推理模型Solar Pro 4,在Artificial Analysis智能指数(Intelligence Index)中获得42分,较去年4月Solar Pro 3的14分大幅提升。
- 在实务型任务基准测试GDPval-AA v2中,该模型Elo评分达到1276,超过人类基准线1000分,与前代(498分)相差778分。
- 知识可信度指标AA-Omniscience从-53改善至-1,但这一改善的很大一部分并非来自答对更多已知内容,而是来自减少了对问题的作答尝试。
仅看一个数字,就能看出这次发布的性质。498到1276。Upstage新推出的旗舰模型Solar Pro 4在实务型任务基准测试中的Elo评分比前代高出778分。对于同一家公司在四个月前推出的模型而言,这样的差距实属罕见。

从14到42
评测由独立基准测试机构Artificial Analysis进行。该机构将多项子测试汇总换算为一个智能指数(Intelligence Index),Solar Pro 4获得42分,是2026年4月发布的Solar Pro 3所获14分的三倍。Solar Pro 4是Upstage新推出的自研(非公开)旗舰推理模型,将取代前代产品。
对照一下基准会更有感觉。同一指数下,xAI的Grok 4.6得分为61分,与GPT-5.6 Sol同属最高梯队。42分虽非前沿最顶端水平,但值得注意的是,一家国内实验室在一代产品上的提升幅度,远超前沿实验室的代际提升幅度(Grok 4.5升至4.6仅提升5分)。

超越人类基准线的实务任务
最大的改进来自"智能体式实务"任务。GDPval-AA v2是一项测试,让模型执行来自真实职业岗位的工作任务,并将人类的表现水平固定为Elo 1000作为比较基准。Solar Pro 4获得1276分,超过了这一基准线。Artificial Analysis解释称,该模型略微领先于MiMo-V2.5-Pro(1266分)。至于同时提及的Qwen系列模型,正文中将Qwen3.7 Max记为1272分,但附带的排行榜表格中却显示Qwen3.8 Max为1737分,两者似乎指的是不同版本。
| 模型 | GDPval-AA v2 Elo | |
|---|---|---|
| Claude Opus 5 (max) | 1849 | 100 |
| Grok 4.6 (high) | 1753 | 95 |
| GPT-5.6 Sol (max) | 1728 | 93 |
| Gemini 3.6 Flash | 1422 | 77 |
| Solar Pro 4 | 1276 | 69 |
| MiMo-V2.5-Pro | 1266 | 68 |
| 人类基准线 | 1000 | 54 |
| Solar Pro 3 | 498 | 27 |

幻觉减少了,但答题也少了
第二项指标需要一些解读。AA-Omniscience是衡量模型区分"知道的"与"不知道的"能力的指数。答对得分,自信地给出错误答案(即幻觉)扣分,不作答则不扣分。Solar Pro 4从-53升至-1。
不过Artificial Analysis指出,这一改善并非来自知识层面,而是来自"减少作答"这一方向。前代模型对92%的问题尝试作答,而Solar Pro 4仅对41%的问题尝试作答。结果幻觉率从88%降至24%。可以说,该模型被训练成了在可能答错时选择沉默的倾向。从可靠性角度看这无疑是进步,但很难将其解读为模型所知范围本身扩大了的证据。
| 项目 | Solar Pro 3 | Solar Pro 4 |
|---|---|---|
| AA-Omniscience指数 | -53 | -1 |
| 作答尝试率 | 92% | 41% |
| 幻觉率 | 88% | 24% |

话少了,但耗时反而增加
效率指标呈现分化。解答一道任务所用的输出token数从52k降至43k,减少约17%。尽管如此,Artificial Analysis评价称,与同等智能水平的其他模型相比,该模型的输出仍然偏长。更值得留意的是耗时。尽管使用的token减少了,但每项任务的耗时却从6.9分钟增至9.5分钟。推理模型在给出答案前会在内部进行较长时间的思考,这似乎意味着这一过程变得更为繁重。

那么,这意味着什么
国内实验室的自研模型在独立评测机构的实务型排行榜上超越人类基准线,这样的案例已经出现。42分的成绩虽不足以与Claude Opus 5或GPT-5.6系列相抗衡,但与前代如此悬殊的差距表明,该实验室在短短一代之间大幅改变了推理训练方式。从实务使用者的角度看,更重要的变化在于模型的"性格"。一款幻觉率高达88%的模型很难用于文档摘要或企业内部问答。而幻觉率降至24%的模型,方向是"宁可不答也不给错误答案",这至少能降低审核成本。但代价是,超过一半的问题可能得不到回答,且等待响应的时间比前代更长。具体适用于哪些工作场景,需要权衡这两种特性后再做判断。





评论