
이미지: X — 벤치마크·평가 화면 갈무리
摘要
- Upstage推出自研旗舰推理模型Solar Pro 4,在Artificial Analysis Intelligence Index中获得42分,较今年4月发布的Solar Pro 3的14分大幅提升。
- 在实务型任务基准测试GDPval-AA v2中,该模型获得1276的Elo评分,超越人类基准线1000分,与前代(498分)相差778分。
- 知识可信度指标AA-Omniscience从-53改善至-1,但这一改善很大程度上并非源于对已知内容答对得更多,而是模型减少了对问题的作答尝试。
- 모델
- Solar Pro 4 (업스테이지, 자체 개발 비공개 플래그십 추론 모델)
- Artificial Analysis Intelligence Index
- 42점 (Solar Pro 3은 14점)
- 전작
- 2026년 4월 공개된 Solar Pro 3을 대체
- GDPval-AA v2 Elo
- 1276 (Solar Pro 3은 498, 인간 기준선 1000)
- AA-Omniscience Index
- -1 (Solar Pro 3은 -53)
- 응답 시도율·환각률
- 시도율 41%(전작 92%), 환각률 24%(전작 88%)
- 과제당 출력 토큰
- 43k (전작 52k, 약 17% 감소)
- 과제당 소요 시간
- 9.5분 (전작 6.9분)
只看一个数字,这次发布的性质就已显现。498到1276。Upstage新款旗舰模型Solar Pro 4在实务型任务基准测试中,Elo评分比前代高出778分。即便是同一家公司相隔仅四个月推出的模型,这样的差距也颇为罕见。

从14分到42分
评测由独立基准测试机构Artificial Analysis进行。该机构将多项子测试汇总换算为一个Intelligence Index,Solar Pro 4在其中获得42分。这是2026年4月发布的Solar Pro 3所获14分的三倍。Solar Pro 4是Upstage全新的自研(非公开)旗舰推理模型,取代了前代产品。
有个参照标准可以帮助理解:在同一指数中,xAI的Grok 4.6得分为61分,与GPT-5.6 Sol同属顶级梯队。42分算不上前沿最高水平,但值得注意的是,一家韩国实验室在单代之间取得的提升幅度,远超前沿实验室代际升级的幅度(Grok 4.5升级到4.6仅提升5分)。

超越人类基准线的实务任务
最大的提升出现在"智能体式实务处理"方面。GDPval-AA v2是一项让模型执行实际职业岗位工作任务、并将人类完成水平固定为Elo 1000作为比较基准的测试。Solar Pro 4获得1276分,超过了这一基准线。Artificial Analysis表示,该分数略高于MiMo-V2.5-Pro(1266分)。至于同时提及的Qwen系列模型,文章正文将Qwen3.7 Max标注为1272分,但附带的排行榜表格中Qwen3.8 Max却显示为1737分,似乎指的是不同版本。

| 模型 | GDPval-AA v2 Elo | |
|---|---|---|
| Claude Opus 5 (max) | 1849 | 100 |
| Grok 4.6 (high) | 1753 | 95 |
| GPT-5.6 Sol (max) | 1728 | 93 |
| Gemini 3.6 Flash | 1422 | 77 |
| Solar Pro 4 | 1276 | 69 |
| MiMo-V2.5-Pro | 1266 | 68 |
| 人类基准线 | 1000 | 54 |
| Solar Pro 3 | 498 | 27 |

幻觉减少了,但答题也变少了
第二项指标需要仔细解读。AA-Omniscience衡量的是模型区分"知道"与"不知道"的能力。答对加分,自信满满地给出错误答案(即幻觉)扣分,不作答则不扣分。Solar Pro 4从-53提升到了-1。
不过Artificial Analysis指出,这一改善并非源于知识本身的提升,而是来自"减少作答"这一策略。前代模型对92%的问题尝试作答,而Solar Pro 4只对41%的问题尝试作答。结果幻觉率从88%降至24%。也就是说,模型被训练成在可能答错时选择保持沉默。从可靠性角度看这确实是明显进步,但很难据此认为模型的知识覆盖范围本身扩大了。
| 项目 | Solar Pro 3 | Solar Pro 4 |
|---|---|---|
| AA-Omniscience Index | -53 | -1 |
| 作答尝试率 | 92% | 41% |
| 幻觉率 | 88% | 24% |

话变少了,但用时更长了
效率指标则喜忧参半。解决单个任务所用的输出token从5.2万降至4.3万,减少约17%。尽管如此,Artificial Analysis评价称,与同等智能水平的其他模型相比,该模型输出仍然偏冗长。更值得关注的是耗时问题。尽管token用量减少,单个任务的处理时间却从6.9分钟增加到9.5分钟。推理模型在给出答案前会在内部进行长时间的思考过程,这似乎意味着这一过程变得更加繁重。

那么,这意味着什么
一家韩国实验室的自研模型,在独立评测机构的实务型排行榜上超越了人类基准线,这样的案例出现了。42分这个成绩,还不足以与Claude Opus 5或GPT-5.6系列正面竞争,但与前代如此巨大的差距,本身就是一个信号——表明该实验室仅用一代产品的时间,就大幅改变了其推理训练方式。从实务使用者角度看,更重要的变化在于模型"性格"的转变。幻觉率高达88%的模型很难用于文档摘要或内部问答场景。而降至24%的模型,由于倾向于"不答而非答错",至少能降低审核核实的成本。但代价是,超过一半的问题可能得不到回答,且等待响应的时间也比前代更长。至于该用在什么业务场景,需要权衡这两项特性再做取舍。



