每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Upstage Solar Pro 4,智能指数从14分升至42分

Artificial Analysis评测显示,该模型得分较前代提升近3倍,实务任务Elo从498升至1276,超越人类基准线

AI 모델별 지능 지수를 비교한 막대그래프

이미지: X — 벤치마크·평가 화면 갈무리

摘要

  • Upstage推出自研旗舰推理模型Solar Pro 4,在Artificial Analysis Intelligence Index中获得42分,较今年4月发布的Solar Pro 3的14分大幅提升。
  • 在实务型任务基准测试GDPval-AA v2中,该模型获得1276的Elo评分,超越人类基准线1000分,与前代(498分)相差778分。
  • 知识可信度指标AA-Omniscience从-53改善至-1,但这一改善很大程度上并非源于对已知内容答对得更多,而是模型减少了对问题的作答尝试。
모델
Solar Pro 4 (업스테이지, 자체 개발 비공개 플래그십 추론 모델)
Artificial Analysis Intelligence Index
42점 (Solar Pro 3은 14점)
전작
2026년 4월 공개된 Solar Pro 3을 대체
GDPval-AA v2 Elo
1276 (Solar Pro 3은 498, 인간 기준선 1000)
AA-Omniscience Index
-1 (Solar Pro 3은 -53)
응답 시도율·환각률
시도율 41%(전작 92%), 환각률 24%(전작 88%)
과제당 출력 토큰
43k (전작 52k, 약 17% 감소)
과제당 소요 시간
9.5분 (전작 6.9분)

只看一个数字,这次发布的性质就已显现。498到1276。Upstage新款旗舰模型Solar Pro 4在实务型任务基准测试中,Elo评分比前代高出778分。即便是同一家公司相隔仅四个月推出的模型,这样的差距也颇为罕见。

이미지: X — 벤치마크·평가

从14分到42分

评测由独立基准测试机构Artificial Analysis进行。该机构将多项子测试汇总换算为一个Intelligence Index,Solar Pro 4在其中获得42分。这是2026年4月发布的Solar Pro 3所获14分的三倍。Solar Pro 4是Upstage全新的自研(非公开)旗舰推理模型,取代了前代产品。

有个参照标准可以帮助理解:在同一指数中,xAI的Grok 4.6得分为61分,与GPT-5.6 Sol同属顶级梯队。42分算不上前沿最高水平,但值得注意的是,一家韩国实验室在单代之间取得的提升幅度,远超前沿实验室代际升级的幅度(Grok 4.5升级到4.6仅提升5分)。

이미지: X — 벤치마크·평가

超越人类基准线的实务任务

最大的提升出现在"智能体式实务处理"方面。GDPval-AA v2是一项让模型执行实际职业岗位工作任务、并将人类完成水平固定为Elo 1000作为比较基准的测试。Solar Pro 4获得1276分,超过了这一基准线。Artificial Analysis表示,该分数略高于MiMo-V2.5-Pro(1266分)。至于同时提及的Qwen系列模型,文章正文将Qwen3.7 Max标注为1272分,但附带的排行榜表格中Qwen3.8 Max却显示为1737分,似乎指的是不同版本。

GDPval-AA v2排行榜
GDPval-AA v2 Elo排行榜 · 来源:Artificial Analysis
模型GDPval-AA v2 Elo
Claude Opus 5 (max)1849100
Grok 4.6 (high)175395
GPT-5.6 Sol (max)172893
Gemini 3.6 Flash142277
Solar Pro 4127669
MiMo-V2.5-Pro126668
人类基准线100054
Solar Pro 349827
이미지: X — 벤치마크·평가

幻觉减少了,但答题也变少了

第二项指标需要仔细解读。AA-Omniscience衡量的是模型区分"知道"与"不知道"的能力。答对加分,自信满满地给出错误答案(即幻觉)扣分,不作答则不扣分。Solar Pro 4从-53提升到了-1。

不过Artificial Analysis指出,这一改善并非源于知识本身的提升,而是来自"减少作答"这一策略。前代模型对92%的问题尝试作答,而Solar Pro 4只对41%的问题尝试作答。结果幻觉率从88%降至24%。也就是说,模型被训练成在可能答错时选择保持沉默。从可靠性角度看这确实是明显进步,但很难据此认为模型的知识覆盖范围本身扩大了。

项目Solar Pro 3Solar Pro 4
AA-Omniscience Index-53-1
作答尝试率92%41%
幻觉率88%24%
이미지: X — 벤치마크·평가

话变少了,但用时更长了

效率指标则喜忧参半。解决单个任务所用的输出token从5.2万降至4.3万,减少约17%。尽管如此,Artificial Analysis评价称,与同等智能水平的其他模型相比,该模型输出仍然偏冗长。更值得关注的是耗时问题。尽管token用量减少,单个任务的处理时间却从6.9分钟增加到9.5分钟。推理模型在给出答案前会在内部进行长时间的思考过程,这似乎意味着这一过程变得更加繁重。

이미지: X — 벤치마크·평가

那么,这意味着什么

一家韩国实验室的自研模型,在独立评测机构的实务型排行榜上超越了人类基准线,这样的案例出现了。42分这个成绩,还不足以与Claude Opus 5或GPT-5.6系列正面竞争,但与前代如此巨大的差距,本身就是一个信号——表明该实验室仅用一代产品的时间,就大幅改变了其推理训练方式。从实务使用者角度看,更重要的变化在于模型"性格"的转变。幻觉率高达88%的模型很难用于文档摘要或内部问答场景。而降至24%的模型,由于倾向于"不答而非答错",至少能降低审核核实的成本。但代价是,超过一半的问题可能得不到回答,且等待响应的时间也比前代更长。至于该用在什么业务场景,需要权衡这两项特性再做取舍。