METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Upstage Solar Pro 4,智能指数从14分升至42分

Artificial Analysis评测显示较前代提升3倍,实务任务Elo从498升至1276,超越人类基准线

Upstage Solar Pro 4,智能指数从14分升至42分

摘要

  • Upstage推出自研旗舰推理模型Solar Pro 4,在Artificial Analysis智能指数(Intelligence Index)中获得42分,较去年4月Solar Pro 3的14分大幅提升。
  • 在实务型任务基准测试GDPval-AA v2中,该模型Elo评分达到1276,超过人类基准线1000分,与前代(498分)相差778分。
  • 知识可信度指标AA-Omniscience从-53改善至-1,但这一改善的很大一部分并非来自答对更多已知内容,而是来自减少了对问题的作答尝试。

仅看一个数字,就能看出这次发布的性质。498到1276。Upstage新推出的旗舰模型Solar Pro 4在实务型任务基准测试中的Elo评分比前代高出778分。对于同一家公司在四个月前推出的模型而言,这样的差距实属罕见。

여러 AI 모델의 GDPval-AA v2 점수를 막대그래프로 비교한 리더보드 차트
이미지: @ArtificialAnlys (X)

从14到42

评测由独立基准测试机构Artificial Analysis进行。该机构将多项子测试汇总换算为一个智能指数(Intelligence Index),Solar Pro 4获得42分,是2026年4月发布的Solar Pro 3所获14分的三倍。Solar Pro 4是Upstage新推出的自研(非公开)旗舰推理模型,将取代前代产品。

对照一下基准会更有感觉。同一指数下,xAI的Grok 4.6得分为61分,与GPT-5.6 Sol同属最高梯队。42分虽非前沿最顶端水平,但值得注意的是,一家国内实验室在一代产品上的提升幅度,远超前沿实验室的代际提升幅度(Grok 4.5升至4.6仅提升5分)。

AA-Omniscience 지수, 정확도, 환각률을 각각 막대그래프로 나타낸 세 부분 차트
이미지: @ArtificialAnlys (X)

超越人类基准线的实务任务

最大的改进来自"智能体式实务"任务。GDPval-AA v2是一项测试,让模型执行来自真实职业岗位的工作任务,并将人类的表现水平固定为Elo 1000作为比较基准。Solar Pro 4获得1276分,超过了这一基准线。Artificial Analysis解释称,该模型略微领先于MiMo-V2.5-Pro(1266分)。至于同时提及的Qwen系列模型,正文中将Qwen3.7 Max记为1272分,但附带的排行榜表格中却显示Qwen3.8 Max为1737分,两者似乎指的是不同版本。

模型GDPval-AA v2 Elo
Claude Opus 5 (max)1849100
Grok 4.6 (high)175395
GPT-5.6 Sol (max)172893
Gemini 3.6 Flash142277
Solar Pro 4127669
MiMo-V2.5-Pro126668
人类基准线100054
Solar Pro 349827
AI 모델별 지능지수 작업당 출력 토큰 수를 답변과 추론으로 구분해 표시한 막대그래프
이미지: @ArtificialAnlys (X)

幻觉减少了,但答题也少了

第二项指标需要一些解读。AA-Omniscience是衡量模型区分"知道的"与"不知道的"能力的指数。答对得分,自信地给出错误答案(即幻觉)扣分,不作答则不扣分。Solar Pro 4从-53升至-1。

不过Artificial Analysis指出,这一改善并非来自知识层面,而是来自"减少作答"这一方向。前代模型对92%的问题尝试作答,而Solar Pro 4仅对41%的问题尝试作答。结果幻觉率从88%降至24%。可以说,该模型被训练成了在可能答错时选择沉默的倾向。从可靠性角度看这无疑是进步,但很难将其解读为模型所知范围本身扩大了的证据。

项目Solar Pro 3Solar Pro 4
AA-Omniscience指数-53-1
作答尝试率92%41%
幻觉率88%24%
AI 모델별 지능지수 작업당 소요 시간과 지능지수 간 관계를 산점도로 나타낸 그래프
이미지: @ArtificialAnlys (X)

话少了,但耗时反而增加

效率指标呈现分化。解答一道任务所用的输出token数从52k降至43k,减少约17%。尽管如此,Artificial Analysis评价称,与同等智能水平的其他模型相比,该模型的输出仍然偏长。更值得留意的是耗时。尽管使用的token减少了,但每项任务的耗时却从6.9分钟增至9.5分钟。推理模型在给出答案前会在内部进行较长时间的思考,这似乎意味着这一过程变得更为繁重。

여러 AI 모델의 다양한 지능 평가 항목별 점수를 막대그래프로 비교한 종합 평가 차트
이미지: @ArtificialAnlys (X)

那么,这意味着什么

国内实验室的自研模型在独立评测机构的实务型排行榜上超越人类基准线,这样的案例已经出现。42分的成绩虽不足以与Claude Opus 5或GPT-5.6系列相抗衡,但与前代如此悬殊的差距表明,该实验室在短短一代之间大幅改变了推理训练方式。从实务使用者的角度看,更重要的变化在于模型的"性格"。一款幻觉率高达88%的模型很难用于文档摘要或企业内部问答。而幻觉率降至24%的模型,方向是"宁可不答也不给错误答案",这至少能降低审核成本。但代价是,超过一半的问题可能得不到回答,且等待响应的时间比前代更长。具体适用于哪些工作场景,需要权衡这两种特性后再做判断。

评论