每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Epoch AI,公开非公开游戏解谜基准测试…Opus 5得分59%

继国际象棋解谜基准测试之后,用不公开具体游戏种类的解谜题集来衡量推理能力

이미지: METAL LAB 생성

摘要

  • Epoch AI公开了一项结构与此前Chess Puzzles基准测试类似的新'game puzzles'基准测试。
  • 该测试未公开题目取材于哪款游戏,目的是衡量模型很可能未在后训练(post-training)阶段接触过的推理任务。
  • 截至公开时点,已知最高得分为Opus 5的59%。
발표 주체
Epoch AI
발표 시점
2026년 8월 6일(UTC)
벤치마크 명칭
game puzzles
설계 참조
Epoch AI의 기존 Chess Puzzles 벤치마크
사용 게임
비공개(undisclosed)
현재 1위
Opus 5
1위 점수
59%
측정 목적
사후학습이 이뤄지지 않았을 가능성이 큰 추론 중심 과제 평가

继国际象棋解谜之后的"无名游戏"

Epoch AI公开了新的'game puzzles'基准测试。该评测沿用了该机构此前运营的Chess Puzzles基准测试的形式,但题目来源的游戏并非国际象棋,具体是哪款游戏并未公开。

Epoch AI将不公开游戏信息的原因与后训练(post-training)阶段可能接触到题目相关联加以说明。其问题意识在于,广为人知的游戏题型可能在模型训练与调优过程中已被反复处理过,因此难以真正衡量纯粹的推理能力。Epoch AI表示,该基准测试考察的是"模型很可能未经过后训练"的以推理为核心的任务。

Epoch AI公开的game puzzles基准测试结果图片
game puzzles基准测试公开图片 · 来源:Epoch AI

目前最高分为Opus 5的59%

截至公开时点,创下最高纪录的模型是Opus 5,得分为59%。由于Epoch AI此次发布并未同时公布其他模型的具体得分或完整排行榜数据,头部模型之间的差距,以及与人类基准线的比较均无法确认。

项目Chess Puzzles(既有)game puzzles(新)
题目来源游戏国际象棋未公开
设计方式基于解谜的评测采用类似结构
公开得分本次发布未包含Opus 5 59%
模型game puzzles得分
Opus 5bar:59 59%

为何需要"未被污染"的评测

推理基准测试长期以来被指出,一旦题目类型公开,就可能被后续模型训练所吸收。将游戏本身的身份保密的做法,可以被解读为一种试图延缓这种暴露的设计。不过,Epoch AI将在多长时间内维持保密状态、题目数量与评分方式如何构成等具体方法论,仅凭此次公开的内容尚无法确认。

关于AI模型评测方式与基准测试可信度的争论,可在METAL LAB的基准测试相关报道中继续查看。

有待确认的部分

本次内容是以Epoch AI直接发布的单篇公开文章为依据。该基准测试的完整排行榜、对比模型清单、评测协议等,仍需通过后续公开的资料加以确认。