
이미지: METAL LAB 생성
摘要
- Epoch AI公开了一项结构与此前Chess Puzzles基准测试类似的新'game puzzles'基准测试。
- 该测试未公开题目取材于哪款游戏,目的是衡量模型很可能未在后训练(post-training)阶段接触过的推理任务。
- 截至公开时点,已知最高得分为Opus 5的59%。
- 발표 주체
- Epoch AI
- 발표 시점
- 2026년 8월 6일(UTC)
- 벤치마크 명칭
- game puzzles
- 설계 참조
- Epoch AI의 기존 Chess Puzzles 벤치마크
- 사용 게임
- 비공개(undisclosed)
- 현재 1위
- Opus 5
- 1위 점수
- 59%
- 측정 목적
- 사후학습이 이뤄지지 않았을 가능성이 큰 추론 중심 과제 평가
继国际象棋解谜之后的"无名游戏"
Epoch AI公开了新的'game puzzles'基准测试。该评测沿用了该机构此前运营的Chess Puzzles基准测试的形式,但题目来源的游戏并非国际象棋,具体是哪款游戏并未公开。
Epoch AI将不公开游戏信息的原因与后训练(post-training)阶段可能接触到题目相关联加以说明。其问题意识在于,广为人知的游戏题型可能在模型训练与调优过程中已被反复处理过,因此难以真正衡量纯粹的推理能力。Epoch AI表示,该基准测试考察的是"模型很可能未经过后训练"的以推理为核心的任务。

目前最高分为Opus 5的59%
截至公开时点,创下最高纪录的模型是Opus 5,得分为59%。由于Epoch AI此次发布并未同时公布其他模型的具体得分或完整排行榜数据,头部模型之间的差距,以及与人类基准线的比较均无法确认。
| 项目 | Chess Puzzles(既有) | game puzzles(新) |
|---|---|---|
| 题目来源游戏 | 国际象棋 | 未公开 |
| 设计方式 | 基于解谜的评测 | 采用类似结构 |
| 公开得分 | 本次发布未包含 | Opus 5 59% |
| 模型 | game puzzles得分 |
|---|---|
| Opus 5 | bar:59 59% |
为何需要"未被污染"的评测
推理基准测试长期以来被指出,一旦题目类型公开,就可能被后续模型训练所吸收。将游戏本身的身份保密的做法,可以被解读为一种试图延缓这种暴露的设计。不过,Epoch AI将在多长时间内维持保密状态、题目数量与评分方式如何构成等具体方法论,仅凭此次公开的内容尚无法确认。
关于AI模型评测方式与基准测试可信度的争论,可在METAL LAB的基准测试相关报道中继续查看。
有待确认的部分
本次内容是以Epoch AI直接发布的单篇公开文章为依据。该基准测试的完整排行榜、对比模型清单、评测协议等,仍需通过后续公开的资料加以确认。



