
요약
- Epoch AI가 기존 Chess Puzzles 벤치마크와 유사한 구조의 새로운 'game puzzles' 벤치마크를 공개했다.
- 어떤 게임의 퍼즐인지는 공개하지 않았으며, 모델이 사후학습(post-training)으로 익히지 않았을 가능성이 큰 추론 과제를 측정하는 것이 목적이다.
- 공개 시점 기준 최고 점수는 Opus 5의 59%로 알려졌다.
- 발표 주체
- Epoch AI
- 발표 시점
- 2026년 8월 6일(UTC)
- 벤치마크 명칭
- game puzzles
- 설계 참조
- Epoch AI의 기존 Chess Puzzles 벤치마크
- 사용 게임
- 비공개(undisclosed)
- 현재 1위
- Opus 5
- 1위 점수
- 59%
- 측정 목적
- 사후학습이 이뤄지지 않았을 가능성이 큰 추론 중심 과제 평가
체스 퍼즐 다음은 '이름 없는 게임'
Epoch AI가 새로운 'game puzzles' 벤치마크를 공개했다. 이 평가는 이 단체가 앞서 운영해 온 Chess Puzzles 벤치마크와 유사한 형식을 따르지만, 문제를 가져온 게임이 체스가 아닌 다른 게임이며 어떤 게임인지는 공개하지 않았다.
Epoch AI는 게임 정보를 밝히지 않은 이유를 사후학습(post-training) 노출 가능성과 연결해 설명했다. 널리 알려진 게임의 문제 형식은 모델 학습·튜닝 과정에서 이미 반복적으로 다뤄졌을 수 있어, 순수한 추론 능력을 재기 어렵다는 문제의식이다. Epoch AI는 이 벤치마크가 "모델이 사후학습되지 않았을 가능성이 큰" 추론 중심 과제를 시험한다고 밝혔다.
현재 최고 점수는 Opus 5의 59%
공개 시점 기준으로 기록 보유 모델은 Opus 5이며 점수는 59%다. Epoch AI는 이번 발표에서 다른 모델의 개별 점수나 전체 순위표 수치를 함께 제시하지 않았기 때문에, 상위권 모델 간 격차나 인간 기준선과의 비교는 확인되지 않았다.
| 항목 | Chess Puzzles(기존) | game puzzles(신규) |
|---|---|---|
| 문제 출처 게임 | 체스 | 비공개 |
| 설계 방식 | 퍼즐 기반 평가 | 유사 구조 적용 |
| 공개 점수 | 이번 발표에 포함되지 않음 | Opus 5 59% |
| 모델 | game puzzles 점수 |
|---|---|
| Opus 5 | bar:59 59% |
왜 '오염되지 않은' 평가가 필요한가
추론 벤치마크는 문제 유형이 공개되는 순간 후속 모델 학습에 흡수될 수 있다는 지적을 오래 받아 왔다. 게임의 정체 자체를 비공개로 두는 접근은 이런 노출을 늦추려는 설계로 읽힌다. 다만 Epoch AI가 비공개 상태를 얼마나 유지할지, 문제 수와 채점 방식이 어떻게 구성됐는지 등 구체적인 방법론은 이번 공개 내용만으로는 파악되지 않는다.
AI 모델 평가 방식과 벤치마크 신뢰도를 둘러싼 논쟁은 METAL LAB의 벤치마크 관련 기사에서 이어서 확인할 수 있다.
확인이 필요한 부분
이번 내용은 Epoch AI가 직접 게시한 단일 공개 글을 근거로 한다. 벤치마크의 전체 순위표, 비교 대상 모델 목록, 평가 프로토콜 등은 추가 공개 자료를 통해 확인해야 하는 상황이다.





댓글