ARC-AGI-3 벤치마크
ARC-AGI-3 benchmark
AI가 한 번도 본 적 없는 퍼즐을 얼마나 잘 풀어내는지로 추론 능력을 재는 시험
쉽게 말하면
ARC-AGI-3 벤치마크는 AI에게 처음 보는 퍼즐을 풀게 해서 진짜로 생각하는 능력이 있는지 재는 시험이다. 학교 시험으로 치면 교과서에서 외운 문제가 아니라, 그 자리에서 처음 보는 응용문제를 얼마나 잘 푸는지 채점하는 것과 비슷하다. 점수가 높을수록 낯선 상황에서도 규칙을 스스로 찾아내 문제를 해결하는 능력이 좋다는 뜻이다.
예를 들어 어떤 AI 모델이 이 시험에서 13.3점을 받다가 나중에 38.3점을 받았다면, 단순히 더 많이 외워서가 아니라 처음 보는 문제 유형에도 적응하는 힘이 늘었다는 신호로 읽힌다. 그래서 기업들이 새 모델을 내놓을 때 이 점수를 함께 공개하며 얼마나 똑똑해졌는지를 보여주는 지표로 쓴다.
기사에서 이렇게 나와요
함께 볼 용어
이 용어가 나온 기사
- GPT-6 아스트라 48시간, 건축부터 로봇까지 실사용 쏟아졌다연구실 · 2026.09.06
- 아스트라 99.9%, 점수를 만든 건 하네스였다AI · 2026.09.04
- AI끼리는 말로 하지 않는 편이 빠르다, 필즈상 수학자가 놓은 모델 사이의 다리연구실 · 2026.09.03
- Prime Agent 기술보고서 공개, ARC-AGI-3 30%→95.5%AI · 2026.08.27
- 엔비디아, 하네스만 바꿔 AI 에이전트 점수 30%→100%로AI · 2026.08.22
- 오픈AI, GPT-5.6 Sol API 요금 3개월간 20% 이상 인하AI · 2026.08.22
