RHAE Best@1 지표
RHAE Best@1
AI 에이전트가 문제를 한 번 시도해 낸 점수 중, 실행 환경 오류로 무산된 시도를 걸러내고 매기는 채점 기준
쉽게 말하면
RHAE Best@1은 AI 에이전트가 어떤 문제를 딱 한 번 풀었을 때 나온 점수를 그대로 최종 성적으로 인정하는 채점 방식이다. 다이빙 경기에서 심판이 선수의 동작만 보고 점수를 매기되, 발판이 부러져 넘어졌다면 그건 선수의 실수로 치지 않고 다시 뛰게 해주는 것과 비슷하다. 이 지표도 문제를 실제로 못 푼 것과, 도구를 부르다 프로그램이 끊겨 시도 자체가 무산된 것을 구분해서 센다.
이 지표가 뉴스에 등장한 이유는 같은 문제집에서 점수가 30%에서 95.5%로 뛰었기 때문이다. 문제를 푸는 두뇌 역할의 모델은 그대로 두고, 모델을 감싸 도구 호출과 오류 복구를 처리하는 실행 환경만 바꿨는데 점수가 세 배 넘게 올랐다. 예전 실행 환경에서는 모델이 맞게 판단했는데도 중간에 프로그램이 끊겨 실패로 기록된 경우가 많았고, RHAE Best@1은 그런 잡음을 걸러내 모델의 진짜 실력에 더 가까운 숫자를 보여주려는 채점 기준이라는 뜻이다.
그래서 이 숫자를 볼 때는 두 가지를 같이 확인해야 한다. 어떤 문제집을 썼는지, 그리고 그 문제집을 채점한 실행 환경이 무엇인지다. 실행 환경이 바뀌면 같은 모델도 전혀 다른 점수를 낼 수 있다는 걸 이 사례가 보여준다.
기사에서 이렇게 나와요
기사는 "ARC-AGI-3의 RHAE Best@1 지표가 30%에서 95.5%로 올랐다"고 전한다. 여기서 오해하기 쉬운 점은 모델 자체가 더 똑똑해졌다고 읽는 것이다. Prime Intellect의 설명대로 실제로 바뀐 건 모델을 감싸는 실행 환경이고, RHAE Best@1은 그 실행 환경 교체로 실패로 잘못 잡히던 시도들이 줄어든 결과를 보여주는 숫자다.
함께 볼 용어
이 용어가 나온 기사
- Prime Agent 기술보고서 공개, ARC-AGI-3 30%→95.5%AI · 2026.08.27
- Prime Intellect, 자기개선형 에이전트 하네스 'Prime Agent' 공개AI · 2026.08.09
- Kimi, 100개 병렬 에이전트 군집 시스템 출시AI · 2026.08.08
- AWS, Bedrock 자동 추론 정책에 오픈소스 에이전트 스킬 도입AI · 2026.08.09
- AWS, AgentCore 게이트웨이에 AI 트래픽 속도 제한 기능 추가AI · 2026.08.09
- AI 리크루터 앞, 챗GPT 대신 면접 보낸 구직자AI · 2026.09.03
