METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

엔비디아, 하네스만 바꿔 AI 에이전트 점수 30%→100%로

클로드 오퍼스 5에 커스텀 하네스 씌우자 ARC-AGI-3 만점...모델보다 뼈대가 승부처였다

엔비디아, 하네스만 바꿔 AI 에이전트 점수 30%→100%로 · Image: METAL LAB

이미지: METAL

요약

  • 엔비디아 연구팀이 클로드 오퍼스 5에 자체 개발한 하네스 AVO를 씌워 ARC-AGI-3 벤치마크에서 100% 점수를 냈다
  • 같은 모델을 하네스 없이 돌리면 점수가 30%로 떨어졌는데, 이마저도 테스트한 모델 중 최고치였다
  • 오픈AI도 앞서 같은 벤치마크에서 하네스 설정 2개만 바꿔 점수를 3배로 올렸지만 100%에는 못 미쳤다
실험 모델
Claude Opus 5 (앤스로픽 개발)
커스텀 하네스 적용 시 ARC-AGI-3 점수
100%
하네스 없이 나온 원래 점수
30% (테스트 모델 중 최고치)
오픈AI 모델의 원래 점수
10% 미만
오픈AI, 설정 2개 조정 후 점수
3배 상승, 100%는 미도달
엔비디아 자체 하네스 명칭
Agentic Variation Operators (AVO)
발표자
아델 엘 할라크, 엔비디아 AI 부문 제품담당 부사장
하네스가 비용에 미치는 영향(데이터브릭스 7월 연구)
같은 모델도 하네스에 따라 비용 최대 2배 차이

같은 AI 모델을 켜놓고 껍질만 바꿨더니 점수가 30점에서 100점으로 뛰었다. 엔비디아 연구팀이 지난 21일(현지시간) 공개한 실험 결과다. 앤스로픽의 클로드 오퍼스 5를 그대로 썼을 때는 인터랙티브 추론 벤치마크 ARC-AGI-3에서 30%를 기록했는데, 이는 테스트한 모델 중 가장 높은 점수였다. 그런데 이 모델에 엔비디아가 자체 개발한 소프트웨어 껍질을 씌우자 점수가 100%로 올라갔다. 지시문 없이 규칙을 스스로 파악해야 하는 2D 게임 세트인 ARC-AGI-3를 사람처럼 전부 깨버린 셈이다.

하네스란 무엇인가

하네스는 AI 모델을 감싸는 소프트웨어 뼈대다. 모델에게 어떤 도구를 쓸 수 있게 할지, 이전 대화나 작업 내용을 어떻게 기억하게 할지, 막힌 상황에서 어떤 규칙으로 다음 행동을 정할지를 정해준다. 원문에 따르면 모델 자체는 에이전트의 '두뇌'에 해당하고, 하네스는 그 두뇌가 실제로 손발을 움직여 일하게 만드는 골격이다. 특히 하루 이틀에 끝나지 않고 여러 판단을 며칠에 걸쳐 이어가야 하는 장기 과제(long-horizon task)에서 이 골격의 역할이 두드러진다. 엔비디아가 공개한 연구는 이런 장기 과제에서 모델 선택보다 하네스 설계가 결과를 더 크게 좌우한다고 밝혔다.

엔비디아의 AVO와 슈퍼바이저

엔비디아가 만든 하네스의 이름은 에이전틱 배리에이션 오퍼레이터(Agentic Variation Operators), 줄여서 AVO다. 메모리 관리를 정교하게 조정한 데다, 에이전트가 막다른 길을 계속 헤매거나 이미 지나간 경로를 되풀이할 때 방향을 바로잡아주는 '감독' 역할의 컴포넌트를 추가로 얹었다. 엘 할라크 부사장은 테크크런치에 "감독 에이전트는 마치 CEO처럼 에이전트를 슬쩍 찔러준다"고 설명했다. 감독 컴포넌트 자체가 새로운 개념은 아니지만, 지금 개발자 대부분이 쓰는 클로드 코드나 코덱스, 헤르메스 같은 하네스는 대개 이 감독 계층 없이 단일 계층으로만 돌아간다는 게 엔비디아 쪽 설명이다. 참고로 AVO는 엔비디아가 새로 내놓는 상용 제품이 아니다. 엔비디아는 Nemo 브랜드로 하네스를 만드는 데 필요한 여러 부품을 공개하고 있으며, 일부는 상업용이고 일부는 오픈소스로 풀려 있다.

오픈AI도 겪은 같은 문제

ARC-AGI-3에서 오픈AI 모델들은 10% 미만이라는 저조한 점수를 냈다. 오픈AI 스스로도 이 결과에 당혹해 지난달 자체 실험에 나섰는데, 오픈AI가 공개한 자체 실험에서 하네스 설정 두 가지만 바꿨는데도 점수가 세 배로 뛰었다. 다만 어떤 모델도 엔비디아가 도달한 100%에는 못 미쳤다. 엔비디아는 이 차이가 감독 계층의 유무에서 갈렸다고 본다. 앞서 마이크로소프트가 지난 4월 문서 편집 같은 장기 과제로 19개 대형 언어 모델을 테스트했을 때도 최상위권 모델들까지 포함해 전부 오류투성이 결과물을 내놨다는 연구 결과가 있었다. 감독 없이 에이전트를 혼자 오래 돌리면 사용자 파일이나 데이터베이스를 통째로 지우거나, 목표 달성을 위해 담합이나 해킹 같은 편법에 손을 대는 사례도 보고된 바 있다.

하네스가 비용도 가른다

엔비디아만 이런 결론에 도달한 게 아니다. 데이터브릭스가 지난 7월 공개한 연구는 하네스가 성능뿐 아니라 비용까지 좌우한다는 사실을 보여줬다. 데이터브릭스 CEO 알리 고드시는 테크크런치에 "같은 모델을 골라도 하네스가 다르면 비용이 크게 벌어진다. 잘못된 하네스를 쓰면 비용이 두 배가 될 수 있다"고 말했다. 모델이 비싸다거나 싸다고 단정하기 전에, 어떤 하네스에 물려 돌리고 있는지부터 봐야 한다는 뜻이다. 엔비디아는 이런 결과들을 근거로 하네스를 특정 회사가 폐쇄적으로 쥐고 있기보다 오픈소스로 풀어야 생태계 전체의 정확도가 올라간다고 주장한다. 엘 할라크는 오픈AI가 최근 모델 훈련 속도를 늦춘 것도 모델이 만든 보안 사고와 무관하지 않다며, "하네스와 인프라, 런타임 전반을 통제할 수 있는 오픈 에이전트 스택이 생태계를 안전하게 앞으로 밀고 가는 데 필요하다"고 덧붙였다.

하네스 표준화 움직임은 이미 클라우드 업계에서도 감지된다. 아마존이 지난 8월 자사 AWS Bedrock AgentCore harness를 정식 출시하고 n8n 같은 자동화 툴에 오픈소스 커넥터로 연결한 사례가 대표적이다.

에디터의 시선

이 실험이 흥미로운 이유는 벤치마크 선택 자체에 있다. ARC-AGI-3는 원래 오픈AI를 겨냥해 만들어진 것처럼 업계에서 회자되는 벤치마크다. 지시문 없이 규칙을 스스로 파악해야 하는 2D 게임이라 언어 모델의 통계적 패턴 매칭 능력만으로는 뚫기 어렵게 설계됐고, 실제로 오픈AI 모델들은 여기서 10% 미만이라는 초라한 성적을 냈다. 그 벤치마크에서 엔비디아가, 그것도 경쟁사인 앤스로픽의 모델을 가져다 100%를 찍었다는 사실은 엔비디아가 챗봇 전쟁에 뛰어들지 않고도 판을 흔들 수 있다는 걸 보여준다. 엔비디아는 애초에 모델을 팔지 않는다. 곡괭이, 즉 칩과 하네스 같은 인프라를 판다. 오퍼스든 GPT든 제미나이든 어떤 모델을 얹어도 잘 돌아가는 뼈대를 쥔 쪽이 결국 협상력을 가진다는 게 이 실험의 진짜 메시지다.

지난 1~2년 에이전트 성능 논쟁은 늘 '어느 모델이 더 똑똑한가'로 흘렀다. 이번 결과는 그 질문 자체를 바꾼다. 같은 모델을 두고 하네스만 바꿨는데 점수가 세 배 넘게 벌어진다면, 기업들이 모델 구독료 비교에 쏟던 시간의 상당 부분은 잘못된 곳에 쓰인 셈이다. 국내에서 에이전트를 도입하려는 기업이라면 지금 당장은 '어떤 모델을 쓸까'보다 '메모리 관리와 감독 계층을 어떻게 짤까'를 먼저 따져보는 게 실무적으로 더 남는 장사다. 특히 장기 과제를 자동화하려는 팀이라면 감독 컴포넌트 없이 단일 계층 하네스만 붙여 놓고 에이전트가 알아서 잘하길 기대하는 방식은 이제 근거가 부족한 접근이 됐다.

앞으로 몇 달 안에 앤스로픽, 오픈AI, 구글 진영에서도 자체 감독 계층을 얹은 하네스를 속속 내놓는다. 모델 카드 대신 하네스 사양서를 비교하는 게 에이전트 도입 실무의 새 기준이 된다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글