METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

클로드·GPT 숨은 추론 토큰 복원됐다, 벤치마크 암기 의혹까지

논문 한 편이 비공개 API의 사고 과정을 100% 노출시키며 벤치마크 신뢰성 논쟁을 키웠다

클로드·GPT 숨은 추론 토큰 복원됐다, 벤치마크 암기 의혹까지

이미지: METAL

요약

  • 한 논문이 Claude·GPT 계열 모델의 숨겨진 추론 토큰을 100% 복원하는 방법을 제시했다고 커뮤니티에 전해졌다
  • 공개된 추론 예시에서 Claude가 AIME 문제를 사전에 외운 듯한 반응을 보였다는 주장이 나왔다
  • 오픈소스 모델에서 흔히 보이는 '이상한 단어 나열·과잉사고' 패턴이 프론티어 모델에서도 나타난다는 관찰도 함께 제기됐다
논문 제목
Stealing Reasoning Traces from Proprietary LLM APIs (커뮤니티 전언)
대상 모델
Claude 계열, GPT 계열 전체로 알려짐
핵심 주장
비공개 API 추론 토큰 100% 복원 가능
논란 지점
Claude가 AIME 벤치마크 문제를 암기한 듯한 반응 확인 (커뮤니티 주장)
확산 경로
r/LocalLLaMA 게시글, 2026년 8월 12일

무엇이 나왔나

오픈AI(OpenAI)와 앤스로픽(Anthropic)이 API로 내놓는 Claude·GPT 계열 모델은 '추론 토큰' — 답을 내기 전 모델이 속으로 생각하는 과정 — 을 사용자에게 그대로 보여주지 않는다. 요약된 형태만 노출하거나 아예 가려버리는 것이 지금까지의 관행이었다. 그런데 한 논문이 이 가림막을 뚫고 두 회사 모델 계열의 추론 토큰을 100% 복원하는 방법을 제시했다고 r/LocalLLaMA 이용자가 8월 12일 전했다. 논문에는 실제 복원된 추론 예시가 다수 함께 공개됐다고 알려졌다.

이 게시물에서 가장 눈에 띄는 대목은 벤치마크 관련 의혹이다. 수학 경시대회 문제 모음인 AIME 벤치마크 질문을 Claude에 던졌을 때, 복원된 추론 과정에서 모델이 답을 '외워서' 알고 있는 듯한 신호가 나타났다는 주장이다. 이 주장이 맞다면 Claude가 오픈소스 모델을 앞선다고 알려진 각종 성능 그래프 일부가 실제보다 부풀려졌을 가능성을 시사한다.

이게 무슨 얘긴가

이런 논란이 처음은 아니다. AI 모델의 성능 지표는 대부분 공개된 벤치마크 문제 세트로 측정되는데, 문제와 정답이 학습 데이터에 이미 섞여 들어갔다면 모델은 '푸는' 것이 아니라 '기억'하는 셈이 된다. 이를 흔히 '벤치맥싱(benchmaxing)' — 벤치마크 점수만 잘 나오도록 특정 문제 패턴에 맞춰 학습을 최적화하는 행태 — 이라고 부른다. Epoch AI가 지난 8월 6일 비공개 게임 퍼즐 벤치마크를 새로 내놓은 것도 같은 맥락이다. 모델이 사후학습으로 미리 익혔을 가능성이 낮은 문제로 실제 추론 능력을 재보겠다는 취지였고, 당시 최고 점수는 Opus 5의 59%로 집계됐다.

게시물은 또 하나의 흥미로운 관찰을 덧붙였다. 오픈소스 모델을 돌릴 때 종종 보이는 '이상한 단어 나열'이나 '과잉사고(overthinking)' 현상이 사실은 프론티어 모델에서도 거의 항상 나타나는 정상적인 패턴이라는 것이다. 그동안 이런 현상은 오픈소스 모델의 완성도가 떨어진다는 증거처럼 여겨졌는데, 비공개 모델의 실제 사고 과정을 들여다보니 크게 다르지 않았다는 이야기다.

그래서 뭐가 달라지나

게시물 작성자는 이번 발견을 근거로 오픈소스 모델이 실제로는 알려진 것만큼 뒤처져 있지 않다는 주장을 폈다. "비법 같은 건 없다, 데이터와 컴퓨트, 엔지니어링일 뿐"이라는 것이 요지다. 커뮤니티 일부에서는 이 정보 격차를 중국 기업들이 프론티어 모델 지식증류 — 큰 모델의 추론 패턴을 작은 모델에 옮겨 학습시키는 방법 — 에 활용해 왔을 것이라는 추정도 나왔다. 이번에 가림막이 닫히면 그런 지식증류 속도가 느려질 것이라는 전망도 함께 제기됐다.

다만 이 모든 내용은 논문 자체가 아니라 이를 소개한 Reddit 게시글을 통해 전해진 것이어서, 논문의 정확한 방법론과 복원 정확도, 두 회사의 대응 여부는 추가 확인이 필요하다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글