
이미지: METAL
요약
- 한 논문이 Claude·GPT 계열 모델의 숨겨진 추론 토큰을 100% 복원하는 방법을 제시했다고 커뮤니티에 전해졌다
- 공개된 추론 예시에서 Claude가 AIME 문제를 사전에 외운 듯한 반응을 보였다는 주장이 나왔다
- 오픈소스 모델에서 흔히 보이는 '이상한 단어 나열·과잉사고' 패턴이 프론티어 모델에서도 나타난다는 관찰도 함께 제기됐다
- 논문 제목
- Stealing Reasoning Traces from Proprietary LLM APIs (커뮤니티 전언)
- 대상 모델
- Claude 계열, GPT 계열 전체로 알려짐
- 핵심 주장
- 비공개 API 추론 토큰 100% 복원 가능
- 논란 지점
- Claude가 AIME 벤치마크 문제를 암기한 듯한 반응 확인 (커뮤니티 주장)
- 확산 경로
- r/LocalLLaMA 게시글, 2026년 8월 12일
무엇이 나왔나
오픈AI(OpenAI)와 앤스로픽(Anthropic)이 API로 내놓는 Claude·GPT 계열 모델은 '추론 토큰' — 답을 내기 전 모델이 속으로 생각하는 과정 — 을 사용자에게 그대로 보여주지 않는다. 요약된 형태만 노출하거나 아예 가려버리는 것이 지금까지의 관행이었다. 그런데 한 논문이 이 가림막을 뚫고 두 회사 모델 계열의 추론 토큰을 100% 복원하는 방법을 제시했다고 r/LocalLLaMA 이용자가 8월 12일 전했다. 논문에는 실제 복원된 추론 예시가 다수 함께 공개됐다고 알려졌다.
이 게시물에서 가장 눈에 띄는 대목은 벤치마크 관련 의혹이다. 수학 경시대회 문제 모음인 AIME 벤치마크 질문을 Claude에 던졌을 때, 복원된 추론 과정에서 모델이 답을 '외워서' 알고 있는 듯한 신호가 나타났다는 주장이다. 이 주장이 맞다면 Claude가 오픈소스 모델을 앞선다고 알려진 각종 성능 그래프 일부가 실제보다 부풀려졌을 가능성을 시사한다.
이게 무슨 얘긴가
이런 논란이 처음은 아니다. AI 모델의 성능 지표는 대부분 공개된 벤치마크 문제 세트로 측정되는데, 문제와 정답이 학습 데이터에 이미 섞여 들어갔다면 모델은 '푸는' 것이 아니라 '기억'하는 셈이 된다. 이를 흔히 '벤치맥싱(benchmaxing)' — 벤치마크 점수만 잘 나오도록 특정 문제 패턴에 맞춰 학습을 최적화하는 행태 — 이라고 부른다. Epoch AI가 지난 8월 6일 비공개 게임 퍼즐 벤치마크를 새로 내놓은 것도 같은 맥락이다. 모델이 사후학습으로 미리 익혔을 가능성이 낮은 문제로 실제 추론 능력을 재보겠다는 취지였고, 당시 최고 점수는 Opus 5의 59%로 집계됐다.
게시물은 또 하나의 흥미로운 관찰을 덧붙였다. 오픈소스 모델을 돌릴 때 종종 보이는 '이상한 단어 나열'이나 '과잉사고(overthinking)' 현상이 사실은 프론티어 모델에서도 거의 항상 나타나는 정상적인 패턴이라는 것이다. 그동안 이런 현상은 오픈소스 모델의 완성도가 떨어진다는 증거처럼 여겨졌는데, 비공개 모델의 실제 사고 과정을 들여다보니 크게 다르지 않았다는 이야기다.
그래서 뭐가 달라지나
게시물 작성자는 이번 발견을 근거로 오픈소스 모델이 실제로는 알려진 것만큼 뒤처져 있지 않다는 주장을 폈다. "비법 같은 건 없다, 데이터와 컴퓨트, 엔지니어링일 뿐"이라는 것이 요지다. 커뮤니티 일부에서는 이 정보 격차를 중국 기업들이 프론티어 모델 지식증류 — 큰 모델의 추론 패턴을 작은 모델에 옮겨 학습시키는 방법 — 에 활용해 왔을 것이라는 추정도 나왔다. 이번에 가림막이 닫히면 그런 지식증류 속도가 느려질 것이라는 전망도 함께 제기됐다.
다만 이 모든 내용은 논문 자체가 아니라 이를 소개한 Reddit 게시글을 통해 전해진 것이어서, 논문의 정확한 방법론과 복원 정확도, 두 회사의 대응 여부는 추가 확인이 필요하다.





댓글