
이미지: METAL LAB 생성
摘要
- 据社区消息,一篇论文提出了一种能100%还原Claude、GPT系列模型隐藏推理令牌的方法
- 有人指出,在公开的推理示例中,Claude在解答AIME题目时表现出似乎是提前"背下"答案的反应
- 同时也有观察指出,开源模型中常见的"奇怪词语堆砌、过度思考"模式,在前沿模型中同样存在
- 논문 제목
- Stealing Reasoning Traces from Proprietary LLM APIs (커뮤니티 전언)
- 대상 모델
- Claude 계열, GPT 계열 전체로 알려짐
- 핵심 주장
- 비공개 API 추론 토큰 100% 복원 가능
- 논란 지점
- Claude가 AIME 벤치마크 문제를 암기한 듯한 반응 확인 (커뮤니티 주장)
- 확산 경로
- r/LocalLLaMA 게시글, 2026년 8월 12일
出现了什么
OpenAI和Anthropic通过API提供的Claude、GPT系列模型,一直不会向用户完整展示"推理令牌"——即模型在给出答案之前内部进行思考的过程。此前的惯例是只展示经过摘要的版本,或者干脆完全隐藏。但据r/LocalLLaMA用户8月12日发布的消息,有一篇论文提出了一种方法,能够突破这层遮蔽,100%还原这两家公司模型系列的推理令牌。据称,论文中还附带公开了大量实际还原出的推理示例。
这篇帖子中最引人注目的部分,是与基准测试相关的疑点。据称,在向Claude提出AIME数学竞赛题目集中的问题时,还原出的推理过程中出现了模型似乎"提前记住"答案的迹象。如果这一说法成立,那么此前显示Claude领先开源模型的部分性能对比图,其真实性可能被夸大了。
这意味着什么
类似争议此前也曾出现过。AI模型的性能指标大多依赖公开的基准测试题集来衡量,但如果题目和答案本身已经混入了训练数据,那么模型所做的就不是"解题",而是"记忆"。这种现象通常被称为"benchmaxing"——即为了让基准测试分数好看,而针对特定题目模式专门优化训练的做法。Epoch AI于8月6日推出一套全新的非公开游戏解谜基准测试,正是出于同样的考虑:希望用模型不太可能通过后训练提前接触过的题目,来真实衡量模型的推理能力。当时的最高分由Opus 5取得,为59%。
帖子还提到了另一个有趣的观察:在运行开源模型时常见的"奇怪词语堆砌"或"过度思考(overthinking)"现象,实际上在前沿模型中也几乎普遍存在,是一种正常模式。此前这类现象一直被视为开源模型完成度不足的证据,但在窥见非公开模型真实的思考过程后发现,二者其实并无太大差别。
这会带来什么变化
帖子作者据此提出观点:开源模型实际上并没有外界认为的那样落后。其核心论点是"没有什么秘诀,无非是数据、算力和工程能力"。社区中也有人猜测,中国企业可能一直在利用这种信息落差,对前沿模型进行知识蒸馏——即把大模型的推理模式迁移训练到小模型上。也有观点认为,随着这层遮蔽被重新关闭,此类知识蒸馏的速度可能会因此减慢。
不过,以上内容均来自介绍该论文的Reddit帖子,而非论文本身,因此论文的具体方法论、还原准确率,以及两家公司是否已作出回应,都还需要进一步核实。



