Recursive Agentic Reasoning
多采样几个答案再投票的方法,连AI答不出话来的失败情况也能补救
研究者把三种让语言模型在推理阶段多花计算量的方法统一起来比较:反复深挖一条思路(Grow)、把问题拆成子问题再合并(Prune)、独立采样多个答案再投票(Branch)。在覆盖3个前沿模型和5个基准、共14种组合的实验中,Branch最稳定地提升了准确率。深入分析发现,Branch获胜的原因不只是综合了多条推理路径,更重要的是它挽救了模型因token预算耗尽而完全答不出话的情况。
METAL LAB 解读图
三种测试时推理算子的比较结构
证据状态已报告实测结果
- CoT基线模型只被调用一次,直接返回它给出的任何答案
- GROW把上一轮答案重新输入让模型再解一次,答案不再变化时停止(最多3轮)
- PRUNE把问题拆解成有序的子问题,依次求解后再合并成最终答案
- BRANCH独立采样5个答案后投票选多数,空回答会被自动排除在投票之外
- 关键发现BRANCH获胜主要是因为挽救了基线因预算耗尽而未给出答案的情况(与空回答比例的相关系数r=0.72)
他们做了什么
- 研究者把三种测试时推理方法统一成一个框架:GROW(反复深化单一推理路径)、PRUNE(把问题拆解成有序子问题分别求解再合并)、BRANCH(独立采样多个答案后投票选出多数结果)。
- 他们在同一套实验框架下用完全相同的提示词、token预算和评分代码,把这三种算子与只调用一次模型的思维链(CoT)基线进行比较,覆盖DeepSeek-V4-Pro、MiniMax-M3、Qwen3.6-plus三个前沿模型和五个基准,共14个模型×基准组合、49327条评分数据和151876次模型调用。
- 结果显示BRANCH在全部14个组合中都提升了准确率,相对CoT基线平均提升5.98个百分点,并在其中12个组合中表现最好。相比之下GROW平均只提升2.18个百分点,且在两个组合中反而拉低了表现;PRUNE平均仅提升0.94个百分点。
- 分析发现BRANCH的优势不仅来自综合多条推理路径,还很大程度上来自挽救了因token预算耗尽而返回空内容的失败情况:基线方法空回答的比例越高,BRANCH带来的提升幅度就越大(相关系数r=0.72)。
- 论文还指出,如果不对齐评分条目集合就比较方法(unpaired),或者把评分系统本身的故障当作模型答错来处理,可能会大幅改变甚至颠倒实验结论,因此建议把配对评分(所有方法只在共同成功回答的条目上比较)作为标准做法。
| Benchmark | Capability probed | n | Metric |
|---|---|---|---|
| MuSiQue (Trivedi et al., 2022) | Multi-hop composition | 2,417 | EM / F1 |
| HLE (Phan et al., 2026) | Expert-level academic | 2,158 | Normalized EM |
| BBEH (Kazemi et al., 2025) | General many-hop† | 200 | Normalized EM |
| SuperGPQA (M-A-P Team et al., 2025) | Graduate knowledge | 300 | Multiple choice |
| Omni-MATH (Gao et al., 2025) | Olympiad mathematics | 300 | Normalized EM |
| Benchmark | Model | n | CoT | Grow | Prune | Branch |
|---|---|---|---|---|---|---|
| MuSiQue | DeepSeek-V4-Pro | 2,417 | 67.94 | 66.69 (−1.25) | 68.43 (+0.49) | 72.36 (+4.42) |
| MuSiQue | MiniMax-M3 | 2,398 | 73.35 | 75.23 (+1.88) | 74.23 (+0.88) | 75.85 (+2.50) |
| MuSiQue | Qwen3.6-plus | 2,395 | 77.08 | 77.49 (+0.41) | 74.91 (−2.17) | 78.46 (+1.38) |
| HLE | DeepSeek-V4-Pro | 2,152 | 13.34 | 14.82 (+1.48) | 14.68 (+1.34) | 19.93 (+6.59) |
| HLE | MiniMax-M3 | 500 | 22.40 | 27.80 (+5.40) | 23.80 (+1.40) | 31.00 (+8.60) |
| HLE | Qwen3.6-plus | 305 | 16.39 | 19.34 (+2.95) | 15.08 (−1.31) | 17.05 (+0.66) |
| BBEH | DeepSeek-V4-Pro | 200 | 38.50 | 36.00 (−2.50) | 37.50 (−1.00) | 52.00 (+13.50) |
| BBEH | MiniMax-M3 | 200 | 26.50 | 32.50 (+6.00) | 30.50 (+4.00) | 37.00 (+10.50) |
| BBEH | Qwen3.6-plus | 192 | 66.67 | 68.75 (+2.08) | 68.75 (+2.08) | 72.40 (+5.73) |
| SuperGPQA | DeepSeek-V4-Pro | 300 | 58.33 | 59.00 (+0.67) | 60.67 (+2.34) | 65.33 (+7.00) |
| SuperGPQA | MiniMax-M3 | 299 | 58.53 | 62.54 (+4.01) | 59.20 (+0.67) | 65.22 (+6.69) |
| SuperGPQA | Qwen3.6-plus | 300 | 69.67 | 72.00 (+2.33) | 69.67 (+0.00) | 72.00 (+2.33) |
| Omni-MATH | DeepSeek-V4-Pro | 299 | 33.11 | 33.11 (+0.00) | 35.79 (+2.68) | 39.46 (+6.35) |
| Omni-MATH | MiniMax-M3 | 282 | 30.14 | 37.23 (+7.09) | 31.91 (+1.77) | 37.59 (+7.45) |
| Benchmark | Model | Attempted | Paired n | Attrition |
|---|---|---|---|---|
| MuSiQue | DeepSeek-V4-Pro | 2,417 | 2,417 | 0 |
| MuSiQue | MiniMax-M3 | 2,417 | 2,398 | 19 |
| MuSiQue | Qwen3.6-plus | 2,417 | 2,395 | 22 |
| HLE | DeepSeek-V4-Pro | 2,158 | 2,152 | 6 |
| HLE | MiniMax-M3 | 500 | 500 | 0 |
| HLE | Qwen3.6-plus | 500 | 305 | 195 |
| BBEH | DeepSeek-V4-Pro | 200 | 200 | 0 |
| BBEH | MiniMax-M3 | 200 | 200 | 0 |
| BBEH | Qwen3.6-plus | 200 | 192 | 8 |
| SuperGPQA | DeepSeek-V4-Pro | 300 | 300 | 0 |
| SuperGPQA | MiniMax-M3 | 300 | 299 | 1 |
| SuperGPQA | Qwen3.6-plus | 300 | 300 | 0 |
| Omni-MATH | DeepSeek-V4-Pro | 300 | 299 | 1 |
| Omni-MATH | MiniMax-M3 | 300 | 282 | 18 |
研究结果
- BRANCH在全部14个模型×基准组合中都优于CoT基线,平均提升5.98个百分点(中位数6.47),并在其中12个组合中表现严格最优。
- GROW平均提升2.18个百分点,但在DeepSeek-V4-Pro上的MuSiQue(-1.25)和BBEH(-2.50)两个组合中反而表现变差;PRUNE平均只提升0.94个百分点。
- 在CoT基线下,DeepSeek-V4-Pro因token预算耗尽而返回空内容的比例在HLE上达51.2%、BBEH为34.5%、Omni-MATH为36.1%;使用BRANCH后这一空回答比例大致减半(例如HLE从51.2%降至32.2%)。
- BRANCH每个组合的准确率提升幅度与基线空回答比例呈强相关(r=0.72),而从未出现空回答的Qwen3.6-plus恰恰是BRANCH提升幅度最小的模型。
- 此前一次未配对评分曾显示Qwen3.6-plus在HLE上的准确率从基线的14.20%在使用BRANCH后降至11.20%,但这其实是把因网络超时未获得响应的条目错判为答错所致的假象;改用配对评分后,BRANCH实际提升了0.66个百分点。
可应用场景
- 在算力预算有限、希望提升AI模型解题准确率的场景中,可优先考虑多采样答案再投票的方法。
- 对于经常因token预算不足而返回空白内容的长推理模型,可以尝试用一次针对被截断内容的'定稿'追加提问来低成本地获得接近多次采样的效果,这一思路值得进一步验证。
- 在设计比较多种测试时推理方法的实验时,可采用配对评分——只在所有方法都成功回答的条目集合上比较——以避免误导性结论。
- 评分流程应将因网络或接口故障而未获得响应的条目排除在外,而不是自动判为错误,以免不公平地惩罚调用次数更多的方法。
局限与待验证事项
- 本文中BRANCH仅使用无权重的多数投票,没有验证器或置信度加权,作者也承认这是与最先进的验证器引导选择方法相比最大的差距。
- BRANCH是平面并行采样,不是树搜索,不会像Tree of Thoughts那样扩展或剪枝部分推理状态。
- 论文未做正式的显著性检验,在约200条数据规模的组合中95%置信区间约为±7个百分点,因此BBEH和Omni-MATH上的较小效应应视为初步结果。
- HLE的评分方式是保守下限,实际准确率可能被低估,且Omni-MATH从未在Qwen3.6-plus上运行过。
- 实验涉及的三个模型都是带有隐藏思考过程的推理模型,所发现的截断恢复机制未必能迁移到没有这种特性的模型上。
为什么重要
对于需要决定如何分配有限推理阶段算力的从业者来说,这项研究提供了该优先尝试哪种方法的具体依据。同时它也是一个方法论警示:评分方式的选择本身就可能颠倒关于哪种方法更好的结论。
本文术语
- 测试时推理(test-time reasoning) · 不重新训练模型,而是在生成答案时额外花费计算量来提升准确率的方法
- GROW / PRUNE / BRANCH · 本文定义的三种算子:反复深化单一路径 / 拆解成子问题求解 / 采样多个答案后投票
- 思维链(CoT)基线 · 模型只被调用一次、经过一次推理过程直接给出答案的最简单参照方法
- 配对评分(paired scoring) · 比较多种方法时,只在所有方法都成功给出答案的相同条目集合上进行打分
- 截断 / 预算耗尽输出 · 模型内部思考过程用光了分配的token预算,最终没能给出答案,返回空白内容的现象
论文原文摘要(英文)
Test-time reasoning methods such as iterative refinement, decomposition, and repeated sampling are often evaluated in isolation, making their gains difficult to compare across models, benchmarks, and evaluation pipelines. We introduce a unified view of these methods as recursion operators over an agent's reasoning trace: GROW, which deepens a single reasoning path; PRUNE, which decomposes and recomposes the problem; and BRANCH, which samples alternative reasoning paths and selects among them. We evaluate all three operators against a single-pass chain-of-thought baseline under a shared harness with identical prompts, token budgets, and grading code. Across five benchmarks and three frontier models, comprising 14 model-benchmark settings, 49,327 graded items, and 151,876 model calls, BRANCH improves accuracy in all 14 settings by an average of 5.98 percentage points and is the best-performing operator in 12. In contrast, GROW yields a mean gain of 2.18 points and degrades performance in two settings, while PRUNE improves accuracy by 0.94 points on average. Analysis shows that BRANCH's advantage arises not only from exploring multiple reasoning paths, but also from recovering from truncation: its gains strongly correlate with the baseline rate of empty, budget-exhausted outputs (r = 0.72). These results weaken the hypothesis that different problems require routing among test-time reasoning operators; at this level of abstraction, repeated branching is consistently dominant. Finally, we show that unpaired evaluation and treating scoring-pipeline failures as model errors can materially change, and even reverse, comparative conclusions, motivating paired scoring as a standard protocol for test-time-compute evaluation.
在 arXiv 阅读最新论文
- Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians一个数学模型证明,哪怕是完全理性的人,也会被一味顺着自己说话的聊天机器人带入妄想
- Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment没有中央指挥,来自不同公司的AI智能体在开放世界环境中自行协作,在五个数学难题上做出了新发现
- Automata from Agent Traces: Failure and Next-Step Prediction研究者把大量LLM智能体执行记录压缩成一个小型有限状态机,同时用来预测下一步动作和提前发现失败
- MARS: Multi-Specialist LLM Relay System for Competitive Programming解竞赛编程题时,让分主题的专家AI接力改代码,比让一个通才模型包办全部角色更高效
- AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace让多个AI编程智能体在同一工作区实时协作,比按顺序执行或无协调地并行执行效果更好
- Black hole singularity is a surface not a point黑洞奇点是一个面,而不是一个点
- GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?AI编程智能体擅长从零做出一款能玩的游戏,但不擅长自己发现漏洞、也难在修改中保住原有功能
- There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items同一个模型只要换一种打分方式,准确率就能从31%变到89%,而这种打分方式正悄悄决定排行榜的冠军
METAL LAB 最新报道
图片来源: Shengxin Zhang et al., arXiv:2608.23956, CC BY 4.0