MARS: Multi-Specialist LLM Relay System for Competitive Programming
解竞赛编程题时,让分主题的专家AI接力改代码,比让一个通才模型包办全部角色更高效
MARS用动态规划、图论、字符串、几何等按主题划分的专家智能体,取代了现有多智能体编程系统里笼统的策划者、编码者、调试者角色,每个专家都依靠检索算法理论语料来支撑自己的判断。系统会为每道题挑选一支最多三人的相关专家小队,由起始专家写出C++17初稿,之后每一轮由当值专家用公开样例实际运行代码,再决定保留、修复还是交给下一位专家。在Gemma 4骨干模型上、CodeContests测试集中,MARS达到0.624的通过率,比直接提示高14.4个百分点,以3.3倍更低的耗时缩小了与CodeSIM(0.731)的大部分差距。
METAL LAB 解读图
MARS接力流水线结构
证据状态已报告实测结果
- 专家池与组队11个按主题划分的专家智能体依据共享的cp-algorithms检索语料进行自我评估,挑出最多三名相关专家组队。
- 起始专家写初稿从小队中选出的起始专家写出初始C++17解决方案。
- 执行-自查-交棒轮次每一轮都在沙箱中用公开测试样例运行当前代码,当值专家据此决定保留、修复还是交给下一位专家。
- 接力终止条件出现明确停止信号、可用专家用尽、达到8步上限,或连续无进展时接力停止。
- 基础设施修复与结果最后由只处理样板代码问题的修复步骤收尾,最终在Gemma 4上取得0.624的通过率。
他们做了什么
- 现有多智能体编程系统通常只把工作拆成策划者、编码者、调试者这类通用角色,把具体算法技巧的选择完全交给底层大模型,缺乏真正注入领域知识的机制。
- MARS从11个主题专家池中,通过基于检索的自我评估挑出最多三名相关专家组队;起始专家写出初始C++17方案,此后每一轮都在沙箱里用公开测试样例运行代码,由当值专家决定保留、修复还是交棒给下一位专家。
- 在165道CodeContests测试题、Gemma 4骨干模型上,MARS平均每题只经过2.3个记录阶段就达到0.624±0.006的通过率,比直接提示高14.4个百分点,比只用单一专家的Single-RAG高9.5个百分点,比并行集成基线高6.0个百分点。
- MARS仍落后于反复进行计划-模拟-调试的更重系统CodeSIM(0.731),但以3.3倍更低的实际运行耗时缩小了大部分差距,且每题token花费的波动明显更小。
- 换成其他骨干模型(Qwen3.5-27B、GPT-5.4-mini)或改用Python语言时,Direct < Single-RAG < MARS的排序依然成立;去掉检索增强后通过率下降了2.0个百分点。

| Method | Pass rate | Sec | Tokens | Calls |
|---|---|---|---|---|
| Direct | 0.48± 0.02 | 34.9± 49.6 | 1.8± 1.2 | 1.0± 0.0 |
| Single-RAG | 0.53± 0.01 | 59.8± 21.2 | 25.0± 3.2 | 12.0± 0.0 |
| Parallel ens. | 0.56± 0.00 | 360.9± 172.9 | 29.8± 5.1 | 17.6± 0.8 |
| Base relay | 0.55± 0.00 | 191.6± 91.5 | 34.1± 10.2 | 17.1± 1.7 |
| MARS | 0.62± 0.01 | 244.3± 154.4 | 40.3± 8.1 | 16.6± 1.3 |
| CodeSIM∗ | 0.73± 0.01 | 817.5± 1358.5 | 32.2± 54.8 | 10.2± 14.2 |

| Method | Pass rate | Sec | Tokens | Calls |
|---|---|---|---|---|
| Qwen3.5-27B, C++17 | ||||
| Direct | 0.192±0.018 | 27.2±74.6 | 1.7±2.2 | 1.0±0.0 |
| Single-RAG | 0.264±0.004 | 71.0±57.1 | 26.5±4.0 | 12.0±0.0 |
| MARS | 0.297±0.012 | 109.7±99.7 | 40.5±18.7 | 15.3±3.3 |
| GPT-5.4-mini, C++17 | ||||
| Direct | 0.149±0.019 | 3.4±2.3 | 1.2±0.5 | 1.0±0.0 |
| Single-RAG | 0.364±0.024 | 49.7±26.3 | 24.7±3.2 | 12.0±0.1 |
| MARS | 0.503±0.043 | 92.2±61.1 | 36.8±7.4 | 15.8±1.8 |
| Gemma 4, Python (PyPy 3) | ||||
| Direct | 0.485±0.000 | 70.0±137.8 | 1.6±1.0 | 1.0±0.0 |
| MARS | 0.622±0.015 | 307.6±215.7 | 42.9±9.1 | 17.1±1.4 |
| PairCoder | 0.705±0.009 | 426.7±451.7 | 27.6±20.9 | 7.6±5.4 |

| Configuration | Pass rate | Δ |
|---|---|---|
| MARS (full) | 0.624±0.006 | — |
| w/o RAG grounding | 0.604±0.007 | −0.020 |
| Generalists, no RAG | 0.615±0.013 | −0.009 |
| Earlier Base relay | 0.552±0.000 | −0.072 |
| Parallel manager | 0.564±0.000 | −0.060 |

研究结果
- 在165道CodeContests测试题、Gemma 4骨干上,MARS平均每题2.3个记录阶段即达到0.624±0.006的通过率,比Direct高14.4个百分点,比Single-RAG高9.5个百分点,比Parallel ensemble高6.0个百分点。
- CodeSIM通过率最高,为0.731±0.009,但MARS以3.3倍更低的实际耗时(每题约244.3秒,对比CodeSIM重跑约817秒)缩小了大部分差距。
- 按难度分层看,Easy几乎接近满分(0.80-0.93),而MARS相对Direct的优势在Medium(0.72对0.59)和Hard(0.40对0.18)上进一步拉大。
- 换用其他骨干模型(Qwen3.5-27B、GPT-5.4-mini)以及改用Python语言时,Direct < Single-RAG < MARS的排序依然保持;在Python上MARS达到0.622±0.015,比Direct的0.485高13.7个百分点。
- 去掉检索增强(RAG)后通过率下降2.0个百分点,Base relay和Parallel manager分别比MARS低7.2和6.0个百分点。
可应用场景
- 为竞赛编程类或高度依赖算法知识的编码任务设计流水线时,可参考用检索支撑的分主题专家小队来替代单一通才模型的思路。
- 可用于设计让智能体每轮都用公开测试自查、并自主决定保留、修复或交棒的自检式工作流。
- 在需要控制实际运行耗时和token花费波动、同时又想保留重型迭代搜索系统大部分准确率的实际代码生成服务中作为参考方案。
局限与待验证事项
- 评测仅限于165道CodeContests题目、三种骨干模型、两种语言(C++17和Python)、一个算法理论语料库(cp-algorithms)以及Codeforces标签体系,尚未验证在此范围之外的泛化能力。
- 确定性门控只能拦截同一轮内公开测试的回退,无法覆盖隐藏测试,也无法跨专家比较;所有生成代码仍需要沙箱执行验证。
- 只有CodeSIM在完全相同的阶段化协议下被直接比较,PairCoder仅在Python上比较,LDB、LPW、MapCoder、MaintainCoder、Xolver等因语言或协议差异未能移植对比。
- 从Base relay到MARS的提升(0.552到0.624)同时包含公开测试自查、子任务追踪、基础设施修复等多项改动,各项改动的独立贡献未被拆分。
- 去掉RAG的通才对比同时改变了检索本身,因此并未纯粹分离出'专业化'这一因素单独的效果。
为什么重要
对于正确信号稀少、又高度依赖深层算法知识的竞赛编程任务来说,这项工作说明用检索为专家智能体注入真实主题知识,可以在远低于重型系统成本的情况下追平大部分性能差距。对于设计多智能体编程流水线的开发者而言,这提供了一种替代通用角色分工的轻量方案:按主题接力、每步都有执行反馈的专家团队。
本文术语
- 检索增强生成(RAG) · 模型生成回答前先检索外部资料并参考其内容的技术
- 接力式流水线(relay pipeline) · 一个智能体写出的代码被依次交给下一个智能体接手修改的流程结构
- 通过率(pass rate) · 全部题目中被判定为正确解决的比例
- ExecEval · 实际运行生成代码、检验其是否通过公开测试样例的沙箱执行环境
- CodeSIM · 通过反复计划、模拟、调试来生成代码的对比多智能体系统
论文原文摘要(英文)
Large Language Models excel at code generation, yet competitive programming exposes a persistent failure mode: existing multi-agent pipelines distribute work over generic planner, coder, and debugger roles and delegate the choice of algorithmic technique to the backbone alone. We present MARS (Multi-Agent Relay of Specialized LLMs), a prompt-only framework in which each agent is a topic specialist---dynamic programming, graphs, strings, geometry, and so on---grounded by retrieval-augmented generation over an algorithm-theory corpus. Given a problem, retrieval selects a small team of relevant specialists; a starter writes an initial C++17 solution, and each subsequent turn runs the candidate against public examples in a sandbox, lets the active specialist keep, repair, or hand off the draft, and forwards a structured packet to the next specialist. A single infrastructure-fixer pass normalizes boilerplate at the end. On the CodeContests test split with Gemma 4, MARS reaches $0.624 \pm 0.006$ pass rate at $2.3$ recorded pipeline stages per task ($+14.4$ percentage points over direct prompting), closing most of the gap to CodeSIM ($0.731$) at $3.3{\times}$ lower wall-clock cost and substantially smaller variance in per-task token spend. The source code is available on GitHub: https://github.com/fckand/mars.
在 arXiv 阅读最新论文
- Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians一个数学模型证明,哪怕是完全理性的人,也会被一味顺着自己说话的聊天机器人带入妄想
- Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment没有中央指挥,来自不同公司的AI智能体在开放世界环境中自行协作,在五个数学难题上做出了新发现
- Automata from Agent Traces: Failure and Next-Step Prediction研究者把大量LLM智能体执行记录压缩成一个小型有限状态机,同时用来预测下一步动作和提前发现失败
- AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace让多个AI编程智能体在同一工作区实时协作,比按顺序执行或无协调地并行执行效果更好
- Recursive Agentic Reasoning多采样几个答案再投票的方法,连AI答不出话来的失败情况也能补救
- Black hole singularity is a surface not a point黑洞奇点是一个面,而不是一个点
- GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?AI编程智能体擅长从零做出一款能玩的游戏,但不擅长自己发现漏洞、也难在修改中保住原有功能
- There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items同一个模型只要换一种打分方式,准确率就能从31%变到89%,而这种打分方式正悄悄决定排行榜的冠军
METAL LAB 最新报道
图片来源: Andrei Mikhailov et al., arXiv:2608.23918, CC BY 4.0