METAL

腾讯混元公开EvolveScaler论文

腾讯混元团队9月15日公开了信息演化数据框架EvolveScaler的论文和项目页面。用先以代码定义状态、再渲染成自然语言的数据测试14个模型,在最长难度层级上avg@5中位数跌至11.3。

腾讯混元公开EvolveScaler论文

图片:METAL

摘要

  • 腾讯混元团队与中国人民大学、香港中文大学的研究者公开了EvolveScaler,它把后续记录修改或撤销先前记录的信息演化语境先用代码定义,再生成数据。
  • 以117个任务原型、159个问题算子和五个难度层级,生成了约35100条训练样本和585条评测样本,14个模型的avg@5中位数从71.2跌至11.3。
  • 用6000条样本继续训练内部A3B模型后,八个外部基准的平均分提高了5.25分,而错误答案中约半数出在变化量的加总上。

腾讯混元团队9月15日在X上公开了EvolveScaler论文和项目页面。这篇论文由中国人民大学高瓴人工智能学院、腾讯混元LLM部门和香港中文大学的研究者共同撰写,9月8日上传arXiv,9日发布第二版。它处理的问题只有一个:在长对话中,当后续记录修改或撤销先前记录时,模型能否正确还原当前有效的状态。研究者把这种情形命名为信息演化,并且不是先用自然语言写数据,而是先用代码定义、再渲染成自然语言,以此构建训练和评测数据。用这些数据测试14个前沿及开源模型,在最难的层级上avg@5中位数跌到了11.3。

混元团队的X帖子用游戏日志来解释这个问题。"读一份40天的RPG日志。现在回答一个问题:如果你跳过第7天的小boss,还能打败最终boss吗?"答案不在日志里,必须把世界重新跑一遍才能得出。记录会被撤回、更正、补录,读完之后世界还在继续变化。论文把这样的语境界定为需要重放的事件历史,而不是需要阅读的长文档。出发点是:同样长度、同样轮数的两段对话,一段只累积有效信息,另一段反复推翻先前记录,两者的难度截然不同。

这篇论文的方法是把生成顺序倒过来。先有人工撰写的操作规范,包含十个要素:实体、时间单位、允许的事件类型、需要追踪的状态变量、状态转移约束、判定哪些记录有效的规则、不改变状态的噪声、难度调节参数、问题算子和答案程序。强大的LLM接收这份规范后合成一个自足的Python模拟器,运行模拟器就得到自然语言的多轮事件历史,对同一历史做确定性重放则计算出参考答案和原子级核对清单。论文作者把这种分工写成:"LLM提出可执行的机制,而重放后的程序状态决定监督信号。"混元团队在X帖子中把同一句话压缩为:"代码保证逻辑,语言承载混乱。"约束被编译成代码中的守卫和运行时断言,库存减少事件只有在库存尚存时才能通过,退款只有在引用先前有效付款且不超过未结算金额时才能通过。

规模都写成了数字。二十多名标注者围绕12个主题撰写了117个任务原型,通过验证的117个模拟器支持159个最终问题算子。算子分为排名与比较、聚合与画像、审计与反事实、定位四大组之下的七个家族。五个难度层级把每个样本的事件数从约7个扩展到约1200个,结果是约35100条训练样本和585条经过验证的评测样本。每个模拟器在每个层级抽取60条训练样本和1条评测样本,因此每个层级有7020条训练样本和117条评测样本。规范中包含3410个具名实体、928个事件模式、549个追踪量、1019条有效性规则和442个干扰模板,无效记录比例为10%到14%。论文称,标注者随机抽查117条样本时,逻辑错误为零。

评测表中最显眼的是跌幅。14个模型的avg@5中位数从最短层级的71.2,经67.8、50.5、21.9,降到最长层级的11.3。最高分是GPT-5.5 xhigh,总体pass@5为82.7,avg@5为72.8,在最长层级上也保持了59.3的avg@5。在该层级上,avg@5超过30的只有GPT-5.5的三个变体,DeepSeek V4 Preview Pro以29.7紧随其后,Gemini 3.1 Pro为27.5,腾讯自家模型Hy3 high为19.8,GLM 5.2为12.5。有6个模型跌到10以下。模型之间的差距也随层级拉大。GPT-5.5 xhigh与GLM 5.1在最短层级上是78.5对74.9,相差3.6分,而在最长层级上是59.3对9.6,相差49.7分。答案由gpt-oss-120b只看核对清单来评判。它不看之前的对话,只接收最终问题、答案和核对清单,判断各项是否满足。

用工程师的眼光读这张表,看到的是与上下文窗口规格不同的数字。论文写明,所有输入都在各模型支持的窗口之内,没有被截断。所以下降的不是能读的长度,而是在过滤已取消的订单、已更正的收据和迟到的记录的同时重新计算当前值的能力。工单系统的状态变更历史、订单与退款混杂的账本、经过多轮评审的代码变更,真实的工作语境大多是这个形状。METAL曾报道以企业代码库构建的基准Real-SWE,也曾报道阿里巴巴衡量长程自主任务的电商基准。EvolveScaler位于两者之间,是一把只量状态还原这一项能力的尺子。

第二个结果是这些数据对训练同样有效。研究者用GRPO在6000条EvolveScaler样本上继续训练内部A3B模型,然后在训练数据中不包含的八个外部基准上测试。平均分从33.17升至38.42,提高5.25分,八个基准全部超过基础模型。仅前200条样本就把平均分提高了2.43分,之后又增加了1.85分和0.97分。提升最大的是MARS的9.50分、MRCR的7.59分、MultiChallenge的7.33分和AA-LCR的6.41分。在同样6000条的预算下,短、中、长三个层级各取2000条的混合配置在八个基准上全部优于只用单一层级的配置。

还有对错误答案的拆解。按失败回答首先违反的核对清单条目贴标签后,十个模型都是在加总带符号的变化量时出错最多。这一比例从GPT-5.5 xhigh的46.2%到Doubao 1.8 high的55.9%不等。遗漏相关记录或纳入无关记录的检索与计数错误以16.8%到21.1%位居其次,排名与平局处理错误至少19.2%,在GPT-5.5 xhigh中最高,达29.8%。选错有效记录集合的情况不超过5.5%。也就是说,模型大体能认出哪些记录被取消了,却在剩余记录的加减上崩溃。

METAL核实的论文PDF共19页。项目页面有一个以仓库交接班看板为例的交互式演示,左侧是模型读到的自然语言语境,右侧是由代码维护的隐藏账本。演练任务、撤回的扫描、旧盘点草稿和测试波次不会触及账本,同一份日志可以用七个算子家族反复提问。METAL曾报道腾讯混元开源生成与修改声音的模型,也曾报道Hy4预览版的开源发布。这次发布的不是模型,而是用来测量和训练模型的数据,截至韩国时间15日晚间,X帖子的浏览量为5634次。论文写道,当前框架限于离散的、由程序规定的状态转移,将其扩展到部分可观测、连续值和多模态场景是下一步的课题。

长上下文的竞争正从能读多少token转向能经受多少次更正。这篇论文给出的数字是这场竞争的起跑线。即便最先进的模型,在约1200个事件的历史上也只有大约五次中三次答对,14个模型中有6个连十次中一次都答不对。把状态用代码固定、把语言放在其上的这种方式,不仅在评测上而且在训练上也行得通,这是留给数据构建者的结果。

评论