每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

hcai-lab-gt/capabilibara

1JavaScriptAGPL-3.0

追踪语言模型的社会推理能力究竟来自训练数据的哪些部分

这个项目构建了一套流程,用来追踪语言模型的某项能力(比如社会推理)究竟依赖训练语料中的哪些内容。团队把568万份抽样文档归入576个主题乘格式的区域,计算这些区域对基准测试答案的影响力,再直接删除被标记的区域,检验模型能力是否真的因此下降。该研究由佐治亚理工学院实验AI实验室、EleutherAI等参与完成,是COLM 2026会议论文。

它做什么

  1. 团队从去重后约12.6亿份文档的Dolma3语料中抽取568万份文档,按24种主题乘24种格式分类,划分出576个语料区域
  2. 在OLMo3-7B模型上使用基于梯度的训练数据溯源方法TrackStar(通过Bergson工具),追踪SocialIQA、MMLU等基准测试的答案受到哪些训练文档影响,并将影响力汇总到576个区域
  3. 对被标记为高影响力的区域进行选择性遗忘(unlearning),即从模型中删除这些内容的影响,以因果方式验证该区域是否真的支撑了对应能力
  4. 删除与SocialIQA相关的被标记区域后,模型在该测试上的表现下降了1.60个百分点,该结果具有统计显著性(p约为十的负五次方)
  5. 代码、采样清单、影响力矩阵和遗忘后的模型检查点计划随论文最终版一起发布,目前仅公开了仓库结构和方法说明

为什么重要

了解模型某项能力究竟来自哪部分训练数据,能让研究者更精准地修正或删除有问题的数据,而不是凭猜测行事。这个项目展示了一种不依赖逐篇文档、而是按语料大区域来追踪能力来源的方法,并用真实的删除实验在大型开放模型上加以验证,对做可解释性和数据治理研究的人有参考价值。

本仓库术语

  • 训练数据溯源(training-data attribution) · 追踪模型某个具体行为或答案是由哪部分训练数据产生的技术
  • 机器遗忘(machine unlearning) · 从已训练好的模型中有选择地去除特定数据影响的技术
  • WebOrganizer 24x24分类体系 · 将网页文档按24种主题与24种格式交叉分类的方案
  • TrackStar(Bergson) · 利用梯度估算哪些训练文档影响了模型输出的工具
  • LoRA · 一种轻量级微调方法,只调整新增的少量参数而非整个模型

仓库简介(英文)

Training-data attribution as a discovery method for capability provenance in language models. COLM 2026.

在 GitHub 打开项目主页

相关报道

热门仓库

全部仓库 →

METAL LAB 最新报道