hcai-lab-gt/capabilibara
追踪语言模型的社会推理能力究竟来自训练数据的哪些部分
这个项目构建了一套流程,用来追踪语言模型的某项能力(比如社会推理)究竟依赖训练语料中的哪些内容。团队把568万份抽样文档归入576个主题乘格式的区域,计算这些区域对基准测试答案的影响力,再直接删除被标记的区域,检验模型能力是否真的因此下降。该研究由佐治亚理工学院实验AI实验室、EleutherAI等参与完成,是COLM 2026会议论文。
- ai-research
- capability-provenance
- interpretability
- language-models
- machine-unlearning
- mechanistic-interpretability
- research
- training-data-attribution
它做什么
- 团队从去重后约12.6亿份文档的Dolma3语料中抽取568万份文档,按24种主题乘24种格式分类,划分出576个语料区域
- 在OLMo3-7B模型上使用基于梯度的训练数据溯源方法TrackStar(通过Bergson工具),追踪SocialIQA、MMLU等基准测试的答案受到哪些训练文档影响,并将影响力汇总到576个区域
- 对被标记为高影响力的区域进行选择性遗忘(unlearning),即从模型中删除这些内容的影响,以因果方式验证该区域是否真的支撑了对应能力
- 删除与SocialIQA相关的被标记区域后,模型在该测试上的表现下降了1.60个百分点,该结果具有统计显著性(p约为十的负五次方)
- 代码、采样清单、影响力矩阵和遗忘后的模型检查点计划随论文最终版一起发布,目前仅公开了仓库结构和方法说明
为什么重要
了解模型某项能力究竟来自哪部分训练数据,能让研究者更精准地修正或删除有问题的数据,而不是凭猜测行事。这个项目展示了一种不依赖逐篇文档、而是按语料大区域来追踪能力来源的方法,并用真实的删除实验在大型开放模型上加以验证,对做可解释性和数据治理研究的人有参考价值。
本仓库术语
- 训练数据溯源(training-data attribution) · 追踪模型某个具体行为或答案是由哪部分训练数据产生的技术
- 机器遗忘(machine unlearning) · 从已训练好的模型中有选择地去除特定数据影响的技术
- WebOrganizer 24x24分类体系 · 将网页文档按24种主题与24种格式交叉分类的方案
- TrackStar(Bergson) · 利用梯度估算哪些训练文档影响了模型输出的工具
- LoRA · 一种轻量级微调方法,只调整新增的少量参数而非整个模型
仓库简介(英文)
Training-data attribution as a discovery method for capability provenance in language models. COLM 2026.
在 GitHub 打开项目主页相关报道
热门仓库
- openai/codexOpenAI的编程智能体现在可以直接在终端里运行了
- cordiverse/cordis一个可以随时插拔功能模块的TypeScript编程框架
- ripienaar/free-for-dev一个仓库汇总了开发者能用的所有免费云服务、API和协作工具
- Wei-Shaw/sub2api让一份Claude、OpenAI、Gemini、Grok订阅可以被多人拼车共用的中转服务器
- multica-ai/andrej-karpathy-skills一份指令文件,防止AI编程助手偷偷瞎猜、乱改代码
- eneskirca/nodeterm把散乱的终端标签页和AI编程代理统一摆到一张可拖拽的画布上
- affaan-m/ECC让AI编程助手养成工程师式工作习惯的工具集
- n8n-io/n8n不用写代码,靠拖拽连接模块就能搭建自动化流程和AI智能体的工具n8n