每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

乔治亚理工用Olmo 3完全开源模型追溯社会推理能力的来源

研究团队从12.6亿份训练文档中抽取568万份作为样本,确认了哪类文本造就了哪种能力

교차하는 두 갈래 길이 있는 항공 풍경 사진

이미지: @allen_ai (X)

摘要

  • 乔治亚理工大学研究团队利用艾伦人工智能研究所完全开源的Olmo 3模型及其训练数据Dolma 3,追溯了各基准测试成绩究竟源自哪类训练文档
  • 研究发现,SocialIQA(社会推理)成绩更多依赖文学、日常对话等叙事类文本,而ARC和MMLU则更依赖技术文档、科学类说明性文本
  • 研究团队将与社会推理关联度最高的文学类文档从模型中删除后,SocialIQA分数的下降幅度大于随机删除同等数量文档的情况,由此确认了因果关系
연구자
Glenn Matlin, Chandreyi(Zini) Chakraborty (조지아공대)
사용 모델·도구
올모3(Olmo 3), 돌마3(Dolma 3), WebOrganizer, OlmoEval, OLMES
분석 방법
영향함수(influence functions)로 개별 학습 문서와 벤치마크 답변의 연관성 추정
표본 규모
돌마3 문서 약 12억6000만개 중 576개 범주에서 568만개 표본 추출
테스트 벤치마크
SocialIQA, ARC-Challenge, MMLU 사회과학/STEM
핵심 발견
SocialIQA만 문학·고객상담·Q&A 등 서사형 글에 크게 의존, 나머지는 기술문서·과학 글에 의존
인과 검증
문학 범주 중 영향력 큰 문서를 삭제하자 무작위 삭제보다 SocialIQA 점수가 더 하락
발행
Ai2, 2026년 8월 21일

删掉文学作品后,社会推理能力随之崩溃

理解人类情感、意图以及日常道德选择的能力——即所谓的社会推理能力——会因语言模型学习的文本类型而有所不同,这是乔治亚理工大学研究团队得出的结论。研究团队从模型训练文档中挑选出对文学类别影响力最大的文档,并将其从模型中删除。结果,衡量理解社会情境能力的基准测试SocialIQA的分数,相比随机删除等量文档时下降得更为明显。这相当于通过"删除后验证"的方式,确认了模型学习的文本类型确实塑造了相应能力。

主导这项实验的是乔治亚理工大学计算机科学博士生Glenn Matlin,以及共同作者Chandreyi(Zini) Chakraborty。两人多年来一直在追踪语言模型社会推理能力的来源。Chakraborty谈及所设计的研究时表示:"问题只有一个,那就是(这种能力)从何而来。"

이미지: @allen_ai (X)

唯有完全开源模型才能实现这项实验

研究团队采用的方法是一种名为"影响函数"(influence functions)的技术。该技术能够估算模型训练过程中每一份文档对特定基准测试问题答案所产生的影响程度。将这些估算值按文档类型汇总后,就能看出无论是文学还是技术文档,哪类文本支撑着模型的特定能力。不过,要让这种方法成立,必须先确认模型确实学习过这些文档。

大多数语言模型无法确认这一点。即便是通常被称为"开源"的模型,也往往只公开训练完成后的权重,而隐藏了具体用什么数据、以何种方式进行训练。相比之下,艾伦人工智能研究所打造的Olmo 3将训练数据Dolma 3、中间检查点乃至评估工具全部公开。这正是研究团队选择该模型的原因。Matlin解释道:"我研究的目标,是绘制一张能将模型行为回溯连接到其训练数据的地图。"

用568万份文档区分出四项基准测试

研究团队动用了Olmo生态系统中的五种公开工具:Olmo 3模型本身、训练数据Dolma 3、按主题和格式对数据进行分类的标注系统WebOrganizer、提供基准测试的OlmoEval,以及统一评分标准的OLMES。Dolma 3中包含约12.6亿份文档,逐一分析是不可能的。研究团队从576个文档类别中抽取568万份作为样本,并按类别汇总了每份文档对基准测试答案所产生的影响得分。

研究团队将这一方法分别应用于SocialIQA、ARC-Challenge(推理能力)以及MMLU的社会科学、STEM子集(事实性知识)等四项基准测试,由此为每项基准测试生成了独特的"影响力画像"。

区分点并非"社会vs科学",而是"叙事vs说明"

对比四份画像后得出的结果比预想的要复杂。研究团队原本预期社会知识与科学知识会呈现分化,但实际上MMLU中的社会科学知识,其表现规律与STEM知识、推理能力更为相似,而非与社会推理更相似。真正呈现出独特性的反而是SocialIQA。这项基准测试的答案格外依赖Dolma中叙事性强、对话色彩浓厚的类别,比如文学作品、日常社交生活、客户咨询、问答论坛等。其余三项基准测试则更多依赖技术文档、科学文章等说明性文本。

Chakraborty表示:"对话占比高、社会与情感语言比重大的类别,对社会推理的影响力远超其他任何基准测试。"这一趋势并不局限于社会推理领域。对话体、以人际关系为中心的文本,在SocialIQA和ARC这两项推理类基准测试中的影响力,均大于其在知识类基准测试中的影响力。这一现象暗示,对话型数据的作用可能不仅限于教授社会情境知识,还可能与推理能力本身相关。

研究团队强调,这一结果并不意味着"增加文学类文本就能提升社会推理能力"这样简单的公式成立。相反,一旦确认某类数据确实支撑着某种能力,就可以据此测试增减该类数据时模型会发生怎样的变化。

为何此类研究如今才成为可能

去年8月6日,艾伦人工智能研究所在题为Ai2扩大与Hugging Face的合作,存储容量增至三倍的公告中表示,已将Hugging Face Hub的存储容量提升至此前约三倍,达到2PB左右的水平。这一举措使得大型数据集和多个检查点模型能够在不受下载速度限制的情况下获取,据悉艾伦人工智能研究所公开的模型和数据集自2024年春季以来下载量已超过5000万次。此次乔治亚理工大学的研究,正是建立在这一不断积累的开放基础设施之上的成果。

Matlin表示:"AI安全研究者需要挑战既有认知、尝试全新的审计方法,而如果研究者完全依赖私营实验室的模型资产,这是不可能实现的。艾伦人工智能研究所不仅仅公开了模型本身,更是将足以让外部团队对该模型进行调查、并从零开始复现的整套科学体系全部公开。"

直接查看代码与数据

研究团队已将实验代码和详细结果发布在github.com/HCAI-LAB-gt/capabilibara代码库以及huggingface.co上的capabilibara Space页面。介绍研究方法的论文可在arXiv上公开的研究设计文档中查阅,如有疑问也可以在研究团队的Discord服务器中提问。目前处于代码与研究成果公开阶段,尚未提供独立的应用程序或网页界面,需通过下载代码库自行复现。

编辑视角

这项研究有趣之处,不在于结果本身,而在于为得出这一结果所采用的路径。对于ChatGPT或Claude这类闭源模型,想要追问"是什么数据造就了这个答案",从原理上就是不可能的——由于训练数据未公开,只能靠猜测。而Olmo 3则将权重、训练文档、中间检查点乃至评分标准全部公开,这使得两名外部研究生得以独立完成一项堪比大型实验室水准的审计工作。这与单纯做出一个优秀模型是截然不同性质的贡献。

从实际应用角度看,这项研究真正的价值并不在于"加入文学作品能提升社会性"这一结论本身,而在于其方法论。对于国内从事微调或数据整理的团队而言,这意味着在为了提升某项基准测试分数而盲目增加数据量之前,现在可以先确认哪类文本真正与该能力相关联。不过,这种方法需要从568万份文档中抽取样本,并针对每项基准测试重新计算影响力,运算量相当可观。与其直接应用于数据量仅为几个GB的小规模微调场景,不如将其视为自研基础模型的机构在制定数据构成策略时可参考的方法论。

预计未来几个月内,类似的"开源模型审计"研究会不断增加。结合艾伦人工智能研究所近期将Hugging Face Hub存储空间扩容至三倍的举措来看,将完全开源模型作为学术审计标准基准的趋势,正在逐步形成。

本文相关代码

评论