FIRSTPASS: A Multi-Domain, Multi-Round Peer Review Dataset Grounded in Real Editorial Outcomes
一个让AI学会生物学、化学和物理学审稿人真正在意什么的数据集,而不只是计算机科学审稿人
过去所有用来训练AI的同行评审数据集都完全来自计算机科学和机器学习会议,导致模型从未见过生物学审稿人要求污染对照实验,也没见过化学家质疑核磁共振(NMR)谱图归属。FIRSTPASS利用Nature Communications强制透明同行评审制度,汇编了涵盖生物学、化学、神经科学、物理学和地球科学五个领域的3,668条多轮对话记录。每条记录都带有直接源自真实编辑决定的结果标签(两轮评审为STANDARD,三轮及以上为EXTENDED),使评估能够对照真实编辑结果而非文本风格的相似度。
METAL LAB 解读图
FIRSTPASS的构建流程与三任务课程
证据状态已报告实测结果
- 数据收集通过Springer Nature API获取2023年1月至2025年12月的Nature Communications论文,用Gemini解析PDF,筛选出四部分完整且至少两轮评审的3,668条记录
- 标签分配按评审轮数分配结果标签:两轮为STANDARD,三轮及以上为EXTENDED,五个领域均保持62.8%至71.2%的STANDARD占比
- 任务一 审稿生成模型仅根据论文内容生成第一轮审稿意见
- 任务二 审稿更新模型根据论文内容、第一轮审稿意见和作者回应生成第二轮审稿意见,学习判断哪些回应具有说服力
- 任务三 结果预测模型根据完整对话预测STANDARD或EXTENDED;微调后的Qwen2.5-7B-Instruct达到80.5%准确率、78.2% F1-macro
他们做了什么
- 此前的数据集如PeerRead、ReviewMT和MARG完全依赖ACL、NIPS和ICLR的审稿文本,使模型对计算机科学和机器学习之外领域的评审规范一无所知。
- 研究团队通过Springer Nature OpenAccess API查询2023年1月至2025年12月发表于Nature Communications(该刊自2022年11月起强制实行透明同行评审)的论文,用Gemini-3.1-flash-lite-preview解析PDF,只保留摘要、引言、方法、结果四个部分均超过20个词且至少完整保留两轮评审的记录。
- 结果标签按评审轮数分配(两轮为STANDARD,三轮及以上为EXTENDED),该标签在五个领域中的STANDARD占比均保持在62.8%到71.2%之间,说明它反映的是审稿人与作者之间张力的结构性模式,而非某个单一学科的程序惯例。
- 对保留的全部3,668条记录进行自动审查,结果显示零空文件、内容完整性达到100%,专家审稿平均长达2,155个词,比典型的ICLR审稿(约400词)长五倍以上。
- 每篇论文生成三个训练任务:审稿生成、审稿更新和结果预测;经过微调的Qwen2.5-7B-Instruct在结果预测任务上达到80.5%的准确率和78.2%的F1-macro,比零样本的Gemini-3.1-flash-lite-preview高出10.4个百分点。

| Domain | Total | Train | Val | Test | STD (%) | EXT (%) |
|---|---|---|---|---|---|---|
| Biology | 741 | 593 | 74 | 74 | 63.2 | 36.8 |
| Chemistry | 744 | 595 | 75 | 74 | 62.8 | 37.2 |
| Neuroscience | 739 | 591 | 74 | 74 | 64.6 | 35.4 |
| Physics | 727 | 582 | 73 | 72 | 66.7 | 33.3 |
| Earth Sci. | 717 | 573 | 72 | 72 | 71.2 | 28.8 |
| Total | 3,668 | 2,934 | 368 | 366 | 65.4 | 34.6 |
研究结果
- 对保留的全部3,668条Nature Communications记录进行自动审查,发现零空文件,内容完整性达到100%。
- STANDARD标签占比在五个领域中保持一致,介于62.8%到71.2%之间。
- 专家审稿平均长达2,155个词,比典型的ICLR审稿(约400词)长五倍以上。
- 经过微调的Qwen2.5-7B-Instruct在结果预测任务上达到80.5%的准确率和78.2%的F1-macro,比零样本的Gemini-3.1-flash-lite-preview高出10.4个百分点。
可应用场景
- 作为训练数据,用于构建跨多个科学学科而非仅限计算机科学场景的AI审稿辅助工具。
- 作为基准,用于评估AI结果预测模型与真实编辑决定的一致程度。
- 作为方法论模板,用于在临床分诊、基金评审或监管审查等其他领域中检验AI判断是否与真实专家决定一致。
局限与待验证事项
- 数据仅来自Nature Communications这一单一期刊来源,该刊自身的编辑惯例或偏见可能已嵌入数据中。
- 公开数据仅涵盖已接受发表的论文,未包含被拒稿论文的评审过程。
- 存在被滥用于生成合成审稿意见的风险,作者为此发布了明确记录已知局限和缓解措施的数据表。
- 标签仅依据评审轮数确定,因为97.7%的记录无法获取决定信文本,这限制了结果标签的细粒度。
为什么重要
用于辅助或自动化论文评审的AI工具存在把计算机科学式的判断标准套用到评审规范完全不同的其他学科的风险,而FIRSTPASS提供了一种依据真实编辑结果而非表面审稿风格来检验和纠正这种偏差的方法。研究团队公开了数据、解析流程、评估脚本和模型权重,让其他研究者可以直接复现和扩展这一基准。
本文术语
- 同行评审(peer review) · 由同领域专家评估投稿论文并决定是否发表的过程
- F1-macro · 对每个类别分别计算F1分数后取未加权平均值的指标,平等对待各类别
- STANDARD / EXTENDED · 标记论文经历两轮评审(STANDARD)还是三轮及以上(EXTENDED)的结果标签
- 零样本(zero-shot) · 模型在没有针对该任务进行专门微调的情况下直接执行任务
论文原文摘要(英文)
Scientific peer review datasets have trained AI systems exclusively on Computer Science and Machine Learning venues, producing models that critique ablation studies yet have never seen a biology reviewer demand contamination controls or a chemist question Nuclear Magnetic Resonance (NMR) spectral assignments. We introduce FIRSTPASS, the first large-scale peer review dataset built on complete multi-round editorial dialogues from a multidisciplinary high-impact journal. Curated from Nature Communications mandatory transparent peer review (instituted November 2022), FIRSTPASS comprises 3,668 records spanning five scientific domains (biology, chemistry, neuroscience, physics, and earth science), capturing the full iterative structure of scientific validation: initial referee reports, author point-by-point responses, and updated reviewer assessments. Each record carries an outcome label derived directly from editorial decisions (STANDARD for two-round review; EXTENDED for three or more rounds), providing ground truth absent in all prior corpora. An automated audit confirms 100% content integrity. Expert reviews average 2,155 words, substantially denser than conference venue reviews. All data, parsing pipelines, and evaluation scripts are released to enable reproducible benchmarking of AI scientific judgment across disciplines.
在 arXiv 阅读最新论文
- JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness EvolutionAI智能体的实力不只取决于模型本身,还取决于包裹模型的'执行框架',这项研究训练了一个能为每个新任务即时生成该框架的AI
- The Dialect Tax: Dialectal Biases Persist throughout the Language Modeling PipelineAI语言模型对AAVE等非标准英语方言征收的隐性'方言税',不只出现在分词环节,而是贯穿训练与推理全流程
- Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians一个数学模型证明,哪怕是完全理性的人,也会被一味顺着自己说话的聊天机器人带入妄想
- Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment没有中央指挥,来自不同公司的AI智能体在开放世界环境中自行协作,在五个数学难题上做出了新发现
- Automata from Agent Traces: Failure and Next-Step Prediction把成千上万条LLM智能体的执行记录压缩成一个只有7到43个状态的小型状态机,同时预测下一步动作和最终是否失败
- MARS: Multi-Specialist LLM Relay System for Competitive Programming让不同算法专长的AI依次接力改代码,比单一全能AI更能解出编程竞赛题
- AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace让多个AI编程智能体在同一工作区实时协作,比按顺序执行或无协调地并行执行效果更好
- Recursive Agentic Reasoning多采样几个答案再投票的方法,连AI答不出话来的失败情况也能补救
METAL LAB 最新报道
图片来源: Prabhjot Singh et al., arXiv:2608.26129, CC BY 4.0