METAL LAB

컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다

arXiv:2608.261292026-08-28

FIRSTPASS: A Multi-Domain, Multi-Round Peer Review Dataset Grounded in Real Editorial Outcomes

컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다

기존 동료평가(peer review) 데이터셋은 전부 컴퓨터공학·기계학습 학회에서만 나와서, AI가 오염 대조군을 요구하는 생물학 심사자나 NMR 스펙트럼을 따지는 화학 심사자를 본 적이 없었다. FIRSTPASS는 Nature Communications의 투명 동료평가 제도를 활용해 생물학, 화학, 신경과학, 물리학, 지구과학 5개 분야에 걸친 3,668건의 다회차 심사 기록을 모았다. 각 기록에는 실제 편집 결정에서 나온 결과 라벨(2라운드면 STANDARD, 3라운드 이상이면 EXTENDED)이 붙어 있어, 텍스트가 심사문처럼 보이는지가 아니라 실제 편집 결과와 맞는지를 평가할 수 있게 했다.

METAL LAB 해설 도표

왼쪽에는 컴퓨터공학 분야만 채워진 작은 점 하나가 있어 기존 심사 데이터셋의 좁은 편향을 나타낸다. 점선 화살표로 확장되어 생물학·화학·물리학 등 5개 분야의 심사 기록이 축적된 모습으로 이어진다. 그 기록에서 서로 마주보며 도는 두 점, 즉 심사자와 저자의 긴장을 뜻하는 라운드 라벨이 실선으로 이어지고, 다시 실선으로 마름모 모양의 예측 모델로 학습되어 들어간다.
METAL LAB이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 기존 PeerRead, ReviewMT, MARG 같은 데이터셋은 모두 ACL, NIPS, ICLR 같은 컴퓨터공학·기계학습 학회 심사문에만 의존해, 다른 학문 분야의 심사 관행을 전혀 반영하지 못했다.
  2. 2022년 11월부터 의무적 투명 동료평가를 시행한 Nature Communications를 대상으로 2023년 1월부터 2025년 12월까지 발표된 논문을 Springer Nature OpenAccess API로 수집하고, Gemini-3.1-flash-lite-preview로 PDF를 파싱해 초록·서론·방법·결과 4개 섹션이 각 20단어 이상이고 심사 2라운드 이상이 완전히 남아있는 기록만 남겼다.
  3. 라운드 수를 기준으로 2라운드면 STANDARD, 3라운드 이상이면 EXTENDED 라벨을 부여했으며, 이 라벨은 5개 분야 모두에서 62.8%에서 71.2% 사이로 STANDARD 비율이 일관되게 나타나 특정 분야의 절차적 관행이 아니라 심사자-저자 간 긴장의 구조적 패턴을 반영함을 확인했다.
  4. 전체 3,668건에 대한 자동 감사에서 빈 파일 없이 100% 내용 무결성이 확인됐고, 심사평 평균 길이는 2,155단어로 ICLR 심사평(약 400단어)보다 5배 이상 길었다.
  5. 각 논문마다 리뷰 생성, 심사평 업데이트, 결과 예측이라는 세 가지 학습 과제를 만들었고, Qwen2.5-7B-Instruct를 미세조정해 결과 예측 과제에서 정확도 80.5%, F1-macro 78.2%를 기록해 같은 과제를 제로샷으로 수행한 Gemini-3.1-flash-lite-preview보다 10.4퍼센트포인트 높은 성능을 보였다.
Figure 1: The FirstPass three-task training curriculum.
Figure 1: The FirstPass three-task training curriculum.
Table 1: FIRSTPASS dataset statistics by domain. STD = STANDARD (2 rounds), EXT = EXTENDED (3+ rounds).
DomainTotalTrainValTestSTD (%)EXT (%)
Biology741593747463.236.8
Chemistry744595757462.837.2
Neuroscience739591747464.635.4
Physics727582737266.733.3
Earth Sci.717573727271.228.8
Total3,6682,93436836665.434.6

실제로 확인된 결과

  • Nature Communications 논문 3,668건을 수집해 자동 감사한 결과 빈 파일 없이 100% 내용 무결성이 확인됐다.
  • 5개 분야 모두에서 STANDARD 라벨 비율이 62.8%에서 71.2% 사이로 일관되게 나타났다.
  • 전문 심사평 평균 길이가 2,155단어로 ICLR 심사평(약 400단어)보다 5배 이상 길었다.
  • Qwen2.5-7B-Instruct를 미세조정해 결과 예측 과제에서 정확도 80.5%, F1-macro 78.2%를 달성했고, 이는 같은 과제를 제로샷으로 수행한 Gemini-3.1-flash-lite-preview보다 10.4퍼센트포인트 높은 수치다.

어디에 쓸 수 있나

  • 다학문 분야 논문의 자동 심사 보조 도구를 만들 때 학습 데이터로 활용
  • AI 심사 결과 예측 모델의 편집 결정 일치도를 벤치마킹하는 평가 세트로 활용
  • 임상 분류, 연구비 심사, 규제 검토처럼 실제 전문가 결정과 대조해야 하는 다른 판단 시스템 설계에 방법론적 참고 자료로 활용

한계와 남은 검증

  • 데이터가 Nature Communications라는 단일 학술지 출처에만 의존하므로 해당 저널의 편집 관행이나 편향이 그대로 반영될 수 있다.
  • 공개된 데이터는 게재가 확정된(accepted) 논문만 포함하고 있어 게재 거부된 논문의 심사 과정은 다루지 않는다.
  • 합성 심사평 생성에 악용될 위험이 있어, 연구진은 알려진 한계와 권장 완화책을 담은 데이터시트를 별도로 공개했다.
  • 라벨링은 라운드 수에만 의존하며 결정문 텍스트는 97.7% 기록에서 활용하지 못했다는 점에서 라벨의 세밀함에 한계가 있다.

왜 중요한가

AI 심사 지원 도구나 자동 논문 평가 시스템이 컴퓨터공학 스타일에만 익숙해 다른 학문 분야에서는 엉뚱한 기준을 들이댈 위험이 있는데, FIRSTPASS는 실제 편집 결과를 정답으로 삼아 이런 편향을 검증하고 개선할 수 있는 기반을 제공한다. 데이터, 파싱 코드, 평가 스크립트, 모델 가중치까지 공개해 다른 연구자가 그대로 재현하고 확장할 수 있게 했다는 점도 중요하다.

이 논문의 용어

  • 동료평가(peer review) · 학술지에 투고된 논문을 같은 분야 전문가가 심사하고 게재 여부를 판단하는 과정
  • F1-macro · 여러 범주에 대해 각각 F1 점수를 구한 뒤 단순 평균한 지표로, 범주별 성능을 균등하게 반영한다
  • STANDARD / EXTENDED · 심사 라운드가 2회면 STANDARD, 3회 이상이면 EXTENDED로 분류한 결과 라벨
  • 제로샷(zero-shot) · 별도의 추가 학습 없이 모델이 곧바로 과제를 수행하는 방식

저자 · Prabhjot Singh, Somnath Luitel, Manmeet Singh, Josh Durkee

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL LAB 최신 기사

그림 출처: Prabhjot Singh et al., arXiv:2608.26129, CC BY 4.0