컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다
컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다
기존 동료평가(peer review) 데이터셋은 전부 컴퓨터공학·기계학습 학회에서만 나와서, AI가 오염 대조군을 요구하는 생물학 심사자나 NMR 스펙트럼을 따지는 화학 심사자를 본 적이 없었다. FIRSTPASS는 Nature Communications의 투명 동료평가 제도를 활용해 생물학, 화학, 신경과학, 물리학, 지구과학 5개 분야에 걸친 3,668건의 다회차 심사 기록을 모았다. 각 기록에는 실제 편집 결정에서 나온 결과 라벨(2라운드면 STANDARD, 3라운드 이상이면 EXTENDED)이 붙어 있어, 텍스트가 심사문처럼 보이는지가 아니라 실제 편집 결과와 맞는지를 평가할 수 있게 했다.
METAL LAB 해설 도표
무엇을 했나
- 기존 PeerRead, ReviewMT, MARG 같은 데이터셋은 모두 ACL, NIPS, ICLR 같은 컴퓨터공학·기계학습 학회 심사문에만 의존해, 다른 학문 분야의 심사 관행을 전혀 반영하지 못했다.
- 2022년 11월부터 의무적 투명 동료평가를 시행한 Nature Communications를 대상으로 2023년 1월부터 2025년 12월까지 발표된 논문을 Springer Nature OpenAccess API로 수집하고, Gemini-3.1-flash-lite-preview로 PDF를 파싱해 초록·서론·방법·결과 4개 섹션이 각 20단어 이상이고 심사 2라운드 이상이 완전히 남아있는 기록만 남겼다.
- 라운드 수를 기준으로 2라운드면 STANDARD, 3라운드 이상이면 EXTENDED 라벨을 부여했으며, 이 라벨은 5개 분야 모두에서 62.8%에서 71.2% 사이로 STANDARD 비율이 일관되게 나타나 특정 분야의 절차적 관행이 아니라 심사자-저자 간 긴장의 구조적 패턴을 반영함을 확인했다.
- 전체 3,668건에 대한 자동 감사에서 빈 파일 없이 100% 내용 무결성이 확인됐고, 심사평 평균 길이는 2,155단어로 ICLR 심사평(약 400단어)보다 5배 이상 길었다.
- 각 논문마다 리뷰 생성, 심사평 업데이트, 결과 예측이라는 세 가지 학습 과제를 만들었고, Qwen2.5-7B-Instruct를 미세조정해 결과 예측 과제에서 정확도 80.5%, F1-macro 78.2%를 기록해 같은 과제를 제로샷으로 수행한 Gemini-3.1-flash-lite-preview보다 10.4퍼센트포인트 높은 성능을 보였다.

| Domain | Total | Train | Val | Test | STD (%) | EXT (%) |
|---|---|---|---|---|---|---|
| Biology | 741 | 593 | 74 | 74 | 63.2 | 36.8 |
| Chemistry | 744 | 595 | 75 | 74 | 62.8 | 37.2 |
| Neuroscience | 739 | 591 | 74 | 74 | 64.6 | 35.4 |
| Physics | 727 | 582 | 73 | 72 | 66.7 | 33.3 |
| Earth Sci. | 717 | 573 | 72 | 72 | 71.2 | 28.8 |
| Total | 3,668 | 2,934 | 368 | 366 | 65.4 | 34.6 |
실제로 확인된 결과
- Nature Communications 논문 3,668건을 수집해 자동 감사한 결과 빈 파일 없이 100% 내용 무결성이 확인됐다.
- 5개 분야 모두에서 STANDARD 라벨 비율이 62.8%에서 71.2% 사이로 일관되게 나타났다.
- 전문 심사평 평균 길이가 2,155단어로 ICLR 심사평(약 400단어)보다 5배 이상 길었다.
- Qwen2.5-7B-Instruct를 미세조정해 결과 예측 과제에서 정확도 80.5%, F1-macro 78.2%를 달성했고, 이는 같은 과제를 제로샷으로 수행한 Gemini-3.1-flash-lite-preview보다 10.4퍼센트포인트 높은 수치다.
어디에 쓸 수 있나
- 다학문 분야 논문의 자동 심사 보조 도구를 만들 때 학습 데이터로 활용
- AI 심사 결과 예측 모델의 편집 결정 일치도를 벤치마킹하는 평가 세트로 활용
- 임상 분류, 연구비 심사, 규제 검토처럼 실제 전문가 결정과 대조해야 하는 다른 판단 시스템 설계에 방법론적 참고 자료로 활용
한계와 남은 검증
- 데이터가 Nature Communications라는 단일 학술지 출처에만 의존하므로 해당 저널의 편집 관행이나 편향이 그대로 반영될 수 있다.
- 공개된 데이터는 게재가 확정된(accepted) 논문만 포함하고 있어 게재 거부된 논문의 심사 과정은 다루지 않는다.
- 합성 심사평 생성에 악용될 위험이 있어, 연구진은 알려진 한계와 권장 완화책을 담은 데이터시트를 별도로 공개했다.
- 라벨링은 라운드 수에만 의존하며 결정문 텍스트는 97.7% 기록에서 활용하지 못했다는 점에서 라벨의 세밀함에 한계가 있다.
왜 중요한가
AI 심사 지원 도구나 자동 논문 평가 시스템이 컴퓨터공학 스타일에만 익숙해 다른 학문 분야에서는 엉뚱한 기준을 들이댈 위험이 있는데, FIRSTPASS는 실제 편집 결과를 정답으로 삼아 이런 편향을 검증하고 개선할 수 있는 기반을 제공한다. 데이터, 파싱 코드, 평가 스크립트, 모델 가중치까지 공개해 다른 연구자가 그대로 재현하고 확장할 수 있게 했다는 점도 중요하다.
이 논문의 용어
- 동료평가(peer review) · 학술지에 투고된 논문을 같은 분야 전문가가 심사하고 게재 여부를 판단하는 과정
- F1-macro · 여러 범주에 대해 각각 F1 점수를 구한 뒤 단순 평균한 지표로, 범주별 성능을 균등하게 반영한다
- STANDARD / EXTENDED · 심사 라운드가 2회면 STANDARD, 3회 이상이면 EXTENDED로 분류한 결과 라벨
- 제로샷(zero-shot) · 별도의 추가 학습 없이 모델이 곧바로 과제를 수행하는 방식
최신 논문
- AI 에이전트의 '실력'은 모델이 아니라 감싸는 틀(하네스)에서 나온다는 발견을 바탕으로, 그 틀을 작업마다 즉석에서 만들어주는 AI를 만들었다AI 에이전트의 '실력'은 모델이 아니라 감싸는 틀(하네스)에서 나온다는 발견을 바탕으로, 그 틀을 작업마다 즉석에서 만들어주는 AI를 만들었다
- AI 언어모델이 AAVE 같은 비표준 영어 방언에 매기는 '방언세'는 토큰화뿐 아니라 학습과 추론 전 단계에 걸쳐 남아 있다AI 언어모델이 AAVE 같은 비표준 영어 방언에 매기는 '방언세'는 토큰화뿐 아니라 학습과 추론 전 단계에 걸쳐 남아 있다
- 챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구
- 중앙 지휘자 없이 AI 에이전트들이 자기들끼리 협업해서 수학 난제 5개에서 새로운 결과를 냈다중앙 지휘자 없이 AI 에이전트들이 자기들끼리 협업해서 수학 난제 5개에서 새로운 결과를 냈다
- LLM 에이전트의 실행 기록 수천 개를 상태 7~43개짜리 작은 오토마톤 하나로 압축해, 다음 행동 예측과 실패 예측을 동시에 해내는 방법LLM 에이전트의 실행 기록 수천 개를 상태 7~43개짜리 작은 오토마톤 하나로 압축해, 다음 행동 예측과 실패 예측을 동시에 해내는 방법
- 경쟁 프로그래밍 AI에 '전문가 릴레이'를 붙이니 정답률이 확 올랐다경쟁 프로그래밍 AI에 '전문가 릴레이'를 붙이니 정답률이 확 올랐다
- 코딩 에이전트 여러 개를 한 작업공간에서 동시에 협업시키면, 순서대로 시키거나 그냥 병렬로 굴리는 것보다 낫다코딩 에이전트 여러 개를 한 작업공간에서 동시에 협업시키면, 순서대로 시키거나 그냥 병렬로 굴리는 것보다 낫다
- 여러 개 답을 뽑아 투표하는 방식이, AI가 추론 도중 답을 아예 못 내는 문제까지 해결해준다여러 개 답을 뽑아 투표하는 방식이, AI가 추론 도중 답을 아예 못 내는 문제까지 해결해준다
METAL LAB 최신 기사
그림 출처: Prabhjot Singh et al., arXiv:2608.26129, CC BY 4.0