매일 아침, 어제의 AI를 한 통으로 정리해 보내드립니다메일로 받아보기

METAL LAB

Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme

arXiv:2608.183362026-08-20

부분점수를 잘못 계산하면 AI 성적이 부풀려진다: 베트남 수능 채점법으로 검증한 벤치마크 THPT-Ladder

베트남 2025년 고교 졸업시험은 4개의 참거짓 문장 중 맞힌 개수에 따라 0, 0.10, 0.25, 0.50, 1.00점을 주는 방식(비례가 아닌 계단식)으로 채점이 바뀌었다. 기존 AI 벤치마크들은 이런 채점 방식을 무시하고 단순 정답률만 매기는데, 이는 실제 정부가 인정하지 않는 실력을 부풀려 보고하는 셈이다. 연구진은 21개 실제 시험 632문항으로 THPT-Ladder를 만들어 8개 모델을 정부 채점 기준 그대로 평가했고, 정답률만으로는 실제 점수를 예측할 수 없음을 보였다.

무엇을 했나

  1. 2025년 개정된 베트남 수능 2부는 문항당 4개의 참거짓 문장을 판단하게 하고, 맞힌 개수(0~4개)에 따라 0, 0.10, 0.25, 0.50, 1.00점을 주는 비례하지 않는 계단식 채점을 쓴다. 3개를 맞히면 0.75점이 아니라 0.50점만 받는다.
  2. 이 2부가 전체 10점 만점 중 4점을 차지하는데, 기존 벤치마크처럼 문장 단위 정답률로 점수를 계산하면 정부가 실제로 주는 점수보다 항상 높게 나온다.
  3. 21개 공식 시험, 11개 과목, 632문항으로 구성된 THPT-Ladder를 만들고 정부 발표 정답지와 채점 규칙을 그대로 적용했으며, 100만 명 넘는 실제 응시생 성적 분포와 비교해 모델 성적을 백분위로 환산했다.
  4. 8개 모델(오픈웨이트 3개, 폐쇄형 5개)을 평가한 결과, 정부 채점 방식은 비례 채점보다 문항당 0.020~0.159점 적게 줬다. 예컨대 Qwen3.5-27B는 2025년 역사 시험에서 이 차이 때문에 백분위 90위에서 77위로 떨어졌다.
  5. 정답률이 같아도 오답이 어떻게 분산되는지에 따라 점수가 크게 달라졌다. Claude Sonnet 5와 같은 정답률 수준에서도 문항당 점수는 0.869점에서 0.932점까지 벌어질 수 있었다.
  6. 무작위로 찍은 고정 응답 패턴(DDSS)조차 정답지의 불균형을 이용해 문제를 읽지 않고도 시험의 11.07%~24.25%를 획득할 수 있었다.
Table 1: Official structure (Decision 764) and corpus coverage.
structureitems
SubjectIIIIIIrnd20252026Fig.
Biology18462.350282828
Chemistry18462.35028289
Economics & Law24402.72528280
English40002.50040400
Geography18462.35028288
History24402.72528281
Informatics244a02.72530300
Mathematics12461.975222214
Physics18462.35028284
Technology (Agri.)24402.72556284
Technology (Ind.)24402.72528n.p.12
total632 items80
Table 2: Eight models on the 632 scored items: three open-weight, then five closed.
Model% avail.III stmtII pts/qshf/qIII
Qwen3.5-27B93.80.9730.9260.8840.0420.917
Qwen3.5-9B90.70.9650.8960.8300.0660.850
InternVL3.5-8B69.30.8380.7560.5970.1590.183
Claude Opus 597.00.9880.9730.9490.0240.950
GPT-5.597.00.9880.9670.9480.0200.950
Claude Sonnet 593.60.9770.9350.8810.0540.917
Claude Opus 4.892.90.9750.9200.8670.0520.917
Claude Haiku 4.582.90.9340.8420.7350.1080.567

왜 중요한가

AI 성능 평가에서 채점 방식을 단순화하면 실제로는 통과하지 못했을 시험을 통과한 것처럼 보이게 만들 수 있다. 시험 문제만 재사용하고 그 시험의 진짜 채점 규칙을 버리는 관행이 얼마나 성적을 왜곡하는지 구체적 수치로 보여준다는 점에서, AI 평가 방법론 전반에 시사점을 준다.

이 논문의 용어

  • convex marking scheme(비선형/계단식 채점) · 맞힌 개수에 비례하지 않고, 특정 구간에서 점수가 확 뛰거나 낮게 눌리는 채점 방식
  • partial-credit gap(부분점수 격차, shortfall) · 비례 채점으로 계산했을 때의 점수와 실제 계단식 채점 점수의 차이
  • 백분위(percentile) · 실제 응시생 집단 중 몇 퍼센트보다 높은 점수를 받았는지 나타내는 순위 지표
  • 오픈웨이트 모델(open-weight model) · 모델 가중치 파일을 공개해 누구나 내려받아 실행할 수 있는 AI 모델
  • Decision 764 · 베트남 교육훈련부가 2025년 발표한, 고교 졸업시험의 새 문제 형식과 채점 규칙을 정한 공식 결정문

논문 원문 초록 (영문)

When evaluating language models on human exams, benchmarks typically score each response as right or wrong and report the overall accuracy. This approach assumes that partial knowledge is worth proportional credit, an assumption that fails when an examination uses a non-additive grading scheme. The 2025 reform of Vietnam's National High School Graduation Examination demonstrates the cost of this substitution. In Part II of the exam, candidates eval

저자 · Nguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL LAB 최신 기사