Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme
부분점수를 잘못 계산하면 AI 성적이 부풀려진다: 베트남 수능 채점법으로 검증한 벤치마크 THPT-Ladder
베트남 2025년 고교 졸업시험은 4개의 참거짓 문장 중 맞힌 개수에 따라 0, 0.10, 0.25, 0.50, 1.00점을 주는 방식(비례가 아닌 계단식)으로 채점이 바뀌었다. 기존 AI 벤치마크들은 이런 채점 방식을 무시하고 단순 정답률만 매기는데, 이는 실제 정부가 인정하지 않는 실력을 부풀려 보고하는 셈이다. 연구진은 21개 실제 시험 632문항으로 THPT-Ladder를 만들어 8개 모델을 정부 채점 기준 그대로 평가했고, 정답률만으로는 실제 점수를 예측할 수 없음을 보였다.
무엇을 했나
- 2025년 개정된 베트남 수능 2부는 문항당 4개의 참거짓 문장을 판단하게 하고, 맞힌 개수(0~4개)에 따라 0, 0.10, 0.25, 0.50, 1.00점을 주는 비례하지 않는 계단식 채점을 쓴다. 3개를 맞히면 0.75점이 아니라 0.50점만 받는다.
- 이 2부가 전체 10점 만점 중 4점을 차지하는데, 기존 벤치마크처럼 문장 단위 정답률로 점수를 계산하면 정부가 실제로 주는 점수보다 항상 높게 나온다.
- 21개 공식 시험, 11개 과목, 632문항으로 구성된 THPT-Ladder를 만들고 정부 발표 정답지와 채점 규칙을 그대로 적용했으며, 100만 명 넘는 실제 응시생 성적 분포와 비교해 모델 성적을 백분위로 환산했다.
- 8개 모델(오픈웨이트 3개, 폐쇄형 5개)을 평가한 결과, 정부 채점 방식은 비례 채점보다 문항당 0.020~0.159점 적게 줬다. 예컨대 Qwen3.5-27B는 2025년 역사 시험에서 이 차이 때문에 백분위 90위에서 77위로 떨어졌다.
- 정답률이 같아도 오답이 어떻게 분산되는지에 따라 점수가 크게 달라졌다. Claude Sonnet 5와 같은 정답률 수준에서도 문항당 점수는 0.869점에서 0.932점까지 벌어질 수 있었다.
- 무작위로 찍은 고정 응답 패턴(DDSS)조차 정답지의 불균형을 이용해 문제를 읽지 않고도 시험의 11.07%~24.25%를 획득할 수 있었다.
| structure | items | ||||||
|---|---|---|---|---|---|---|---|
| Subject | I | II | III | rnd | 2025 | 2026 | Fig. |
| Biology | 18 | 4 | 6 | 2.350 | 28 | 28 | 28 |
| Chemistry | 18 | 4 | 6 | 2.350 | 28 | 28 | 9 |
| Economics & Law | 24 | 4 | 0 | 2.725 | 28 | 28 | 0 |
| English | 40 | 0 | 0 | 2.500 | 40 | 40 | 0 |
| Geography | 18 | 4 | 6 | 2.350 | 28 | 28 | 8 |
| History | 24 | 4 | 0 | 2.725 | 28 | 28 | 1 |
| Informatics | 24 | 4a | 0 | 2.725 | 30 | 30 | 0 |
| Mathematics | 12 | 4 | 6 | 1.975 | 22 | 22 | 14 |
| Physics | 18 | 4 | 6 | 2.350 | 28 | 28 | 4 |
| Technology (Agri.) | 24 | 4 | 0 | 2.725 | 56 | 28 | 4 |
| Technology (Ind.) | 24 | 4 | 0 | 2.725 | 28 | n.p. | 12 |
| total | 632 items | 80 |
| Model | % avail. | I | II stmt | II pts/q | shf/q | III |
|---|---|---|---|---|---|---|
| Qwen3.5-27B | 93.8 | 0.973 | 0.926 | 0.884 | 0.042 | 0.917 |
| Qwen3.5-9B | 90.7 | 0.965 | 0.896 | 0.830 | 0.066 | 0.850 |
| InternVL3.5-8B | 69.3 | 0.838 | 0.756 | 0.597 | 0.159 | 0.183 |
| Claude Opus 5 | 97.0 | 0.988 | 0.973 | 0.949 | 0.024 | 0.950 |
| GPT-5.5 | 97.0 | 0.988 | 0.967 | 0.948 | 0.020 | 0.950 |
| Claude Sonnet 5 | 93.6 | 0.977 | 0.935 | 0.881 | 0.054 | 0.917 |
| Claude Opus 4.8 | 92.9 | 0.975 | 0.920 | 0.867 | 0.052 | 0.917 |
| Claude Haiku 4.5 | 82.9 | 0.934 | 0.842 | 0.735 | 0.108 | 0.567 |
왜 중요한가
AI 성능 평가에서 채점 방식을 단순화하면 실제로는 통과하지 못했을 시험을 통과한 것처럼 보이게 만들 수 있다. 시험 문제만 재사용하고 그 시험의 진짜 채점 규칙을 버리는 관행이 얼마나 성적을 왜곡하는지 구체적 수치로 보여준다는 점에서, AI 평가 방법론 전반에 시사점을 준다.
이 논문의 용어
- convex marking scheme(비선형/계단식 채점) · 맞힌 개수에 비례하지 않고, 특정 구간에서 점수가 확 뛰거나 낮게 눌리는 채점 방식
- partial-credit gap(부분점수 격차, shortfall) · 비례 채점으로 계산했을 때의 점수와 실제 계단식 채점 점수의 차이
- 백분위(percentile) · 실제 응시생 집단 중 몇 퍼센트보다 높은 점수를 받았는지 나타내는 순위 지표
- 오픈웨이트 모델(open-weight model) · 모델 가중치 파일을 공개해 누구나 내려받아 실행할 수 있는 AI 모델
- Decision 764 · 베트남 교육훈련부가 2025년 발표한, 고교 졸업시험의 새 문제 형식과 채점 규칙을 정한 공식 결정문
논문 원문 초록 (영문)
When evaluating language models on human exams, benchmarks typically score each response as right or wrong and report the overall accuracy. This approach assumes that partial knowledge is worth proportional credit, an assumption that fails when an examination uses a non-additive grading scheme. The 2025 reform of Vietnam's National High School Graduation Examination demonstrates the cost of this substitution. In Part II of the exam, candidates eval
arXiv에서 원문 보기최신 논문
- FM-Bench: A Benchmark for Long-Horizon Management with Competing AgentsAI에게 축구 구단을 20년간 통째로 맡겨보니, 승패는 계산력이 아니라 '경영 감각'에서 갈렸다
- FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI SystemsAI가 '정답'을 맞혀도, 정작 증거는 못 찾는 경우가 대부분이었다 - 재무 이상거래 진단 AI의 숨은 약점
- FACET: Preserving Source Intent and Executable State in Terminal Task SynthesisAI 에이전트에게 '터미널 문제집'을 정합성 있게 만들어주는 파이프라인, FACET
- Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models음성·소리를 알아듣는 AI, 지시문 학습 없이 '연결 다리'만 훈련해도 충분하다
- Adversarial Review: Structured Disagreement for Grounded Agentic Code ReviewAI 코딩 에이전트, 에이전트 늘리기보다 '검토자 vs 비판자' 한 쌍이 더 똑똑하게 일한다
- Looped Language Models Improve Compositional Tool Calling생각을 여러 번 되짚는 AI가 여러 개의 도구를 순서대로 엮어 쓰는 일도 더 잘한다
- Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-Engagement쇼핑몰 검색에서 이탈한 고객을 AI 에이전트가 다시 카톡(왓츠앱)으로 불러온 이야기
- GenEx: A Graph-Based Representational Paradigm for SARS-CoV-2 Variant Detection via Codon Co-occurrence Networks바이러스 유전자 서열을 코돈끼리 서로 옆에 등장하는 관계망(그래프)으로 바꿔 변이를 구분하는 법