Mathematics in the age of AI
AI가 수학 증명을 대신 풀어줄 수 있게 되면, 수학자 공동체는 무엇을 지켜야 하는가
이 글은 2026년 국제수학자대회 강연을 바탕으로 한 에세이로, AI가 실제로 연구 수준의 수학 문제를 풀 수 있는지 논쟁하는 대신 그런 능력이 언젠가 생긴다고 가정하고 시작한다. 그 대신 수학 공동체가 암묵적으로 추구해온 목표와 가치가 무엇인지 되짚어보는 데 초점을 맞춘다. 사례로 문제 풀이 과정을 단계별로 뜯어보면서, 정답을 맞히는 것만으로는 충분하지 않다는 점을 보여준다.
무엇을 했나
- 저자는 'AI가 수학을 얼마나 잘하는가'라는 논쟁을 잠시 접어두고, 그런 능력이 도래한다는 가정(작업가설) 아래에서 수학 공동체의 진짜 목표가 무엇인지를 따져본다.
- 문제 풀이라는 활동을 예로 들어, 목표를 '많은 문제를 푼다'에서 시작해 '정확성 검증', '이해 가능한 서술', '공동체의 소화와 수용', '정전(canonical) 이론으로의 흡수'까지 다섯 단계로 점점 정교하게 다듬어간다.
- AI가 만든 증명은 형식적으로 검증되어도 아무도 이해하지 못하거나, 지나치게 매끄럽게 다듬어져 정작 어디가 어려운 부분인지 알 수 없게 만들 위험이 있다고 지적한다.
- 실제 사례로 First Proof 프로젝트의 두 번째 평가에서, 온라인에 공개된 적 없는 신규 연구 수준 문제 10개 중 7개가 AI 시스템으로부터 최소 한 번 이상 합격점(전문가 검토 기준)을 받았고, 비용은 문제당 수십~수백 달러 수준이었다고 밝힌다.
- 2026년 6월 발표된 '라이덴 선언(Leiden Declaration on Artificial Intelligence and Mathematics)'의 권고사항 일부를 인용하며, AI 도구 사용 공개, 검증을 돕는 서술, 인간 저자성의 확인, 출처 표시 노력 등을 제안한다.
![Figure 3. A page from a 1991 paper of Bourgain [3], annotated by my much younger (and very frustrated) self. But by fighting my way through these texts, I came to understand Bourgain’s way of thinking, and in time I actively sought out his papers to read. See also [19], [17].](https://media.metallab.ai/papers/2608.16753/f0.jpg)
왜 중요한가
AI가 증명을 빠르게 쏟아내기 시작하면 검증, 서술, 심사, 교과서화라는 기존 수학 생태계의 병목이 한꺼번에 터질 수 있다는 경고다. 연구자와 학계뿐 아니라 지식이 어떻게 만들어지고 신뢰받는지에 관심 있는 모든 독자에게, '빠른 답'과 '이해된 지식'은 다르다는 점을 다시 생각하게 한다.
이 논문의 용어
- 구드하트의 법칙(Goodhart's law) · 어떤 지표가 목표가 되는 순간 그 지표는 더 이상 좋은 척도가 아니게 된다는 원칙
- 자동형식화(autoformalization) · 사람이 쓴 수학 증명을 Lean 같은 컴퓨터 검증 언어로 자동 변환하는 것
- 정전화(canonicalization) · 증명된 결과를 가장 자연스러운 형태로 다듬어 교과서와 표준 지식체계에 편입시키는 과정
- First Proof 프로젝트 · 온라인에 공개된 적 없는 신규 연구 문제로 AI 모델의 실제 수학 능력을 검증하는 독립 평가 프로젝트
- 라이덴 선언(Leiden Declaration) · 2026년 국제수학연맹이 지지한, AI와 수학 연구 윤리에 관한 23개 권고안
논문 원문 초록 (영문)
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs.
arXiv에서 원문 보기최신 논문
- Improving Natural-Language Combinatorial-Optimization Accuracy in Resource-Constrained Language Models via Formal Abstractions작은 AI 모델도 전용 미니 언어를 쓰면 말로 된 스케줄링 문제를 제대로 풀 수 있다
- SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured DecompositionAI가 두 답변 중 뭐가 나은지 고를 때, 왜 그렇게 골랐는지 항목별로 보여주는 방법
- Position: AI Leaderboards Are Underserving the Global South: A Case Study from India인도 등 글로벌 사우스 언어를 평가할 벤치마크는 이미 있는데, 그 결과를 믿고 정리해줄 '심판'이 없다
- Temporal Multi-Signal Fusion for Token-Level Hallucination DetectionAI가 지어낸 문장을 한 단어씩 보지 말고 흐름으로 봐야 더 잘 잡힌다
- Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application공공기관 고위험 서류처리에 오픈소스 AI를 그냥 쓰면 4건 중 3건이 낙제점
- When Clean Signals Are Not Enough: Detecting Structural Ambiguity for Safe Wearable Stress Classification평균 정확도 93%인 스트레스 감지 AI가 특정 한 사람은 완전히 놓친 이유를 찾아, 위험한 판단을 미리 걸러내는 감시 장치를 만들었다
- Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-Engagement쇼핑몰 검색에서 이탈한 고객을 AI 에이전트가 다시 카톡(왓츠앱)으로 불러온 이야기
- Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson추천 이유 문장, 매번 AI가 새로 안 써도 된다: 미리 만들어두고 고르기만 해도 더 좋다
METAL LAB 최신 기사
그림 출처: jonbaer et al., arXiv:2608.16753, arxiv-nonexclusive