중앙 지휘자 없이 AI 에이전트들이 자기들끼리 협업해서 수학 난제 5개에서 새로운 결과를 냈다
중앙 지휘자 없이 AI 에이전트들이 자기들끼리 협업해서 수학 난제 5개에서 새로운 결과를 냈다
Station이라는 오픈월드 다중 에이전트 환경에서 GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro 등 서로 다른 모델 계열의 AI 에이전트들이 중앙 조정자 없이 스스로 연구 주제를 정하고 논문을 쓰며 협업했다. AlphaEvolve가 다뤘던 12개 구성 문제와 별도의 사례연구 2개를 시험한 결과, 유한체 카키야 집합의 새 무한 계열, 11차원 604점 키싱 배치, 이산 카키야 니들과 부호 불확도 문제의 새 기록, 에르되시 최소중첩 문제의 대폭 개선된 하한 등 5개 문제에서 기존 문헌 대비 새로운 결과를 얻었다. 에이전트들은 숫자 답만이 아니라 그 구성이 왜 성립하는지 설명하는 정리와 분석까지 만들어 결과를 이해하고 활용하기 쉽게 만들었다.
METAL LAB 해설 도표
무엇을 했나
- 연구자들은 Station이라는 개방형 다중 에이전트 환경을 만들어, 서로 다른 회사의 AI 모델(GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro)이 중앙 지휘 없이 각자 연구 방향을 정하고 실험하며 논문을 써서 지식을 축적하도록 했다.
- AlphaEvolve 연구가 다뤘던 12개 수학 구성 문제와 별도의 사례연구 2개(북 램지 수, 야코비안 추측)에 이 환경을 적용했으며, 각 문제는 독립된 Station 인스턴스에 배정되어 약 1000~2000틱(실시간 1~2주 상당) 동안 실행됐다.
- 12개 문제 중 5개에서 기존 문헌 대비 새로운 결과가 나왔다: p≡3(mod4)인 소수에 대한 유한체 카키야 집합의 새 무한 계열, 11차원에서 정확히 604점인 키싱 배치 3종, 이산 카키야 니들 문제의 새 상계(CT(128)≤0.107067), 부호 불확도 문제의 개선된 상계(0.3089), 에르되시 최소중첩 상수의 하한을 0.37912에서 0.380552 이상으로 끌어올려 이전에 열려 있던 구간의 약 82%를 좁힘.
- 나머지 7개 문제 중에서는 3개에서 AlphaEvolve를 능가, 2개에서 동률, 2개에서 미달했다. 또한 별도 사례연구로 북 램지 수 추측에서 새로운 무한 계열 2개(외부 전문가 도움으로 3개째까지)를 발견해 200 이하 43개 값에서 추측을 증명했고, 이 중 28개는 이전까지 미해결이었다. 야코비안 추측 반례는 웹 접근 없이 하루 만에 독립적으로 재구성했다.
- 에이전트의 절반 이상이 협업으로 이룬 결과였으며, 서로 다른 모델 계열이 상호보완적 아이디어를 내고, 초기 에이전트가 쓴 논문이 훨씬 나중의 발견에 토대가 되는 경우가 많았다는 점을 분석으로 확인했다.
| Room | Function |
|---|---|
| Research | |
| Research Center | Read the assigned task, develop and run code, and submit solutions for evaluation. |
| Reflection Chamber | Respond to self-designed prompts to encourage extended reflection. |
| Communication | |
| Mail Room | Communicate directly and privately with other agents. |
| Public Memory Room | Participate in persistent public discussions, similar to an online forum. |
| Common Room | Participate in non-persistent public discussions, similar to a group chat. |
| Knowledge | |
| Private Memory Room | Store private documents, such as plans, notes, and paper drafts. |
| Archive Room | Read scientific papers and publish papers that pass automated review. |
| Question Room | Ask questions and vote on answers, similar to Stack Exchange. |
| External Counter | Access reports based on external literature via the web; disabled by default. |

| Problem | Source | Finding |
|---|---|---|
| Novel Results Relative to Prior Literature | ||
| Finite-field Kakeya (Section 4.1) | AlphaEvolve Problem 6.1 | For every prime p≡3(mod4), the Station constructed a Kakeya set in 𝔽p3 of size (2p3+7p2+3)/8, saving (p−3)/4 points over AlphaEvolve’s infinite family. It also found a 53-point set in 𝔽35, improving AlphaEvolve and the previous literature bound of 63; both appear novel relative to the literature. |
| Erdős minimum overlap (Section 4.2) | AlphaEvolve Problem 6.5 | AlphaEvolve lowered the upper bound only slightly, from 0.380927 to 0.380924, whereas the Station raised the lower bound from 0.37912 to 0.380552. Relative to the published lower bound 0.37912, this closes approximately 82% of the corresponding published gap. |
| Kissing number in d=11 (Section 4.3) | AlphaEvolve Problem 6.8 | AlphaEvolve raised the lower bound from 592 to 593, while the Station constructed three exact 604-point configurations. One was an independent rediscovery of the EinsteinArena construction, while the other two appear to represent novel isometry classes. |
| Discretized Kakeya needle (Section 4.4) | AlphaEvolve Problem 6.9 | At n=128, the Station obtained union area 0.107067, improving AlphaEvolve’s 0.114810 by 6.74% and HorizonMath’s 0.109148 by 1.91%. This establishes a new literature upper bound. |
| Sign uncertainty principle (Section 4.5) | AlphaEvolve Problem 6.11 | The Station lowered the upper bound to 0.3089, improving AlphaEvolve’s 0.321591 and the previously announced human value 0.3102. This is a new literature record. |
| Better than AlphaEvolve | ||
| Hardy–Littlewood maximal inequality (Section 4.6) | AlphaEvolve Problem 6.18 | The Station reached 1.557069, versus AlphaEvolve’s 1.5080 unguided and approximately 1.533 with hints, but the centered problem was already solved. Its proof that the non-tangential constant equals 2 for 1/3≤α<1 appears novel relative to the literature. |
| Ovals problem (Section 4.7) | AlphaEvolve Problem 6.19 | AlphaEvolve recovered only the circle, while the Station recovered the full family of noncircular equality ovals. This family was already known in the literature, so the result is novel only relative to AlphaEvolve. |
| Prime number theorem (Section 4.8) | AlphaEvolve Problem 6.27 | The Station certified 0.980681 for all x, improving AlphaEvolve’s sampled score of 0.938. This is new for the finite-weight benchmark; unrestricted, the prime number theorem already gives the exact limit 1. |
| Ties with AlphaEvolve | ||
| Difference bases (Section 4.9) | AlphaEvolve Problem 6.7 | The Station independently recovered AlphaEvolve’s 360-element construction but did not improve upon it. |
| Sidorenko’s conjecture (Section 4.10) | AlphaEvolve Problem 6.26 | Neither AlphaEvolve nor the Station found a counterexample. No substantive result was obtained. |
| Worse than AlphaEvolve | ||
| Peak autoconvolution (Section 4.11) | AlphaEvolve Problem 6.2 | The Station obtained C6.2≤1.504473, weaker than AlphaEvolve’s C6.2≤1.5032. No substantive result was obtained. |
| Flat autoconvolution (Section 4.12) | AlphaEvolve Problem 6.3 | The Station obtained C6.3>0.953189, weaker than AlphaEvolve’s C6.3≥0.961021, but proved that the unrestricted supremum can be approached using binary step functions on increasingly fine grids. |
| Additional Case Studies | ||
| Book Ramsey numbers (Section 4.13) | Epoch AI | The Station independently discovered and proved two novel infinite families. Its finite constructions and an earlier identity also enabled an external expert to derive a third. Together, the three families prove the conjecture at 43 values of n≤200, resolving 28 previously open cases. |
| Jacobian Conjecture (Section 4.14) | Public | From a formula-free binary task, the Station independently reconstructed the recently announced degree-seven counterexample and derived a geometric explanation of its constant Jacobian and three-sheeted fibers. |

| (d,p) | Initial Evaluation | Pre-AlphaEvolve Literature | AlphaEvolve | Station |
|---|---|---|---|---|
| (3,3) | 13 | 13 | 15 | 13 |
| (3,5) | 53 | 53 | 53 | 53 |
| (3,7) | 129 | 129 | 128 | 128 |
| (3,11) | 440 | 440 | 438 | 437 |
| (3,13) | 699 | 698 | 697 | 697 |
| (3,19) | 2,034 | 2,034 | 2,031 | 2,030 |
| (3,23) | 3,509 | 3,509 | 3,505 | 3,504 |
| (3,29) | 6,837 | 6,837 | 6,833 | 6,833 |
| (3,31) | 8,295 | 8,295 | 8,290 | 8,288 |
| (3,37) | 13,867 | 13,866 | 13,861 | 13,861 |
| (3,41) | 18,709 | 18,708 | 18,701 | 18,701 |
| (3,43) | 21,504 | 21,504 | 21,495 | 21,495 |
| (3,47) | 27,899 | 27,899 | 27,892 | 27,889 |
| (3,53) | 39,687 | 39,686 | 39,677 | 39,677 |
| (4,3) | 27 | 27 | 31 | 27 |
| (4,5) | 164 | 163 | 162 | 161 |
| (4,7) | 529 | 528 | 527 | 527 |
| (4,11) | 2,689 | 2,689 | 2,687 | 2,684 |
| (4,13) | 4,973 | 4,972 | 4,966 | 4,962 |
| (4,17) | 13,524 | 13,521 | 13,514 | 13,509 |
| (4,19) | 20,593 | 20,586 | 20,583 | 20,579 |
| (5,3) | 63 | 63 | 63 | 53 |
| (5,5) | 503 | 497 | 510 | 490 |
| (5,7) | 2,145 | 2,142 | 2,187 | 2,135 |
| (5,11) | 16,348 | 16,307 | 16,427 | 16,288 |
실제로 확인된 결과
- 12개 AlphaEvolve 구성 문제 중 5개에서 기존 문헌 대비 새로운 결과를 냈다: 카키야 무한 계열, 604점 키싱 배치 3종, 이산 카키야 니들 상계 개선, 부호 불확도 상계 0.3089, 에르되시 최소중첩 하한 0.380552 초과(기존 0.37912 대비 개방 구간 약 82% 축소).
- 나머지 7개 문제 중 3개는 AlphaEvolve를 능가, 2개는 동률, 2개는 미달했다.
- 북 램지 수 사례연구에서 새로운 무한 계열 2개(외부 전문가 협력으로 1개 추가)를 발견해 200 이하 43개 값에서 추측을 증명, 이 중 28개는 이전에 미해결이었다.
- 야코비안 추측에 대해서는 웹 접근 없이 하루 만에 기존에 발표된 7차 반례를 독립적으로 재구성하고 그 구조에 대한 기하학적 설명을 도출했다.
- 전체 스포트라이트 결과의 절반 이상이 여러 에이전트 간 협업으로 만들어졌으며, 서로 다른 모델 계열 간 협업이 다수 관찰됐다.
어디에 쓸 수 있나
- 기존에 사람 연구자가 파이프라인을 짜고 개입해야 했던 수학적 구성 탐색 문제에서, 목표만 제시하고 AI 에이전트 집단이 자율적으로 방향을 잡아 탐색하게 하는 연구 보조 도구로 활용할 수 있다.
- 숫자 답만 내는 최적화 도구 대신, 구성이 성립하는 이유를 설명하는 정리와 증명까지 함께 얻고 싶은 조합론·기하학·해석학 분야의 열린 문제 탐색에 적용해 볼 수 있다.
- 공개된 에이전트 대화록, 증명, 검증 코드를 활용해 AI가 실제로 어떤 경로로 발견에 이르는지 연구하는 메타연구(AI 사이언스 과정 분석)에 활용할 수 있다.
한계와 남은 검증
- 평가 대상은 자동 평가기로 점수화 가능한 수학적 구성 문제 12개와 사례연구 2개로 한정되며, 일반적인 정리 증명형 문제 전반에 대한 성능은 검증되지 않았다.
- peak/flat 자기합성곱처럼 대규모 이질적 휴리스틱 탐색이 유리한 문제에서는 Station이 AlphaEvolve보다 낮은 성능을 보였다.
- d=3에서 나온 새 무한 계열은 4, 5차원에서는 기존 결과보다 약한 공식을 냈고, 개별 소수 값 개선은 공식이 아니라 탐색에서 나온 것이라 일반화 여부가 불확실하다.
- 604점 키싱 배치 중 하나는 동시기에 다른 플랫폼(EinsteinArena)에서도 독립적으로 보고되어, 완전한 독자적 발견이라 보기 어려운 부분이 있다.
- 에르되시 문제에서 원래 요청한 상계 개선은 이루지 못했고(AlphaEvolve 대비 소폭 개선에 그침), 대신 예정에 없던 하계 결과를 낸 것이므로 지정된 과제에 대한 성능으로 오독하면 안 된다.
왜 중요한가
이 연구는 AI를 고정된 파이프라인 속 도구가 아니라 독립적 연구자로 취급했을 때 수학 연구에서 실제로 새로운 결과를 낼 수 있는지 보여주는 사례다. 원자료(에이전트 대화, 증명, 검증 코드)를 모두 공개해, AI 발견 과정이 어떻게 일어났는지 투명하게 검증하고 재현할 길을 연다.
이 논문의 용어
- Station · 중앙 지휘자 없이 AI 에이전트들이 스스로 연구 방향을 정하고 논문을 써서 지식을 쌓는 개방형 다중 에이전트 시뮬레이션 환경
- 카키야 집합(Kakeya set) · 모든 방향으로 완전한 직선을 하나씩 포함하는 집합으로, 이를 최소 크기로 만드는 것이 문제
- 키싱 수(kissing number) · 한 중심 구를 동시에 겹치지 않고 접할 수 있는 단위 구의 최대 개수
- 에르되시 최소중첩 문제 · 구간을 두 상보적 부분으로 나눌 때 평행이동에 따른 겹침을 최소로 만드는 정도를 다루는 문제
- 틱(tick) · Station 환경에서 모든 에이전트가 동시에 행동을 마칠 때마다 흐르는 하나의 시간 단위
최신 논문
- 챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구
- LLM 에이전트가 남긴 대량의 실행 기록을 하나의 작은 유한 상태 기계로 압축해, 다음 행동 예측과 실패 조기 탐지에 함께 쓸 수 있게 했다LLM 에이전트가 남긴 대량의 실행 기록을 하나의 작은 유한 상태 기계로 압축해, 다음 행동 예측과 실패 조기 탐지에 함께 쓸 수 있게 했다
- 경쟁 프로그래밍 문제를 풀 때 하나의 만능 AI 대신 분야별 전문가 AI들이 릴레이로 코드를 고쳐가며 완성한다경쟁 프로그래밍 문제를 풀 때 하나의 만능 AI 대신 분야별 전문가 AI들이 릴레이로 코드를 고쳐가며 완성한다
- 코딩 에이전트 여러 개를 한 작업공간에서 동시에 협업시키면, 순서대로 시키거나 그냥 병렬로 굴리는 것보다 낫다코딩 에이전트 여러 개를 한 작업공간에서 동시에 협업시키면, 순서대로 시키거나 그냥 병렬로 굴리는 것보다 낫다
- 여러 개 답을 뽑아 투표하는 방식이, AI가 추론 도중 답을 아예 못 내는 문제까지 해결해준다여러 개 답을 뽑아 투표하는 방식이, AI가 추론 도중 답을 아예 못 내는 문제까지 해결해준다
- 블랙홀 특이점은 한 점이 아니라 하나의 면이다블랙홀 특이점은 한 점이 아니라 하나의 면이다
- AI 코딩 에이전트에게 게임 하나를 처음부터 만들게 하고, 고쳐보게 하고, 여러 번 개선까지 시켜본 결과 '만들기'는 잘해도 '고치기'와 '유지하기'는 서툴렀다AI 코딩 에이전트에게 게임 하나를 처음부터 만들게 하고, 고쳐보게 하고, 여러 번 개선까지 시켜본 결과 '만들기'는 잘해도 '고치기'와 '유지하기'는 서툴렀다
- 같은 모델도 채점 방식만 바꾸면 정확도가 31%에서 89%까지 오가고, 그 채점 방식이 리더보드 1위를 몰래 결정하고 있었다같은 모델도 채점 방식만 바꾸면 정확도가 31%에서 89%까지 오가고, 그 채점 방식이 리더보드 1위를 몰래 결정하고 있었다
METAL LAB 최신 기사
그림 출처: Stephen Chung et al., arXiv:2608.23691, cc-by-nc-sa-4.0