LLMs as Acquisition Policies for Finite-Pool Materials Optimization: A Controlled Study
신소재 후보를 고를 때, 챗GPT 같은 AI가 전문 통계기법을 대신할 수 있을까 실험해봤다
연구진은 값비싼 실험 없이도 좋은 신소재를 빨리 찾아야 하는 문제에서, 오픈소스 대형언어모델(LLM) 5종이 다음에 어떤 후보를 실험할지 스스로 고르게 해봤다. 무작위로 고르는 것보다는 훨씬 나았지만, 이 분야에서 오래 쓰여온 통계적 방법인 가우시안 프로세스보다는 대체로 못했다. 후보를 어떻게 나열해서 보여주는지, 소재 관련 설명을 곁들이는지에 따라 성능이 크게 흔들려서, 아직은 안정적으로 믿고 쓰기는 이르다는 결론이다.
무엇을 했나
- 강철, 자석 합금, 압전 세라믹 등 4가지 소재 최적화 문제에서 정답(최적 후보)을 찾는 실험을 재현하는 방식으로, Gemma·DeepSeek·Qwen 계열 등 5개 오픈소스 LLM이 매번 후보 목록 중 하나를 고르게 하고 몇 번 만에 최적값을 찾는지 측정했다
- 후보를 한 번에 다 보여주는 방식과, 후보를 여러 조로 나눠 토너먼트처럼 승자를 뽑아 올라가는 방식(배치 토너먼트) 두 가지 제시 방법을 비교했다
- LLM은 무작위 선택보다는 항상 더 적은 시도로 정답을 찾았지만, 전통적인 통계기법인 가우시안 프로세스보다는 4개 과제 중 3개에서 뒤처졌고, 나머지 1개 과제에서만 앞서거나 비슷했다
- 같은 LLM이라도 후보 목록의 순서, 배치 크기, 소재 관련 설명(원소 이름 등) 유무에 따라 성적이 크게 달라졌고, 특히 목록의 특정 위치에 있는 후보를 유독 자주 고르는 '위치 편향' 현상도 모델마다 다르게 나타났다
- LLM의 선택 패턴을 뜯어봤더니 가우시안 프로세스처럼 규칙적으로 탐색과 활용 사이를 오가는 방식이 아니라 훨씬 불규칙했다
| Task | Candidates | Features | Target |
|---|---|---|---|
| Kerr Rotation | 921 | 3 | Kerr rotation (mrad) |
| Coercivity | 921 | 3 | coercivity (mT) |
| Matbench Steels | 312 | 14 | yield strength (MPa) |
| Electrostrain | 81 | 15 | electrostrain (%) |
| Model | Kerr Rotation | Coercivity | Matbench Steels | Electrostrain |
|---|---|---|---|---|
| Random | 462.48 ± 262.24 | 448.09 ± 269.63 | 159.31 ± 91.28 | 39.89 ± 23.00 |
| GP-EI | 8.40 ± 2.78 | 91.80 ± 62.77 | 42.72 ± 27.24 | 18.48 ± 14.53 |
| Whole-pool selection | ||||
| Gemma4 | 31.28 ± 17.24 | 209.88 ± 134.05 | 44.16 ± 23.36 | 14.36 ± 7.71 |
| Qw27B | 27.08 ± 13.59 | 195.20 ± 114.39 | 48.24 ± 23.43 | 19.44 ± 10.40 |
| Qw35B | 45.72 ± 20.28 | 289.88 ± 127.44 | 50.36 ± 24.89 | 27.64 ± 18.15 |
| Qw397B | 23.48 ± 10.40∗ | 258.24 ± 151.68∗ | 53.32 ± 32.90∗ | 16.84 ± 5.93 |
| DS | 110.64 ± 85.31 | 236.28 ± 210.72 | 87.60 ± 52.10 | 13.88 ± 9.98 |
| Batch-tournament (b=20) | ||||
| Gemma4 | 13.12 ± 5.12 | 389.64 ± 92.00 | 78.08 ± 49.83 | 14.80 ± 6.50 |
| Qw27B | 14.28 ± 7.33 | 468.64 ± 50.68 | 64.52 ± 32.94 | 18.04 ± 5.33 |
| Qw35B | 22.00 ± 8.73 | 379.80 ± 110.27 | 52.68 ± 20.12 | 20.36 ± 9.89 |
| Qw397B | 14.48 ± 7.54 | 178.80 ± 82.87† | 81.96 ± 41.10 | 15.08 ± 6.92 |
| DS | 16.88 ± 5.52 | 241.84 ± 52.10 | 32.88 ± 31.71 | 12.36 ± 4.71 |
| Electrostrain | Matbench Steels | Coercivity | Kerr Rotation | |||||
|---|---|---|---|---|---|---|---|---|
| Models | Whole | Batch | Whole | Batch | Whole | Batch | Whole | Batch |
| Gemma4 | 0.998 | 2.27 | 1.02 | 2.11 | 1.60 | 2.08 | 2.21 | 2.02 |
| DS | 1.36 | 2.29 | 1.47 | 2.13 | 2.48 | 2.35 | 2.60 | 2.15 |
| Qw27B | 0.929 | 2.10 | 0.852 | 2.04 | 2.18 | 2.06 | 2.17 | 2.04 |
| Qw35B | 1.26 | 2.20 | 0.747 | 2.12 | 1.67 | 2.24 | 2.77 | 2.08 |
| Qw397B | 1.04 | 2.20 | 1.36∗ | 2.08 | – | 1.84† | – | 2.06 |
| Model | Random | GP-EI | Whole-pool | Generation-and-matching |
|---|---|---|---|---|
| Qw27B | 159.31 ± 91.28 | 42.72 ± 27.24 | 48.24 ± 23.43 | 123.60 ± 63.60 |
| Gemma4 | 44.16 ± 23.36 | 48.80 ± 26.14 |

왜 중요한가
신소재 개발처럼 시험 한 번에 비용과 시간이 많이 드는 분야에서, 별도의 훈련 없이 범용 AI 모델만으로 다음 실험 대상을 고를 수 있는지는 실무적으로 큰 의미가 있다. 다만 이번 연구는 그 가능성과 한계를 동시에 보여주므로, 지금 단계에서 LLM을 실제 소재 탐색 파이프라인에 무작정 투입하기보다는 신중한 검증이 필요함을 시사한다.
이 논문의 용어
- 능동학습(Active Learning) · 적은 수의 관측 결과를 보고 다음에 어떤 데이터를 확인할지 스스로 정하는 학습 방식
- 가우시안 프로세스(Gaussian Process, GP) · 불확실성까지 함께 예측해주는 확률적 통계 모델로, 신소재 탐색에서 널리 쓰이는 대표적 기법
- 획득 함수(Acquisition Function) · 다음에 어떤 후보를 실험할지 점수를 매겨 결정하는 규칙, 대표적으로 기대개선량(EI)이 있다
- 오픈웨이트(Open-weight) LLM · 모델 내부 가중치가 공개되어 누구나 내려받아 실행할 수 있는 대형언어모델
- 위치 편향(Position Bias) · AI가 목록에서 특정 위치(예: 맨 앞)에 있는 항목을 실제 중요도와 상관없이 더 자주 고르는 경향
논문 원문 초록 (영문)
Discovering materials with desirable properties often requires searching large candidate spaces while experimental or computational evaluations remain costly. Active learning addresses this challenge by using previous observations to select which candidate to evaluate next, typically through probabilistic surrogate models. We investigate whether open-weight large language models (LLMs) can serve as standalone acquisition policies in this setting. We evaluate five LLMs across four retrospective finite-pool materials optimization tasks under different candidate-presentation strategies and compare them with random selection and conventional Gaussian-process methods. LLM policies generally reach the global optimum in fewer iterations than random selection, indicating that they provide a useful acquisition signal without task-specific training. Their performance relative to Gaussian-process methods is mixed: conventional acquisition performs better on most tasks, while LLMs match or outperform it in some settings. Performance varies substantially across tasks, models, initializations, and candidate presentations, with no LLM approach performing best across all tasks. Overall, open-weight LLMs show potential as acquisition policies for finite-pool materials search, although their reliability remains sensitive to the task and to how candidates and scientific context are presented.
arXiv에서 원문 보기최신 논문
- Specification-delta-driven data governance: an empirical study of the {\guillemotleft}spec-delta{\guillemotright} as the unit of change in lakehouse data platforms데이터 플랫폼 변경도 코드처럼 '설계도 조각'을 붙여서 검토하면 어떨까: 실험 설계 논문
- Are LLMs becoming similarly creative? Evidence from three years of models최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
- Auditing Cross-Lingual Fairness in Language Model WatermarkingAI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다
- TESTNAV: Pareto-Guided Search for Compositional Robustness TestingAI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- Optimal Skill Selection for LLM Agents with Provable Bicriteria GuaranteesAI 에이전트에게 어떤 '스킬 문서'를 몇 개나 줘야 잘 작동하는지, 수학적으로 최적해를 보장하며 골라주는 방법
- Reliable Financial Named Entity Recognition under Domain Shift금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
METAL LAB 최신 기사
그림 출처: Dino-Rober Demir et al., arXiv:2608.19790, CC BY 4.0