
이미지: METAL
요약
- 마이크로소프트가 역합성 모델 RetroChimera를 MIT 라이선스 오픈소스로 공개하고 논문을 네이처에 실었어요.
- 트랜스포머 기반 R-SMILES 2와 그래프 신경망 기반 NeuralLoc의 예측을 학습된 투표로 합쳤어요.
- 박사급 화학자 블라인드 평가에서 까다로운 표적 10개 중 9개의 완결 경로가 통과했어요.
- 게재
- 네이처 · 프리프린트 28쪽
- 구성
- R-SMILES 2(트랜스포머) + NeuralLoc(그래프 신경망)
- 결합 방식
- 순위별 학습된 투표 · 같은 반응이면 표를 합산
- 완결 경로
- 표적 10개 중 9개 · de novo 5 · 편집 4 · NeuralSym 2
- 전문가 선호
- 박사급 유기화학자 9명 · 문헌 방식 대비 약 64%
- top-10 정확도
- USPTO-50K +1.7%p · USPTO-FULL +1.6%p
- 주 학습 데이터
- Pistachio · USPTO-FULL 대비 표본 3.5배
- 학습 시점
- 2023년까지의 반응 데이터
- 제약사 검증
- GSK 내부 데이터 적응 · 주요 제약사 2곳 제로샷·미세조정
- 공개
- 오픈소스 · MIT 라이선스 · 깃허브 · 마이크로소프트 파운드리
- 사용 권고
- 입력당 5~10개 이하 · 타당성 모델 병용 · 전문가 검증 필수
마이크로소프트가 목표 분자를 거꾸로 분해해 합성 경로를 짜는 AI 모델 RetroChimera를 공개하고 가중치와 구현을 MIT 라이선스 오픈소스로 열었어요. 같은 연구를 담은 논문은 네이처에 실렸어요. 박사급 유기화학자들이 어느 쪽이 만든 것인지 모르는 상태로 평가한 블라인드 테스트에서, 이 모델의 제안은 기존 모델뿐 아니라 문헌에 이미 기록된 반응보다도 더 선호됐어요.
역합성은 만들고 싶은 분자에서 출발해 한 단계씩 더 단순한 전구체로 쪼개 나가다가 살 수 있는 원료에 닿을 때까지 거슬러 올라가는 작업이에요. 연구진은 이 일을 체스나 바둑 같은 전략 게임에 견주면서도 결정적으로 다른 점을 짚었어요. 가능한 수의 개수가 보드게임보다 훨씬 많고, 주어진 분자에 어떤 수가 열려 있는지조차 자명하지 않다는 점이에요. 그래서 오랫동안 이 조합 폭발은 자동화가 안 되는 영역으로 여겨졌어요.
RetroChimera는 모델 하나를 키우는 대신 성향이 다른 둘을 붙였어요. R-SMILES 2는 분자를 문자열로 적는 표기법을 쓰는 트랜스포머 기반 생성 모델로, 입력 분자에서 전구체를 곧바로 만들어 내요. 데이터에서 반응 패턴을 직접 배우는 유연함이 있지만 제약 없이 생성하는 만큼 없는 것을 지어낼 여지도 같이 커져요. NeuralLoc은 그래프 신경망 기반이라 표적 분자와 반응 템플릿을 모두 그래프로 인코딩하고, 어떤 템플릿을 고를지와 그것을 분자의 어디에 적용할지를 예측해요. 학습 데이터에서 뽑아낸 반응 패턴에 묶여 있어 더 정확하고 안정적인 대신, 템플릿 라이브러리에 없는 반응 앞에서는 운신의 폭이 좁아요.
이 차이가 약점이 아니라 설계의 축이에요. 두 모델은 서로 다른 반응 유형에 강해요. R-SMILES 2는 반응 과정에서 분자 구조가 크게 바뀌는 경우에 특히 잘 맞고, NeuralLoc은 선례가 적은 반응과 국소적인 변화가 일어나는 반응에서 앞서요. RetroChimera는 두 모델이 내놓은 순위 매겨진 예측을 학습된 앙상블 전략으로 합쳐요. 각 모델이 예측한 반응물 집합마다 순위에 따라 달라지는 학습된 표를 던지고, 두 모델이 같은 반응을 제안하면 그 표를 더해요. 어느 모델을 어느 순위에서 얼마나 믿을지를 학습으로 정하는 구조예요.
같은 투표 틀에 다른 제안자를 더 끼울 수 있다는 점도 논문에 적혀 있어요. 반응 데이터베이스 조회나 사람이 끼어드는 질의를 추가 입력으로 붙이면, 모델 예측과 기관 내부 데이터, 전문가 판단을 한자리에서 합칠 수 있어요.
숫자는 두 갈래로 나왔어요. 공개 벤치마크에서 RetroChimera는 USPTO-50K와 USPTO-FULL 양쪽에서 최고 성능을 새로 썼고, top-10 정확도를 각각 1.7%포인트와 1.6%포인트 끌어올렸어요. 더 눈에 띄는 쪽은 사람이 매긴 점수예요. 까다로운 표적 10개에 대해 전 단계가 전문가 검토를 통과해야 인정되는 기준을 걸었을 때, RetroChimera는 아홉 개에서 완결된 경로를 받아 냈어요. 같은 조건에서 de novo 모델은 다섯 개, 편집 모델은 네 개, 기준선인 NeuralSym은 두 개였어요. 마이크로소프트와 주요 제약사 소속 박사급 유기화학자 아홉 명은 이 모델의 최상위 제안과 같은 분자를 만드는 기존 문헌 방식 가운데 하나를 고르게 했을 때 약 64%의 비율로 모델 쪽을 골랐어요.
산업 현장에서 걸리는 문제는 데이터가 다르다는 점이에요. 제약사는 공개 데이터셋과 성격이 다른 자체 화학 데이터를 들고 일해요. 연구진은 미리 학습된 RetroChimera를 GSK의 내부 데이터에 어렵지 않게 맞출 수 있다는 것을 보였고, 네이처 논문 초록은 주요 제약사 두 곳의 내부 데이터셋에서 제로샷 전이와 미세조정을 모두 확인했다고 적었어요. 추가 학습 없이 새 데이터셋에 그대로 옮겨도 두 하위 모델보다 나은 성능이 나왔어요. 공동 저자 명단에도 노바티스 바이오메디컬 리서치 소속 연구자 다섯 명이 마이크로소프트 리서치 AI for Science 연구진과 나란히 올라 있어요.
메탈이 arXiv에서 프리프린트 원문(arXiv:2412.05269) 파일을 직접 내려받아 PDF 쪽수를 센 결과는 본문과 참고문헌, 확장 데이터를 합쳐 28쪽이었고, 공동 핵심 기여자로 표시된 제1저자는 크시슈토프 마지아시와 류궈칭이에요. 케임브리지대와 야기엘로니안대 소속 저자도 함께 들어가 있어요. 주 체크포인트는 공개 데이터셋보다 잘 정제된 Pistachio로 학습했는데, 이 데이터는 USPTO-FULL보다 표본이 3.5배 많아요.
쓰는 쪽에 회사가 붙여 둔 단서는 구체적이에요. 저장소 문서는 이 체크포인트가 2023년까지의 반응 데이터로 학습돼 그 이후 화학은 들어 있지 않다고 적었어요. Pistachio 자체에 잡음이 있어 예측은 관련 문헌에 비춰 확인해야 하고, 학습 분포와 많이 다른 화학에서는 성능이 떨어질 수 있어요. 순위가 낮은 반응일수록 지어냈을 가능성이 올라가니 입력 하나당 다섯에서 열 개를 넘겨 받지 말라는 권고와, 반응 타당성 모델을 함께 쓰고 컨센서스 모드를 켜라는 권고가 같은 자리에 적혀 있어요. 연구진은 저장소에 "실제 환경에서 어떤 예측이든 쓰기 전에 화학 전문가가 독립적으로 위험을 평가하고 검증해야 합니다" 라고 못 박았어요.
공개의 방식도 메시지예요. 모델은 MIT 라이선스로 깃허브에 올라갔고 마이크로소프트 파운드리로도 접근할 수 있어요. 마르윈 세글러 선임 수석 연구 매니저를 비롯한 저자들은 블로그에 "우리는 여러분이 가능한 모든 방법으로 이것을 깨뜨려 보고 그 결과를 우리에게 공유해 주기를 바랍니다" 라고 적었어요. 성능을 자랑하는 자리에 실패 사례를 달라는 요청을 같이 둔 셈이에요.
메탈은 AI가 설계한 단백질에서 예측과 실제 결과가 갈렸다고 보도한 바 있어요. 그 간극이 이 발표를 읽는 자리이기도 해요. 이번 평가는 전문가의 판단을 모은 것이지 실험실에서 실제로 합성해 본 결과가 아니에요. 제안된 경로는 여전히 타당성 검토와 실험 검증을 거쳐야 하고, 표적 10개라는 표본이 화학 공간 전체의 성능을 말해 주지도 않아요. 공개된 반응 데이터가 성공하고 잘 기록된 실험 쪽으로 기울어 있다는 점도 그대로 남아 있어요.
그래도 이 논문이 옮겨 놓은 것은 분명해요. 화학자가 모델 출력을 보고 고개를 끄덕이느냐는 오랫동안 평가표에 없던 항목이었고, 정확도 숫자와 따로 놀았어요. RetroChimera는 그 항목을 벤치마크와 같은 무게로 올려놓고, 문헌에 기록된 사람의 선택과 정면으로 비교해 이겼다고 보고해요. 엔지니어링 관점에서 더 눈여겨볼 대목은 그것을 한 모델의 규모가 아니라 성향이 다른 두 모델의 투표로 해냈다는 점이에요. 하나를 더 키우는 대신 서로의 빈칸을 메우게 하는 설계가, 지금 이 영역에서 더 멀리 간 길이었어요.
출처
- Microsoft Research — Improving synthesis prediction of small molecules at scale with RetroChimera →
- Nature — Chemist-aligned retrosynthesis by ensembling diverse inductive bias models →
- Microsoft Source — RetroChimera: New research advances AI-assisted molecule synthesis →
- Microsoft — microsoft/retrochimera — GitHub 저장소 →
- Microsoft Research — Microsoft Research 공식 X 게시물 — RetroChimera →





댓글