
이미지: 영상 갈무리
요약
- 앤스로픽이 9월 17일 클로드가 최적화한 오픈소스 생물학 모델 코드를 전부 공개했어요.
- 구조 예측 모델 13개가 Fast 모드에서 평균 4.1배, 14개가 출력이 같은 Exact 모드에서 평균 1.6배 빨라졌어요.
- 저메모리 Big 모드로 1만 토큰이 넘는 분자 기계를 GPU 노드 한 대에서 정확히 예측했어요.
- 공개
- 2026년 9월 17일 · 앤스로픽 사이언스 블로그와 기술 보고서
- 규모
- 오픈소스 모델 30개 이상 · 구현 36개 · 4주 미만
- 속도
- Fast 13개 평균 4.1배 · Exact 14개 평균 1.6배 · Big 평균 3.4배 (NVIDIA H100)
- 커널
- FlashPairformer v1 · 삼각 어텐션 평균 2.7배 · 삼각 곱셈 1.7~3.2배
- 정확도
- 모델 구성 13개 · 1,925개 모델과 표적 쌍 · 허용 계면 비율 변화 1%포인트 미만
- Big 모드
- 1만 토큰 초과 복합체를 8-GPU 노드 한 대로 정확 예측 · 최대 70,320 잔기 추론
- 감독
- 생체분자 모델링 경험은 있으나 추론 최적화·커널 경험은 없는 기술진 2명
- 결합체 설계
- H200 한 장 24시간 · GPU 시간 약 100분의 1 · GPU와 토큰 합쳐 약 150달러
- 설계 점수
- ipSAE 중앙값 Opus 5 0.785 · Mythos 5.1 0.781 · Mythos 5 0.739 · 이전 0.749
- 배포
- Apache 2.0 · 키트 36개 · 유지보수하지 않는 참조 배포 · 풀 리퀘스트 미수용
- 대회
- Adaptyv Bio 공동 주최 · 클로드 크레딧 최대 100만 달러 · Modal 25만 달러 · 설계 5,000건 이상 검증
- 기술 보고서
- 139쪽 · 교신저자 Amir Shanehsazzadeh
앤스로픽이 클로드에게 남이 만든 생물학 모델을 더 빠르게 돌리라고 시켰고, 4주가 채 안 되는 사이에 오픈소스 모델 구현 36개가 다시 쓰였어요. 회사는 9월 17일 사이언스 블로그와 기술 보고서로 결과를 공개하면서 최적화 코드를 전부 오픈소스로 풀었어요. 단백질 구조 예측과 단백질 설계, 유전체학, 단백질 언어 모델까지 30개가 넘는 모델이 대상이고, 발표문에 따르면 평균 4배 안팎 빨라졌어요.
숫자를 읽으려면 모드를 먼저 갈라야 해요. 각 패키지는 원래 가중치를 그대로 쓰면서 최대 세 가지 모드를 내놓는데, 출력을 비트 단위까지 똑같이 재현하는 Exact, 수치 정밀도를 조금 내주고 속도를 얻는 Fast, 메모리 사용을 줄여 더 큰 입력을 담는 Big 이에요. 기술 보고서에 따르면 NVIDIA H100 에서 Exact 모드는 구조 예측 모델 14개의 순전파를 평균 1.6배, Fast 모드는 해당 모드를 가진 13개를 평균 4.1배 빠르게 돌렸고 Big 모드는 평균 3.4배였어요.
속도가 나온 자리는 삼각 연산이에요. AlphaFold3 와 OpenFold3, Boltz-2 같은 최신 구조 예측 모델은 실행 시간과 메모리의 상당 부분을 삼각 어텐션과 삼각 곱셈에 써요. 토큰 세 개 묶음을 다루는 연산이라 비용이 토큰 수의 세제곱으로 늘고, 크기를 두 배로 키우면 시간과 메모리가 여덟 배, 세 배로 키우면 스물일곱 배가 돼요. 클로드는 이 자리를 겨냥한 GPU 커널 묶음 FlashPairformer v1 을 만들었고, 보고서는 대부분의 모델이 쓰는 쌍 너비 128 에서 삼각 어텐션이 업계 표준 커널보다 평균 2.7배 빨랐다고 적었어요.
공용 커널 위에는 모델마다 다른 손질이 얹혔어요. 원래 코드가 되풀이해 계산하던 중간값을 기억해 두고, 결과가 늘 같은 분기를 상수로 접고, CUDA 그래프를 캡처하고, 커널을 합쳤어요. 구조 예측 모델의 Fast 모드 속도 향상은 OpenDDE 의 2.3배부터 Chai-1 의 6.4배까지 벌어졌고, 유전체학과 단백질 언어 모델은 Exact 모드에서 1.2배부터 5.0배를 얻었어요.
빨라진 코드가 답을 바꾸지 않았는지는 따로 쟀어요. 모델 구성 13개에 걸친 1,925개 모델과 표적 쌍을 모아 본 벤치마크에서 허용 가능하다고 판정된 계면의 비율은 기본 설정 54.8%, Exact 55.0%, Fast 54.5%, Big 54.2% 였어요. 세 모드의 변화폭은 각각 0.2%포인트, 마이너스 0.4%포인트, 마이너스 0.6%포인트로 전부 1%포인트 안쪽이었고 0과 구별되지 않았다고 보고서는 밝혔어요. 계면은 DockQ 점수가 0.23 이상이면 허용으로 쳤어요.
더 눈에 띄는 쪽은 메모리예요. 세포 안의 일은 단백질을 만드는 리보솜, 세포에 힘을 대는 호흡 복합체, 다른 단백질이 접히는 걸 돕는 샤페론 같은 거대 분자 기계가 하는데, 이 크기를 예측하려면 대개 GPU 노드 여러 대가 필요했어요. 클로드가 만든 저메모리 Big 모드는 1만 토큰이 넘는 시스템을 GPU 노드 한 대로 정확히 접었어요. 사람 미토콘드리아 복합체 I 과 TRiC 샤페론 복합체, 프로테아좀, 세균 70S 리보솜이 실험으로 밝혀진 구조와 가깝게 맞았고 보고서는 TM 점수가 0.92에서 0.997 사이였다고 적었어요. AlphaFold3 논문이 정확히 예측했다고 내세운 40S 리보솜은 7,663 토큰이었고, 그 구조를 따르는 모델들이 학습한 조각은 최대 768 토큰이에요.
같은 실험의 반대쪽 끝에는 실패가 숫자로 남아 있어요. B300 여덟 장짜리 노드로 바이러스 캡시드와 단백질 구획을 3만 1천에서 7만 320 잔기까지 돌렸더니 일곱 번 모두 계산은 끝났지만 예측 구조는 실제 조립체 지름의 4분의 1쯤 되는 공처럼 뭉개졌고 TM 점수는 0.08에서 0.14 였어요. 보고서는 이 조립체가 AlphaFold3 의 가장 큰 학습 조각보다 40배에서 90배 크다는 점을 들어, 일반화가 되지 않은 결과로 본다고 적었어요. 계산할 수 있는 크기가 넓어진 것이지 모델이 배운 범위가 넓어진 건 아니라는 이야기예요.
설계 쪽 결과가 이 최적화의 값을 가장 잘 보여 줘요. 메탈은 클로드가 24시간 자율로 설계한 단백질 12개 가운데 절반이 실험실에서 결합했다고 보도한 바 있는데, 그때는 같은 24시간 기간에 표적 하나마다 최대 1만 달러, 목록가로 약 2,500 H100 GPU 시간을 쓰고 1만 6천 낱말짜리 프롬프트와 하위 에이전트를 동원했어요. 이번에는 클로드 한 모델에 H200 한 장과 24시간, 1,100 낱말 안팎의 프롬프트와 도구 설명서만 주고 하위 에이전트도 사람의 조종도 없앴어요.
같은 표적 16개에 Mythos 5.1 과 Mythos 5, Opus 5 를 각각 돌린 결과, 보고서에 따르면 24시간 뒤 설계 점수 중앙값은 Opus 5 가 0.785, Mythos 5.1 이 0.781, Mythos 5 가 0.739 로 이전 캠페인의 0.749 와 견줄 만했어요. 가장 좋은 설계는 각각 0.833, 0.825, 0.813 이었고 이전 캠페인은 0.817 이었어요. 쓴 GPU 시간은 24 H200 시간으로 약 100분의 1 이었고, 발표문은 GPU 와 토큰을 합쳐 150달러쯤이면 이전 캠페인의 계산 성능에 닿는다고 적었어요. 점수를 낸 ipSAE 는 실험실 결합을 예측하는 것으로 알려진 계산상의 지표이고 이번 설계들은 아직 실험으로 검증되지 않았는데, 메탈은 AI 가 설계한 단백질에서 예측과 실험이 갈린 사례를 보도한 바 있어요.
코드를 가져다 쓸 사람에게 중요한 건 배포 조건이에요. 저장소에는 상위 도구 하나마다 하나씩, 끼워 넣는 최적화 키트 36개가 들어 있고 원래 코드는 Apache 2.0 이에요. 키트는 off 와 exact, fast, big 이라는 같은 어휘를 쓰고 기준 구성은 NVIDIA H100 80GB 리눅스 x86-64 이며 A100 과 H200, B200, B300 구성도 일부 함께 들어 있어요. 실행할 때마다 어떤 최적화가 켜졌는지 한 줄을 찍고, 그 기계에서 모드를 켤 수 없으면 NOT ACTIVE 를 찍고 종료 코드 3 으로 멈춰요. 원래 구현으로 조용히 되돌아가지 않게 막아 둔 설계예요.
저장소는 유지보수하지 않는 참조 배포라고 스스로 적어 뒀어요. 상위 버전을 고정해 그대로 제공하고 풀 리퀘스트는 받지 않으며 상위 프로젝트를 따라 올릴 계획도 없다고 밝혔어요. Apache 2.0 이라 필요한 쪽이 갈라 유지할 수는 있어요. 메탈이 확인한 기술 보고서는 139쪽이고, 저자에는 앤스로픽의 Richard Shuai 와 Rohil Badkundri, Vincent Fan, Biohub 의 Kilian Fatras, 컬럼비아대의 Lukas Jarosch 가 이름을 올렸어요.
작업이 어떻게 굴러갔는지는 초록 한 문장에 적혀 있어요. 교신저자인 앤스로픽의 Amir Shanehsazzadeh 와 공저자들은 "생체분자 모델링에는 경험이 있지만 추론 최적화나 커널 엔지니어링에는 경험이 없는 과학자 두 명의 감독 아래, 클로드는 4주가 채 안 되는 기간에 30개가 넘는 오픈소스 모델을 아우르는 36개 모델 구현의 최적화 패키지를 만들어 냈습니다" 라고 적었어요. 앤스로픽은 발표문에서 "우리 결과는 프런티어 AI 모델이 이 분야의 다른 이들이 과학 도구를 더 빠르고 쉽게 만들도록 도우리라는 점을 시사합니다" 라고 밝혔어요.
앤스로픽은 같은 날 Adaptyv Bio 와 공동 주최하는 단백질 설계 대회도 열었어요. 두 곳이 오늘의 능력 경계에 있는 문제 다섯 개를 함께 골랐는데 종 간 교차반응성과 pH 민감성, 펩타이드와 MHC 특이성, 그리고 GPCR 같은 어려운 표적이 들어갔어요. 클로드 크레딧 최대 100만 달러와 Modal 컴퓨트 크레딧 최대 25만 달러가 걸렸고 Twist Bioscience 가 DNA 를 대며, 공동체가 낸 설계 5,000건 이상을 실험으로 검증해요. 보도에 따르면 참가자는 설계 소유권을 그대로 갖고 음성 결과를 포함한 실험 결과가 전부 공개되며 현금 상금은 없어요.
엔지니어 눈으로 이 발표에서 가장 큰 숫자는 4.1배가 아니라 4주예요. 이런 최적화는 보통 경험 있는 엔지니어 팀이 모델 하나마다 몇 주씩 붙어야 하고 그 작업이 다른 모델로 잘 옮겨 가지도 않아요. 이번에는 커널 경험이 없는 감독자 두 명과 모델 하나가 그 일을 36개 구현에 걸쳐 했고, 결과물이 열어 볼 수 있는 커널과 벤치마크 설정으로 남았어요. 남은 검증은 실험실이에요. 계산상의 점수가 아무리 높아도 결합은 시험관에서 확인되고, 그 답은 대회 검증이 끝나는 11월 말에야 나와요.





댓글