METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

엔비디아, 3B만 켜서 도는 30B 오픈모델 'Nemotron 3.5 Lightning'

전체 30B 중 토큰당 3B만 활성화하는 MoE 구조로, 동급 모델 대비 최대 4배 출력 속도를 주장했다

NVIDIA Nemotron 관련 AI 모델 성능 비교 막대 그래프

요약

  • NVIDIA가 오픈 모델 Nemotron 3.5 Lightning을 공개했다. 전체 30B 파라미터 MoE에 활성 파라미터는 3B다
  • 회사는 비슷한 크기 모델 대비 최대 4배의 출력 속도를 낸다고 밝혔다
  • 공개 당일 Together AI에서 바로 호출 가능한 상태로 올라갔다
모델명
NVIDIA Nemotron 3.5 Lightning
구조
오픈 30B MoE, 활성 파라미터 3B
성능 주장
동급 크기 모델 대비 최대 4배 출력 속도(NVIDIA 발표)
타깃 용도
대량·특화 작업을 처리하는 상시 구동(always-on) 에이전트
제공처
Together AI에 공개 당일 서비스 개시
발표 시점
2026년 8월 11일

30B을 불러놓고 3B만 쓴다

NVIDIA가 오픈 모델 계열 Nemotron의 신작 Nemotron 3.5 Lightning을 공개했다. 전체 파라미터는 300억 개인데, 토큰 하나를 만들 때 실제로 계산에 참여하는 건 30억 개다. 회사는 이 구조 덕분에 비슷한 규모의 모델보다 최대 4배 빠르게 답을 뽑아낸다고 밝혔다. 겨냥한 곳도 분명하다. 하루 종일 꺼지지 않고 도는 에이전트, 그리고 정해진 작업을 대량으로 반복 처리하는 일이다.

같은 날 추론 서비스 업체 Together AI가 이 모델을 자사 플랫폼에 올렸다. Together AI는 "동급에서 가장 빠른 오픈 모델"이라고 소개했다. 발표와 서비스 개시 사이의 간격이 거의 없었다는 점만으로도, 이 모델이 연구용 전시품이 아니라 곧바로 API로 때려 넣을 물건으로 설계됐다는 게 읽힌다.

왜 '활성 파라미터'가 이름값보다 중요한가

MoE(Mixture of Experts)는 모델 안에 전문가라 불리는 여러 하위 신경망을 두고, 입력마다 그중 일부만 골라 쓰는 방식이다. 도서관 전체를 지어두고 질문마다 필요한 서가 한두 칸만 여는 셈이다. 지식의 총량은 30B급이지만 연산 비용과 응답 지연은 3B급에 가까워진다. 최근 1년 사이 공개된 오픈 모델이 대부분 이 구조로 몰린 이유가 여기 있다. 지난 8월 9일 공개된 큐원(Qwen)의 Qwen-AgentWorld-35B-A3B도 전체 35B에 활성 3B였다. 30B대 총량, 3B대 활성. 오픈 진영에서 하나의 규격처럼 굳어가는 구간이다.

속도가 왜 이렇게 중요해졌는지도 짚어둘 만하다. 사람이 한 번 묻고 한 번 답을 받는 챗봇에서는 1초가 늦어도 크게 티가 안 난다. 그런데 에이전트는 한 작업을 끝내려고 스스로 수십 번, 때로 수백 번 모델을 호출한다. 호출 한 번의 지연이 그 횟수만큼 곱해진다. 정확도를 조금 양보하더라도 빠르고 싼 모델을 여러 번 굴리는 편이 나은 구간이 생겼고, Lightning이라는 이름은 그 지점을 정확히 노린 작명이다.

NVIDIA가 GPU 회사이면서 모델을 계속 오픈으로 던지는 배경도 같은 맥락이다. 지난 7월 이 회사는 200개 이상 기업·기관과 함께 오픈 웨이트를 지지하는 공개서한에 서명했고, 이후 피지컬 AI 파운데이션 모델 Cosmos 3, 양자컴퓨터 보정용 비전언어모델 Ising 1.5를 잇달아 공개해 왔다. 자사 하드웨어 위에서 돌 만한 모델이 세상에 많아질수록 칩 수요가 따라온다.

그래서 무엇이 달라지나

에이전트를 실제 서비스에 붙여보려던 팀에게 선택지가 하나 늘었다. 프런티어 모델로 다 처리하기엔 호출당 비용과 지연이 부담이고, 소형 모델로는 작업 완수율이 떨어지던 중간 지대가 이 30B/3B 구간이다. Together AI를 통해 자체 GPU 없이 바로 성능을 재볼 수 있다는 점도 실무적으로는 크다. 벤치마크 점수와 라이선스 조건 같은 세부는 모델 카드 공개 이후 검증이 필요하지만, '큰 모델 하나'에서 '빠른 모델 여러 번'으로 무게중심이 옮겨가는 흐름 위에 이 모델이 정확히 놓여 있다는 것만은 분명하다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글