METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

Qwen3.8 Max, "안 만들어도 될 것" 잘 골라내는 모델로 호평

r/LocalLLaMA 리뷰어가 속도·기획 검토·자기 교정 능력을 극찬, 배경엔 2.4조 파라미터와 에이전틱 지수 1위 성적

Qwen3.8 Max, "안 만들어도 될 것" 잘 골라내는 모델로 호평 · Image: METAL LAB

이미지: METAL

요약

  • r/LocalLLaMA 사용자가 알리바바 Qwen3.8 Max 정식 출시판을 써본 뒤 속도와 기획 검토 능력을 높이 평가했다
  • 리뷰어는 이 모델이 불필요한 복잡도와 중복 컴포넌트를 잘 걸러내며, 실험 설계에서도 가설을 반증하려는 태도가 강하다고 평했다
  • Qwen3.8 Max는 지난 8월 발표에서 Artificial Analysis Agentic Index 1위, Intelligence Index 5위(56점)를 기록한 바 있다
모델명
Qwen3.8 Max (알리바바 Qwen)
리뷰 출처
r/LocalLLaMA, 2026-08-14 게시
파라미터 구조
2.4조 총 파라미터 MoE(8월 8일 알리바바 발표 기준)
Artificial Analysis Intelligence Index
56점, 5위
Artificial Analysis Agentic Index
1위
작업당 비용
1.14달러 (Kimi K3는 0.86달러로 1점 앞선 점수 기록)
리뷰어가 꼽은 강점
속도, 기획 검토, 실험 설계, 자기 교정, 인프라 작업, 창작 구현

써본 사람이 먼저 알아챈 것

출시 초기 API 프리뷰부터 정식 출시판까지 두루 써본 한 r/LocalLLaMA 이용자는 Qwen3.8 Max를 두고 "불필요한 걸 알아서 걸러내는 모델"이라고 평가했다. 이 모델 크기치고는 응답이 유독 빠르고, 답을 내놓기 전 스스로 가정을 되짚어 오류를 잡아내는 빈도가 높다는 게 리뷰의 요지다. 이는 회사의 공식 발표가 아니라 실사용 후기이지만, 커뮤니티에서 관심을 모을 만큼 구체적인 관찰이 담겨 있다.

리뷰어가 가장 높게 평가한 대목은 기획·설계 검토 능력이다. 그는 "이게 정말 다 필요한가"를 묻는 데 있어 지금까지 써본 모델 중 가장 낫다고 말했다. 많은 모델이 그럴듯하게 들리는 정교한 아키텍처를 잘 만들어내는 반면, Qwen3.8 Max는 조기 추상화, 중복 컴포넌트, 불필요한 서비스, 지나치게 많은 이동 부품을 짚어내는 데 능하다는 것이다. 다만 무조건 단순화하지는 않고, 실제로 필요한 복잡도와 유지보수만 어렵게 만드는 복잡도를 구분한다고 덧붙였다.

실험 설계와 인프라 작업에서도 강세

연구 목적 활용에서도 후한 평가가 나왔다. 유용한 절제 실험(ablation)을 제안하고, 교란 변수를 짚어내며, 비교가 공정한지 따지는 능력이 인상적이라는 설명이다. 리뷰어는 이 모델이 가설을 뒷받침하는 증거만 만드는 데 그치지 않고, 가설을 실제로 반증할 수 있는 실험을 밀어붙이는 경향이 있다고 전했다. 많은 모델이 어떤 결과가 나와도 제안된 방법이 좋아 보이게 만드는 실험을 순순히 도와주는 것과 대비된다는 지적이다.

암호화, 역할 기반 접근 제어(RBAC), 서버 보안 설정 같은 인프라 작업에서도 맥락을 잘 처리했고, 비슷한 작업에서 다른 모델보다 불필요한 응답 거부가 적었다고 알려졌다.

배경: 2.4조 파라미터와 엇갈린 벤치마크 성적

지난 8월 6일 알리바바 Qwen팀이 X 공식 계정을 통해 공개한 성적표에 따르면, Qwen3.8-Max는 Artificial Analysis Intelligence Index에서 5위(56점), 같은 지표의 Agentic Index에서는 1위를 기록했다. 다만 구조 면에서 이 모델은 2.4조 총 파라미터 규모의 MoE(Mixture of Experts, 여러 전문가 신경망 중 필요한 일부만 골라 쓰는 구조)로 알려졌고, Intelligence Index 점수는 오픈소스 모델 Kimi K3보다 1점 낮았다. 작업당 비용도 1.14달러로 Kimi K3(0.86달러)보다 25% 높게 책정됐다.

항목Qwen3.8 MaxKimi K3
Intelligence Index 점수56 bar:5657 bar:57
작업당 비용(달러)1.14 bar:570.86 bar:43
공개 형태비공개(API)오픈 가중치

리뷰어는 총 파라미터 규모 경쟁이 다시 커지는 흐름도 짚었다. 한동안 업계는 희소성과 효율, 적은 활성 파라미터로 더 많은 지능을 뽑아내는 데 집중했는데, 이제 다시 총 파라미터 수가 커지고 있다는 관찰이다. 그는 "다음엔 GLM이 3조를 넘길지 지켜보자"고 농담 섞인 전망을 남겼다.

창작 작업까지 손댄 흔적

의외의 대목은 창작 구현이다. 리뷰어는 영상 제작 도구 Remotion으로 제품 데모 영상을 만드는 데 이 모델을 썼는데, 타이포그래피와 여백, 절제된 연출, 카메라 움직임, 기능 노출 타이밍에 대한 감각이 좋았다고 전했다. 한 번은 음악을 분석해 컷 전환을 비트에 맞추는 자바스크립트 스크립트를 직접 작성해, 완성된 영상이 훨씬 의도적으로 편집된 느낌을 줬다고 한다.

그래서 무엇이 달라지나

이번 후기는 회사 발표가 아니라 커뮤니티 사용자의 경험담이라는 한계가 있지만, 벤치마크 점수만으로는 잘 드러나지 않는 실사용 감각을 보여준다는 점에서 눈여겨볼 만하다. 종합 지능 점수에서는 오픈소스 모델에 근소하게 밀렸지만, 기획을 검토하고 불필요한 복잡도를 걷어내는 실무형 작업에서는 오히려 강점을 보인다는 평가다. 코드 아키텍처를 짜거나 연구 실험을 설계하는 실무자라면, 점수표보다 이런 실사용 후기가 모델을 고르는 데 더 실질적인 참고가 될 수 있다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글