매일 아침, 어제의 AI를 한 통으로 정리해 보내드립니다메일로 받아보기

METAL LAB

큐원3.8-27B, 노트북서 돌려 제미나이 3.7 플래시 눌렀다

알리바바 큐원이 사용자의 로컬 실행 비교 사례를 앞세워 27B 모델의 경쟁력을 강조했다

WebGPU로 브라우저에서 3D 블록 세계를 생성하는 Qwen 데모 화면

이미지: X — 모델·오픈소스 영상 갈무리

요약

  • 알리바바 큐원이 8월 18일 자사 27B 모델의 로컬 실행 데모와 사용자 비교 사례를 공식 X 계정으로 소개했다
  • 사용자 AJ는 동일 프롬프트로 만든 Three.js 물 시뮬레이션에서 Qwen3.8-27B가 구글 제미나이 3.7 플래시를 앞섰다고 밝혔다
  • 이 테스트는 RTX 3090 한 장에 Q5 양자화 버전을 올려 진행됐으며, Qwen3.8-27B는 지난 14일 아파치 2.0으로 공개된 뒤 허깅페이스 트렌딩 1위에 오른 모델이다
공개일/라이선스
2026-08-14, 아파치 2.0 오픈웨이트 (알리바바 큐원)
허깅페이스 트렌딩
8월 16일 기준 1위, 원본 다운로드 9만1900건·좋아요 9890건(unsloth GGUF 판 86만8000건)
이번 비교 테스트
사용자 AJ가 동일 Three.js 물 시뮬레이션 프롬프트로 Qwen3.8-27B와 구글 제미나이 3.7 플래시를 원샷 비교
실행 환경
RTX 3090 GPU, Q5 GGUF 양자화 버전(F8 아님)
제3자 코멘트
레온 츠베트코프스키는 제미나이 3.7 플래시 가격대를 근거로 MoE 60~70B급으로 추정하며 비교가 공정하다고 평가
큐원 공식 발표
8월 18일 공식 X 계정이 로컬 실행 데모와 AJ의 비교 게시물을 소개

노트북 한 대로 돌린 27B 모델, 제미나이를 앞섰다는 사례

알리바바 큐원(Qwen) 공식 X 계정이 8월 18일 짧은 영상 하나를 올렸다. 문구는 단순했다. "프론티어 모델을 따라갈 만큼 강하면서도 노트북에서 돌릴 만큼 가볍다"는 것. 몇 분 뒤 이어진 두 번째 게시물에서는 사용자 AJ(@ItsmeAjayKV)가 올린 비교 데모를 인용했다. 같은 프롬프트, 같은 원샷 조건에서 Qwen3.8-27B가 구글의 제미나이(Gemini) 3.7 플래시를 앞선 결과를 냈다는 내용이었다.

Qwen3.8-27B, 다시 무대에 오르다

이 모델은 새로 나온 게 아니다. 알리바바 큐원은 지난 8월 14일 Qwen3.8-27B 가중치허깅페이스에 아파치 2.0 라이선스로 공개했다. 27B — 300억 개에 조금 못 미치는 매개변수를 가진 덴스 모델로, 4비트 GGUF 변환판이 17.9GB에 불과해 24GB급 그래픽카드 한 장에 올라간다. 이틀 뒤인 8월 16일에는 이 모델이 허깅페이스 트렌딩 1위에 올랐다는 소식도 나왔다. 원본은 다운로드 9만1900건, 좋아요 9890건을 기록했고 커뮤니티 개발자 언슬로스(unsloth)가 만든 GGUF 변환판은 이보다 훨씬 많은 86만8000건의 다운로드를 모았다. 이번 게시물은 그 뒤로 며칠 지나지 않아 나온 후속 홍보전인 셈이다.

사용자가 올린 물 시뮬레이션 비교

AJ가 공개한 테스트는 Three.js — 웹 브라우저에서 3D 그래픽을 그리는 자바스크립트 라이브러리 — 로 물의 파동을 시뮬레이션하는 과제였다. 그는 같은 프롬프트를 Qwen3.8-27B와 구글 제미나이 3.7 플래시에 각각 한 번씩 넣어 결과를 나란히 올렸다. AJ가 올린 비교 게시물에서 그는 "the difference is hugeee"(차이가 엄청나다)라고 적었다. 특히 그는 이 테스트를 RTX 3090 한 장에서, F8이 아닌 Q5 양자화 버전으로 돌렸다는 점을 강조했다. 양자화 — 모델의 계산 정밀도를 낮춰 용량과 연산량을 줄이는 압축 방식 — 등급이 낮을수록 성능 손실이 커질 수 있는데, 그 조건에서도 결과가 앞섰다는 주장이다.

이 비교에 레온 츠베트코프스키가 댓글을 달았다. 그는 제미나이 3.7 플래시의 가격 정책을 근거로 이 모델이 혼합전문가(MoE) 구조의 600억~700억 규모일 것으로 추정하며, 그렇다면 이번 비교가 크게 불공정하지는 않다고 평했다. 다만 이는 제3자의 추정일 뿐, 구글이 제미나이 3.7 플래시의 구조를 공개한 적은 확인되지 않았다.

그대로 써먹는 프롬프트 원문

AJ가 두 모델에 동일하게 넣은 프롬프트 전문은 다음과 같다.

"Create a Three.js water simulation. Requirements: Plane mesh with 512x512 subdivisions. Wave propagation simulation. Mouse click creates ripples. Multiple interacting waves. Real-time lighting. Everything in a single HTML file. No external libraries besides Three.js."

한국어로 옮기면 이렇다 — Three.js로 물 시뮬레이션을 만들어라. 512x512로 분할한 평면 메시, 파동 전파 시뮬레이션, 마우스 클릭 시 물결 생성, 여러 파동의 상호작용, 실시간 조명을 포함하고, Three.js 외 다른 라이브러리 없이 단일 HTML 파일 안에 전부 구현하라는 조건이다. 이 문구를 그대로 로컬 챗 UI나 API에 붙여 넣으면 같은 조건의 비교를 재현해볼 수 있다.

스펙으로 보는 두 모델

항목Qwen3.8-27B제미나이(Gemini) 3.7 플래시
개발사알리바바 큐원구글 딥마인드
공개된 구조27B 덴스, 아파치 2.0 오픈웨이트비공개(가격 기반 MoE 60~70B 추정)
이번 테스트 실행 환경RTX 3090, Q5 GGUF클라우드 API
최근 이력8/14 공개, 8/16 허깅페이스 트렌딩 1위확인된 배경 없음

에디터의 시선

이번 게시물 자체는 새로운 발표가 아니라 홍보전이다. 하지만 홍보전의 타이밍이 흥미롭다. Qwen3.8-27B는 공개(8/14) → 트렌딩 1위(8/16) → 과잉 사고 지적(같은 주) → 이번 사용자 비교 인용(8/18)까지, 2주가 채 안 되는 기간 동안 네 번째 회차를 이어가고 있다. 알리바바가 공식 계정으로 커뮤니티 데모를 계속 재인용하는 건, 이 모델의 화력을 벤치마크 표가 아니라 "내 컴퓨터에서 이렇게 됐다"는 1차 목격담으로 증명하려는 전략으로 읽힌다. 벤치마크 점수는 조작 논란에서 자유롭지 않지만, RTX 3090 한 장으로 재현 가능한 데모는 누구나 검증할 수 있다는 점에서 설득력이 다르다.

로컬 LLM을 실무에 붙여 본 경험을 떠올리면 이 흐름이 낯설지 않다. 27B급 모델이 24GB 그래픽카드 한 장에서 돌아간다는 건, 예전엔 70B 이상 모델에게나 기대했던 코드 생성 품질을 훨씬 저렴한 하드웨어에서 만난다는 뜻이다. 다만 Q5 같은 낮은 양자화 등급에서 나온 결과가 항상 안정적인 건 아니다. 같은 프롬프트를 열 번 돌려 결과 편차를 확인하는 절차 없이는, 한 번의 "원샷 승리" 데모만으로 실무 도입을 결정하기엔 이르다.

국내 개발팀이 참고할 지점은 명확하다. 프런트엔드 프로토타입이나 3D 시각화처럼 코드 한 방에 결과가 눈에 보이는 작업이라면, RTX 3090 또는 4090급 GPU 한 장과 Qwen3.8-27B GGUF 버전으로 클라우드 API 비용 없이 비슷한 실험을 지금 바로 돌려볼 수 있다. 다만 프로덕션 코드나 보안이 걸린 작업에는 아직 더 넓은 검증이 필요하다. 앞으로 몇 주 안에는 이런 커뮤니티발 원샷 비교가 다른 코딩·시각화 과제로 계속 이어질 것이고, 알리바바는 그 사례들을 계속 공식 계정으로 재인용할 가능성이 크다.