
이미지: @UnslothAI (X) 화면 갈무리
요약
- 알리바바 큐원의 새 125B 규모 MoE 모델 Qwen3.8-Flash-Next를 언슬로스가 8월 26일 로컬 실행용 GGUF로 공개했어요
- 1비트 양자화 기준 75GB RAM·통합메모리로 GPU 없이 구동되며, 원본 BF16(355GB) 대비 79% 작은 용량에도 top-1 정확도 79%를 유지한다고 밝혔어요
- SWE-bench Pro·CoWorkBench·JobBench 등 언슬로스 공개 비교표에서 두 모델 모두 점수가 있는 전 항목에서 클로드 오퍼스 4.6 맥스를 앞섰어요
- 모델
- Qwen3.8-Flash-Next (알리바바 큐원 개발, 125B MoE, Qwen4 아키텍처 프리뷰)
- 컨텍스트 윈도우
- 262K 토큰
- 최소 구동 사양
- 75GB RAM/통합메모리 (1비트 양자화, GPU VRAM 불필요)
- 양자화 압축률
- BF16(355GB) 대비 79% 작은 용량, top-1 정확도 79% 유지
- 로컬 실행 지원 발표
- 언슬로스(Unsloth), 2026-08-26 X 게시물
- 벤치마크 비교(SWE-bench Pro)
- Qwen3.8-Flash-Next 62.5 vs 클로드 오퍼스 4.6 맥스 53.4
- GGUF 저장소
- huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
알리바바 큐원의 새 모델 Qwen3.8-Flash-Next가 오픈웨이트로 등록된 데 이어, 언슬로스(Unsloth)가 8월 26일 이 모델을 로컬에서 돌릴 수 있는 GGUF 파일과 가이드를 공개했어요. 125B 규모 MoE(전문가 혼합) 모델인데도 서버용 GPU 없이 75GB RAM이나 통합메모리만으로 구동된다는 게 핵심이고요. 언슬로스가 공개한 비교표에서는 이 모델이 앤스로픽 클로드 오퍼스 4.6 맥스를 여러 벤치마크에서 앞섰어요.
Qwen4 아키텍처의 첫 프리뷰
Qwen3.8-Flash-Next는 알리바바가 준비해온 차세대 Qwen4 아키텍처의 첫 프리뷰 모델이에요. 텍스트와 이미지를 함께 읽는 멀티모달 구조이고, 262K 토큰 컨텍스트 윈도우를 지원해서 긴 문서나 코드 저장소를 한 번에 넣고 처리할 수 있어요. 앞서 지난 8월 14일 알리바바 큐원이 27B 덴스 모델 Qwen3.8-27B를 아파치 2.0으로 공개한 적이 있는데, 이 모델은 24GB급 그래픽카드 한 장으로도 구동됐어요. 이번 Qwen3.8-Flash-Next는 그보다 5배 가까이 큰 125B 규모라는 점이 달라요.
75GB 메모리로 어떻게 돌아가나
언슬로스는 Qwen3.8-Flash-Next를 1비트부터 8비트까지 여러 단계로 양자화해서 공개했어요. 원본 BF16 가중치는 355GB에 달하지만, 가장 가벼운 1비트 버전은 75GB로 줄어들어요.
| 양자화 등급 | 필요 메모리 |
|---|---|
| 1비트 | 75GB |
| 2비트 | 79GB |
| 3비트 | 90GB |
| 4비트 | 112GB |
| 6비트 | 128GB |
| 8비트 | 156GB |
| BF16(원본) | 355GB |
표의 단위는 RAM과 VRAM을 합친 총 메모리, 혹은 통합메모리 기준이에요. 79% 작아진 1비트 버전인데도 top-1 정확도는 79%를 유지한다고 언슬로스는 설명했어요. 이 모델은 구조가 독특해서 CPU RAM이나 통합메모리로 추론해도 GPU VRAM에 가까운 속도를 낼 수 있고, 그만큼 맥이나 엔비디아 DGX 스파크처럼 메모리가 큰 기기에 잘 맞는다고 덧붙였어요. 언슬로스는 자사 게시물에서 "큐원 덕분에 데이제로 접근이 가능했다"고 감사를 전했어요.

벤치마크: 클로드 오퍼스 4.6 맥스와 비교
| 벤치마크 | Qwen3.8-Flash-Next | 클로드 오퍼스 4.6 맥스 |
|---|---|---|
| SWE-bench Pro (에이전트 코딩) | 62.5 | 53.4 |
| SWE-bench Multilingual | 81.0 | 77.5 |
| NL2Repo-Bench | 48.1 | 47.6 |
| CoWorkBench (장기 업무) | 73.9 | 68.2 |
| JobBench (전문 업무) | 55.7 | 36.6 |
언슬로스가 공개한 비교표에서 Qwen3.8-Flash-Next는 두 모델 모두 점수가 있는 항목에서 전부 클로드 오퍼스 4.6 맥스를 웃돌았어요. 특히 전문 업무 처리를 평가하는 JobBench에서는 55.7점으로 클로드(36.6점)보다 20점 가까이 앞섰고요. 다만 이 수치는 알리바바 큐원과 언슬로스가 자체 공개한 값이라, 제3자가 독립적으로 재현한 결과는 아직 확인되지 않았어요.
어떻게 써보나
Qwen3.8-Flash-Next를 로컬에서 돌리려면 언슬로스가 만든 가이드 문서와 허깅페이스 저장소부터 챙기면 돼요. 언슬로스 가이드 문서에서 설치 절차와 하드웨어별 권장 설정을 확인할 수 있어요.
- 먼저 자신의 컴퓨터가 가진 RAM이나 통합메모리 용량을 확인해요. 위 표를 기준으로 75GB 이상이면 1비트 양자화 버전을, 여유가 있다면 4비트 이상 버전을 골라볼 수 있어요.
- huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF 저장소에서 원하는 양자화 등급의 GGUF 파일을 내려받아요.
- 언슬로스가 배포한 전용 llama.cpp PR 빌드나 Unsloth Desktop 앱을 설치해요.
- 다운로드한 GGUF 파일을 불러오면 별도의 서버 GPU 없이도 모델을 바로 실행할 수 있어요.
GPU VRAM 없이도 75GB 이상의 RAM이나 통합메모리를 갖춘 기기라면 실행할 수 있어요. 언슬로스는 맥과 엔비디아 DGX 스파크 같은 대용량 메모리 시스템을 예로 들었어요. 별도의 클라우드 GPU를 빌리지 않고도 개인 워크스테이션에서 큰 모델을 써볼 수 있다는 뜻이에요.
262K 토큰 컨텍스트를 활용하면 방대한 코드 저장소나 긴 문서를 한 번에 넣고 리팩터링을 맡길 수 있어요. 예를 들어 SWE-bench Pro가 측정하는 에이전트 코딩 작업이나, JobBench가 다루는 보고서 작성·일정 조율 같은 사무 업무에도 적용해볼 수 있어요.
에디터의 시선
이번 공개에서 눈에 띄는 대목은 따로 있어요. 알리바바가 차세대 Qwen4 아키텍처를 완성형이 아니라 프리뷰로 먼저 풀면서, 125B급 MoE 하나로 시장 반응부터 살피는 방식을 택했다는 점이에요. 지난 8월 14일 27B 덴스 모델을 내놓은 지 열흘 남짓 만에 5배 가까이 큰 모델을 다시 공개한 속도를 보면, 알리바바가 오픈웨이트 라인업을 촘촘하게 채워 앤스로픽·구글 같은 폐쇄형 모델 진영과 정면으로 붙는 전략을 굳힌 것으로 읽혀요.
큐원3.8-27B가 24GB 그래픽카드 한 장으로 돌아가는 실무형 모델이었다면, 이번 Qwen3.8-Flash-Next는 그보다 훨씬 크면서도 GPU 없이 메모리만으로 구동된다는 점에서 체감이 달라요. 이 정도 규모의 오픈 모델을 로컬에 올려 본 경험에 비추면, 대개는 여러 장의 GPU를 묶어야 했던 작업이 이제는 램이 넉넉한 워크스테이션 한 대로 옮겨가고 있다는 인상을 받아요.
국내 기업이라면 당장 서버 GPU를 늘리기보다, 메모리가 넉넉한 워크스테이션이나 DGX 스파크급 장비 한 대에 이런 모델을 먼저 붙여 코딩·문서 작업 파일럿을 돌려보는 편이 비용 대비 실속이 있어요. 다만 벤치마크가 알리바바와 언슬로스 자체 공개 수치라는 점은 감안하고, 사내 데이터로 직접 검증하는 절차를 건너뛰지 않는 게 좋아요.
몇 주 안에 언슬로스나 다른 커뮤니티가 이 모델의 독립 벤치마크나 파인튜닝 가이드를 내놓을 가능성이 커요. Qwen4 정식 버전이 언제 나올지도 이번 프리뷰의 반응에 달려 있다고 봐요.




댓글