METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

딥시크 v4 플래시 0731, RTX 4090·테슬라 P40 조합으로 로컬 구동 성공

DDR4 128GB에 GPU 두 장 더해 총 176GB 확보, 양자화별로 초당 2~3토큰 기록

딥시크 v4 플래시 0731, RTX 4090·테슬라 P40 조합으로 로컬 구동 성공

이미지: METAL

요약

  • 레딧 이용자가 RTX 4090과 Tesla P40, DDR4 128GB로 DeepSeek v4 Flash 0731을 로컬 구동했다
  • Unsloth 4bit K_XL 양자화는 약 144GB 용량에 초당 2토큰, MTP 적용 없이 구동됐다
  • IQ4_XS 양자화(약 127GB)에 MTP를 더해 초당 3토큰, 프롬프트 처리는 초당 30토큰을 기록했다
하드웨어 구성
RTX 4090 + Tesla P40, DDR4 RAM 128GB (총 176GB RAM+VRAM)
K_XL 양자화
약 144GB, 12k 컨텍스트에서 초당 2토큰(MTP 미적용)
IQ4_XS 양자화
디스크 약 127GB, MTP 포함 약 137GB, 초당 3토큰
프롬프트 처리 속도
5k+ 컨텍스트 기준 초당 약 30토큰
제약 사항
llama.cpp가 DeepSeek v4 Flash용 텐서 분할을 아직 지원하지 않음

레딧 커뮤니티 r/LocalLLaMA에 DeepSeek v4 Flash 0731을 소비자용 하드웨어로 로컬 구동한 사례가 공유됐다. 작성자는 DDR4 RAM을 32GB 스틱 2개로 교체해 최대 128GB까지 늘리고, RTX 4090과 Tesla P40을 함께 사용해 총 176GB의 RAM+VRAM을 확보했다고 밝혔다.

양자화별 성능 차이

Unsloth 4bit K_XL 양자화(약 144GB, 정확도 약 97%로 알려짐)를 12k 컨텍스트로 구동했을 때는 초당 약 2토큰이 나왔으며, 이때 메모리 부족으로 MTP(DSpark)는 적용하지 못했다. 이후 용량이 더 작은 IQ4_XS 양자화(디스크 기준 약 127GB, MTP 포함 시 약 137GB)로 전환해 MTP를 활성화한 결과 초당 약 3토큰, 5k+ 컨텍스트에서 프롬프트 처리 속도는 초당 약 30토큰까지 나왔다고 전했다.

GPU 순서·레이어 배치가 변수

llama.cpp의 -dev 플래그에서 GPU 순서를 CUDA0(RTX 4090)을 먼저 지정했을 때 프롬프트 처리 속도가 초당 40~80토큰까지 나왔지만, Tesla P40을 먼저 지정하면 초당 17토큰으로 떨어졌다고 밝혔다. 또한 Gated Delta Net 관련 미지원 연산 때문에 출력 레이어는 Tesla P40에 배치할 수 없어 임베딩·출력 레이어는 RTX 4090에, 일부 레이어는 P40과 CPU에 수동으로 나눠 배치했다고 설명했다.

작성자는 "llama.cpp가 DeepSeek v4 Flash에 대한 텐서 분할을 아직 지원하지 않아 레이어 단위로 분산해야 했다"고 전했다. 향후 llama.cpp 업데이트로 DSpark 지원과 속도가 개선될 수 있다는 전망도 함께 공유됐다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글