每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

DeepSeek v4 Flash 0731,RTX 4090与Tesla P40组合本地运行成功

DDR4 128GB加两块GPU共获176GB容量,不同量化方案下每秒可跑2~3个token

이미지: METAL LAB 생성

摘要

  • 一位Reddit用户使用RTX 4090、Tesla P40和DDR4 128GB在本地运行了DeepSeek v4 Flash 0731
  • Unsloth 4bit K_XL量化方案容量约144GB,未启用MTP的情况下达到每秒2个token
  • IQ4_XS量化方案(约127GB)配合MTP后达到每秒3个token,提示词处理速度为每秒30个token
하드웨어 구성
RTX 4090 + Tesla P40, DDR4 RAM 128GB (총 176GB RAM+VRAM)
K_XL 양자화
약 144GB, 12k 컨텍스트에서 초당 2토큰(MTP 미적용)
IQ4_XS 양자화
디스크 약 127GB, MTP 포함 약 137GB, 초당 3토큰
프롬프트 처리 속도
5k+ 컨텍스트 기준 초당 약 30토큰
제약 사항
llama.cpp가 DeepSeek v4 Flash용 텐서 분할을 아직 지원하지 않음

Reddit社区r/LocalLLaMA上有人分享了用消费级硬件本地运行DeepSeek v4 Flash 0731的案例。作者表示,将DDR4内存换成2条32GB内存条,扩容至最大128GB,并同时使用RTX 4090和Tesla P40,共获得176GB的内存+显存容量。

不同量化方案性能差异

在12k上下文下运行Unsloth 4bit K_XL量化方案(容量约144GB,据称精度约97%)时,速度约为每秒2个token,且因内存不足未能启用MTP(DSpark)。之后切换为容量更小的IQ4_XS量化方案(磁盘占用约127GB,加上MTP后约137GB)并启用MTP,结果达到每秒约3个token,在5k+上下文下提示词处理速度达到每秒约30个token。

GPU顺序与层级分配是关键变量

在llama.cpp的-dev参数中,若将CUDA0(RTX 4090)指定在前,提示词处理速度可达每秒40~80个token;但若将Tesla P40指定在前,速度则降至每秒17个token。此外,由于Gated Delta Net相关运算不受支持,输出层无法放置在Tesla P40上,因此将嵌入层和输出层放在RTX 4090上,部分层则手动分配到P40和CPU上。

作者表示:"llama.cpp目前还不支持针对DeepSeek v4 Flash的张量分割,所以只能按层进行分布式部署"。同时也有人预测,未来随着llama.cpp更新,对DSpark的支持和运行速度有望得到改善。