METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

DeepSeek v4 Flash 0731,RTX 4090与Tesla P40组合本地运行成功

DDR4 128GB加两块GPU共获176GB容量,不同量化方案下每秒可跑2~3个token

DeepSeek v4 Flash 0731,RTX 4090与Tesla P40组合本地运行成功

图片:METAL

摘要

  • 一位Reddit用户使用RTX 4090、Tesla P40和DDR4 128GB在本地运行了DeepSeek v4 Flash 0731
  • Unsloth 4bit K_XL量化方案容量约144GB,未启用MTP的情况下达到每秒2个token
  • IQ4_XS量化方案(约127GB)配合MTP后达到每秒3个token,提示词处理速度为每秒30个token

Reddit社区r/LocalLLaMA上有人分享了用消费级硬件本地运行DeepSeek v4 Flash 0731的案例。作者表示,将DDR4内存换成2条32GB内存条,扩容至最大128GB,并同时使用RTX 4090和Tesla P40,共获得176GB的内存+显存容量。

不同量化方案性能差异

在12k上下文下运行Unsloth 4bit K_XL量化方案(容量约144GB,据称精度约97%)时,速度约为每秒2个token,且因内存不足未能启用MTP(DSpark)。之后切换为容量更小的IQ4_XS量化方案(磁盘占用约127GB,加上MTP后约137GB)并启用MTP,结果达到每秒约3个token,在5k+上下文下提示词处理速度达到每秒约30个token。

GPU顺序与层级分配是关键变量

在llama.cpp的-dev参数中,若将CUDA0(RTX 4090)指定在前,提示词处理速度可达每秒40~80个token;但若将Tesla P40指定在前,速度则降至每秒17个token。此外,由于Gated Delta Net相关运算不受支持,输出层无法放置在Tesla P40上,因此将嵌入层和输出层放在RTX 4090上,部分层则手动分配到P40和CPU上。

作者表示:"llama.cpp目前还不支持针对DeepSeek v4 Flash的张量分割,所以只能按层进行分布式部署"。同时也有人预测,未来随着llama.cpp更新,对DSpark的支持和运行速度有望得到改善。

评论