每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

USB3接口连接GPU,270亿参数模型跑出每秒34个token

tiny corp公开了通过USB3连接7900XTX运行Qwen 3.6 27B的视频,配套底座将于12日发售

이미지: METAL LAB 생성

摘要

  • tiny corp公开了通过USB3连接AMD 7900XTX、以每秒34个token的速度运行Qwen 3.6 27B的演示。
  • 支持该方式的eGPU底座将于12日发售,公司表示固件将100%开源公开。
  • 据悉底座还额外配备了一个用于串口通信的USB端口,即便固件损坏也能进行恢复。
구동 모델
Qwen 3.6 27B
가속기
AMD Radeon 7900XTX
연결 방식
USB3
측정 속도
초당 34토큰
도크 출시
12일, 펌웨어 100% 오픈소스
복구 기능
시리얼용 USB 포트 추가로 브릭 방지
공개 주체·시점
the tiny corp, 2026년 8월 10일 X 게시

每秒34个token。这已经达到了文字流出速度快于人类阅读速度的水平。但跑出这一速度的环境却颇为特别。连接运行270亿参数级模型的电脑和显卡的,不是PCIe插槽,而只是一根USB线缆。

展示了什么

tiny corp于8月10日在X上发布了一段视频,展示通过USB3连接AMD 7900XTX运行Qwen 3.6 27B的过程。公司写道,"过去十年间制造的任何电脑"都可以做到。负责这一连接的外置GPU(eGPU)底座将于12日发售,公司还表示将把固件全部开源公开,并额外增加一个用于串口通信的USB端口,以防固件更新出错导致设备无法使用。

USB3为何令人惊讶

给笔记本电脑外接显卡原本是件棘手的事。显卡是插在主板PCIe插槽上、设计用来实现每秒数十GB数据吞吐的部件,要把它挪到机箱外面,就需要Thunderbolt或OCuLink这类能够原样延伸PCIe信号的规格接口。Thunderbolt接口只在近几年推出的中高端笔记本上才有配备。相比之下,USB3自2010年代初以来几乎所有PC都具备。

带宽差距依然很大。但语言模型推理对带宽的需求与游戏不同。模型权重一旦加载到GPU显存中,之后往来传输的基本只是输入和输出的token而已。繁重的计算全部发生在显卡内部的VRAM与运算单元之间。7900XTX是配备24GB VRAM的高端游戏显卡,27B级别的模型经过4比特左右的量化后可以装入其中。也就是说,即便"搬运通道"较窄,只要把货物搬完,性能也不会有太大折损。

tiny corp是一家怎样的公司

tiny corp是以iPhone破解和自动驾驶开源项目闻名的乔治·霍兹(George Hotz)创立的公司。该公司开发了深度学习框架tinygrad,并推出搭载该框架的成品AI工作站tinybox进行销售。这个团队一贯关注的方向,是在NVIDIA CUDA生态系统之外、尤其是在AMD显卡上从零重写软件栈。据悉该团队曾自行实现绕过厂商驱动来驱动AMD GPU的方案。此次将底座固件全部公开、并加入用于恢复的串口,也是这种态度的延续。硬件中的黑箱越少,用户就越能亲自排查故障。

那么会带来什么变化

过去一两年间,20-30B规模的开放模型大量涌现,而这一规模正好是一张高端游戏显卡能够承载的区间。问题在于这张显卡该插在哪里。对于没有台式机主机、只用办公笔记本的人来说,本地推理一直是一件遥不可及的事。如今降临的USB3连接规格,降低了这道门槛。不必丢弃旧的迷你PC或老笔记本,只需添置一张显卡和一个底座,就能拥有打造个人推理机器的新选择。

不过目前能确认的,只是公司公开的这一份演示和每秒34个token这个数字。加载模型到内存所需的初始时间、上下文变长时的表现、连接多张显卡时的扩展性等问题,恐怕要等到12日实物发售、用户在各自环境中实际运行之后才能见分晓。