
요약
- tiny corp가 AMD 7900XTX를 USB3로 연결해 Qwen 3.6 27B를 초당 34토큰으로 구동한 데모를 공개했다.
- 이 방식을 지원하는 eGPU 도크는 12일 출시되며, 펌웨어를 100% 오픈소스로 공개한다고 밝혔다.
- 시리얼 통신용 USB 포트를 하나 더 달아 펌웨어가 깨져도 복구할 수 있게 만들었다는 설명이다.
- 구동 모델
- Qwen 3.6 27B
- 가속기
- AMD Radeon 7900XTX
- 연결 방식
- USB3
- 측정 속도
- 초당 34토큰
- 도크 출시
- 12일, 펌웨어 100% 오픈소스
- 복구 기능
- 시리얼용 USB 포트 추가로 브릭 방지
- 공개 주체·시점
- the tiny corp, 2026년 8월 10일 X 게시
초당 34토큰. 사람이 읽는 속도보다 빠르게 글자가 흘러나오는 수준이다. 그런데 이 속도가 나온 환경이 특이하다. 270억 파라미터급 모델이 돌아간 컴퓨터와 그래픽카드를 이어준 건 PCIe 슬롯이 아니라 그냥 USB 케이블이었다.
무엇을 보여줬나
tiny corp는 8월 10일 X에 AMD 7900XTX를 USB3로 연결해 Qwen 3.6 27B를 구동하는 영상을 올렸다. 회사는 "지난 10년 사이 만들어진 어떤 컴퓨터든" 된다고 적었다. 이 연결을 담당하는 외장 GPU(eGPU) 도크는 12일 출시되며, 펌웨어를 전부 오픈소스로 공개하고 시리얼 통신용 USB 포트를 하나 더 붙여 펌웨어 업데이트가 잘못돼도 기기가 죽지 않게 했다고 덧붙였다.
USB3가 왜 놀라운 일인가
노트북에 외장 그래픽카드를 붙이는 건 원래 까다로운 일이었다. 그래픽카드는 메인보드의 PCIe 슬롯에 꽂혀 초당 수십 기가바이트를 주고받도록 설계된 부품이고, 이걸 밖으로 빼내려면 Thunderbolt나 OCuLink처럼 PCIe 신호를 그대로 연장해주는 규격이 필요했다. Thunderbolt 포트는 최근 몇 년 사이 나온 중상급 노트북에나 달려 있다. 반면 USB3는 2010년대 초반 이후 사실상 모든 PC에 있다.
대역폭 차이는 여전히 크다. 하지만 언어 모델 추론은 대역폭에 대한 요구가 게임과 다르다. 모델 가중치를 한 번 GPU 메모리에 올려놓으면, 그 뒤로 오가는 건 입력 토큰과 출력 토큰 정도다. 무거운 계산은 전부 카드 안의 VRAM과 연산 유닛 사이에서 일어난다. 7900XTX는 24GB VRAM을 갖춘 상급 게이밍 카드고, 27B급 모델은 4비트 내외로 양자화하면 이 안에 들어간다. 즉 "짐을 옮기는 통로"가 좁아도 짐을 다 옮긴 뒤에는 성능이 크게 깎이지 않는다는 계산이다.
tiny corp라는 회사
tiny corp는 아이폰 해킹과 자율주행 오픈소스 프로젝트로 알려진 조지 호츠가 세운 회사다. 딥러닝 프레임워크 tinygrad를 만들고, 이를 얹은 완제품 AI 워크스테이션 tinybox를 팔아왔다. 이 팀의 일관된 관심사는 NVIDIA CUDA 생태계 밖에서, 특히 AMD 카드에서 소프트웨어 스택을 밑바닥부터 다시 짜는 일이다. AMD GPU 구동을 위해 제조사 드라이버를 우회하는 자체 구현을 해온 것으로 알려졌다. 도크 펌웨어를 전부 공개하고 복구용 시리얼 포트까지 넣은 것도 같은 태도의 연장선이다. 하드웨어에서 블랙박스를 줄이면 고장을 사용자가 직접 들여다볼 수 있다.
그래서 무엇이 달라지나
지난 1~2년 사이 20~30B 규모의 개방형 모델이 쏟아졌고, 이 크기는 상급 게이밍 그래픽카드 한 장에 얹을 수 있는 구간이다. 문제는 그 카드를 어디에 꽂느냐였다. 데스크톱 본체가 없는 사람, 사무실 노트북만 쓰는 사람에게 로컬 추론은 늘 한 단계 먼 얘기였다. USB3로 내려온 연결 규격은 그 문턱을 낮춘다. 낡은 미니PC나 오래된 노트북을 버리지 않고, 카드 한 장과 도크만 더해 개인용 추론 기계를 만드는 선택지가 생기는 셈이다.
다만 지금 확인된 건 회사가 공개한 데모 한 건과 초당 34토큰이라는 숫자다. 모델을 메모리에 올리는 초기 로딩 시간, 컨텍스트가 길어질 때의 거동, 여러 카드를 붙일 때의 확장성은 12일 실물이 풀리고 사용자들이 각자의 환경에서 돌려본 뒤에야 드러날 부분이다.





댓글