DGX Spark 2대·3대·4대 연결하는 법, 엔비디아 공식 가이드로 확정
2대와 3대는 QSFP 케이블 직결, 4대는 스위치 필수. 승인 케이블과 자동 설정 도구까지 공식 문서에 담겼어요
vLLM은 대규모 언어모델을 여러 사용자에게 동시에 서비스할 수 있도록 추론 속도와 메모리 효율을 높이는 오픈소스 추론 엔진이다. 대표 기술로는 GPU 메모리를 페이지 단위로 관리해 처리량을 끌어올리는 페이지드어텐션 기법이 꼽힌다. vLLM은 특정 기업이 판매하는 상용 제품이 아니라 커뮤니티 메인테이너들이 개발과 배포를 이끄는 오픈소스 프로젝트다. 2026년 8월 vLLM의 리드 메인테이너는 50만 GPU 규모의 오픈모델 운영 경험을 공개하며 대규모 추론 인프라 운영 사례를 알렸다.
현재 순위 (1M)
23위
최근 30일 순위 추이
2026.08.18 – 2026.09.16 · 최고 14위 · 최저 23위 · 현재 23위
2대와 3대는 QSFP 케이블 직결, 4대는 스위치 필수. 승인 케이블과 자동 설정 도구까지 공식 문서에 담겼어요
국채 금리 급등이 아시아 AI 주가 랠리를 위협하는 가운데, AMD의 차세대 서버 칩과 GPT-5.6 요금 인하, 오픈소스 모델·인프라 논의가 하루를 채웠다.
알리바바 큐원이 27B 멀티모달 모델의 가중치를 통째로 풀었다. 4비트로 17.9GB — 그래픽카드 한 장에 들어가는 크기인데, 공식 표에서는 클로드 오퍼스 4.6 맥스를 여러 항목에서 앞선다.