
이미지: METAL LAB 생성
摘要
- Reddit用户Atretador发布了开源工具"Unswarm",可以把多个本地LLM运行环境整合到一个统一的代理中管理。
- 只要提前注册好容器或bash脚本,请求进来时它就会自动启动所需的运行环境,排队处理并以流式方式返回结果。
- 这款工具主要面向同时使用MI50、P100、P40等多张老旧GPU的用户,既可以部署在VPS上远程访问,也支持分布到多台机器上并行运行。
- 프로젝트명
- Unswarm(언스웜)
- 개발자
- 레딧 이용자 u/Atretador (개인 프로젝트)
- 공개 시점·채널
- 2026년 8월 23일, r/LocalLLaMA
- 저장소
- github.com/atretador/unswarm
- 핵심 기능
- 런타임 등록, 동시 실행 규칙, 요청 큐잉, API 프록시
- 겨냥 하드웨어
- MI50·P100·MI25·P40 등 구형 GPU
- 알려진 한계
- 세션 중 모델 전환 시 캐시 히트율 손실
多个容器、多套脚本……本地LLM运维者的共同烦恼
只要在本地同时跑过几个LLM的人,都会对这个场景很熟悉:每个模型用的推理引擎不一样,有的得用Docker容器启动,有的一个bash脚本就够了。Reddit用户Atretador亲身经历了这个问题后,把一款名为Unswarm的开源工具上传到github.com/atretador/unswarm仓库,并在r/LocalLLaMA上公开分享。他在2026年8月23日发布的帖子中写道:"每个模型用的fork、容器和引擎都不一样,只能一个个手动管理。"
他特别举了同时运行MI50、P100、MI25、P40等好几代老GPU的场景为例。这类老卡经常和最新的操作系统软件包发生冲突,与其硬碰硬,不如用容器把它们隔离开来运行,这样反而更省心。
Unswarm能做什么
顾名思义,Unswarm是一款把多个模型像蜂群(swarm)一样统一管理的运行时管理器兼代理工具。用户把自己原本就在用的容器或bash运行脚本注册进Unswarm,再设定哪些运行环境可以同时运行的规则,Unswarm就会按照这些规则把请求排队处理。
接下来,只要配置好API密钥,并把Unswarm作为一个统一的提供方(provider)注册到Claude Code或Codex这类编码工具中,即便背后实际是好几个运行环境各自独立启动,代理层也会让它们看起来像是所有模型都在同时对外服务。在编码工具里选好模型发送消息后,请求会进入队列;如果对应的运行环境还没启动,Unswarm会自动把它拉起来,再把响应以流式方式返回。
Atretador特别强调,Unswarm只是一个管理"已经跑得好好的"模型的工具,并不是用来调优模型本身的平台。他也提到,会话过程中切换模型会导致缓存命中率下降,这是无法避免的副作用。
具体怎么用
要使用Unswarm,需要先从github.com/atretador/unswarm仓库获取代码,自行搭建部署。
- 把自己使用的容器或bash运行脚本逐一注册到Unswarm中。
- 设定哪些运行环境可以同时运行的规则。在VRAM有限的环境下,可以限制只允许特定组合同时运行。
- 生成API密钥,并把Unswarm作为provider注册到正在使用的编码工具(例如Claude Code、Codex)中。
- 在编码工具中选好想用的模型并发送消息,请求会进入队列;如果所需的运行环境处于关闭状态,系统会自动启动它并以流式方式返回响应。
这款工具不仅可以在个人电脑上使用,也可以部署到VPS(虚拟专用服务器)上,实现随时随地访问自己的模型;同时还支持按不同智能体分别部署到多台机器上并行运行。
多智能体配置示例
Atretador以同时使用24GB和16GB显卡的场景为例,展示了用Unswarm可以搭建出怎样的组合。
| 分组 | 角色 | 模型示例 | 运行方式 |
|---|---|---|---|
| 分组1 | 编排器 | Qwen 3.8 27B A3B | 始终运行 |
| 分组2 | 代码库检索 | Qwen 3.5 9B | 按需切换 |
| 分组2 | 执行器 | Qwen 3.6 35B A3B | 按需切换 |
| 分组2 | 设计器 | 独立微调模型 | 按需切换 |
指挥整体任务的编排器一直保持开启,而代码检索、执行、设计这类根据情况变化的子智能体则只在需要时才被调用。对于VRAM不够宽裕、想要分角色运行多个模型的人来说,这种配置值得参考。
编辑视角
看着Unswarm这类工具,会让人觉得本地LLM生态的关注点正在发生转移:从"该用哪个模型"变成了"多个模型该怎么一起运行"。Ollama、vLLM这类运行工具,一直专注于把单个模型按照各自的方式服务好。而真正需要同时使用多个运行工具和容器的人所需要的编排层,往往不是由公司来补上,而是像这次一样,由个人开发者出于实际需求自己动手填补空白。
如果你曾经用好几张8GB到24GB的二手服务器GPU跑过本地LLM,一定懂这种烦躁感。为了换一个模型就得手动把容器关掉再启动,反复几次之后就会发现,花在运维脚本上的时间,居然比研究模型性能本身还多。Unswarm相当于在这些重复劳动之上,加了一层用规则和队列自动处理的薄薄的中间层。
如果是在公司内部自建服务器上同时测试多个LLM的团队,这类代理层能起到类似部署一个API网关的效果。不过缓存命中率的损失,看数字或许显得微不足道,但在实际工作负载中会直接体现为响应延迟的增加。所以在接入这类工具之前,最好先想清楚哪些是需要频繁切换的子智能体、哪些是必须一直保持在线的编排器,把这个结构先规划好。
未来几周内,这类个人项目很可能会被Ollama、vLLM等主流运行工具吸收为官方功能,也有可能反过来带动更多社区分支涌现,逐步扩大对AMD老款显卡等特定硬件的支持。




评论