
이미지: @UnslothAI (X) 화면 갈무리
摘要
- Unsloth宣布,现在用24GB显存的显卡,或是免费的Kaggle笔记本,就能对Qwen3.8-27B进行微调。
- 据介绍,训练速度比FA2快约1.5倍,显存占用降到一半左右,且不损失精度。
- 资料显示,QLoRA只需22GB显存,LoRA需要36GB以上,而全参数微调(FFT)的显存需求还要再高出约4倍。
- 지원 방식
- Unsloth 무료 Kaggle 노트북 — Conversational(비전 옵션), RL GRPO
- 로컬 훈련 최소 사양
- 24GB VRAM (QLoRA는 22GB에서도 가능)
- 훈련 성능
- FA2 대비 약 1.5배 빠름, VRAM 약 50% 절감, 정확도 손실 없음
- LoRA 요구 VRAM
- 36GB 초과
- 전체 파인튜닝(FFT)
- VRAM 약 4배 소요
- Kaggle 무료 GPU
- 2× Tesla T4, 30시간 제공
- 모델 사양
- 밀집형 27B 통합 비전-언어 모델, 텍스트·이미지·영상 지원, 사고 제어, 262K 컨텍스트
- 4비트 양자화 모델명
- Qwen3.8-27B-unsloth-bnb-4bit
在自己的GPU上训练270亿参数模型
一张主流游戏显卡的显存通常是24GB。用这么点内存就能对一个拥有270亿参数的模型进行完整的追加训练,这在过去是难以想象的事。开发工具公司Unsloth在其X账号上宣布,他们已经为阿里巴巴Qwen系列最新模型Qwen3.8-27B支持了这项功能。
Qwen是阿里巴巴自主训练推出的模型系列。今年8月14日,Qwen3.8-27B以Apache 2.0许可证开放了权重,发布后立刻登上Hugging Face热门榜首位,还出现过在用户对比测试中超越Google Gemini 3.7 Flash的案例。这些内容此前在《Qwen3.8-27B,笔记本上跑赢Gemini 3.7 Flash》一文中已有报道。这次的消息是后续进展——把已经公开的模型真正拿到手上,按照自己的需求重新训练。
具体改变了什么
Unsloth是一款支持微调的工具,能把训练好的模型针对特定用途进行追加训练。根据其官方GitHub说明,用Unsloth训练Qwen3.8-27B,速度比传统FA2(Flash Attention 2)方案快约1.5倍,显存占用只需原来的一半左右,且不会损失精度。这样的效率提升,来自一种名为Flash Linear Attention内核的运算优化技术。
不同训练方式所需的显存门槛也各不相同。只冻结大部分模型参数、只对一小部分进行低成本训练的QLoRA,22GB显存就能跑;LoRA则需要超过36GB。对整个模型重新训练的全参数微调(FFT),所需显存要比QLoRA再高出约4倍,这在训练指南文档中有说明。此外,该工具也支持强化学习(RL)方式的训练,同样可以在免费环境或22GB显存下完成。
具体怎么上手
即便没有自己的GPU,也可以开始尝试。Unsloth通过Kaggle提供的免费笔记本打开了入门通道。Kaggle是Google运营的服务,和Google Colab类似,可以免费借用两块Tesla T4 GPU,时长30小时。
- 打开Unsloth提供的对话式(Conversational)笔记本,或用于强化学习的RL GRPO笔记本,任选其一即可。
- 在对话式笔记本中可以开启视觉功能;在RL笔记本中只需把模型指定为Qwen3.8,训练准备就完成了。
- 加载经过4比特压缩的
Qwen3.8-27B-unsloth-bnb-4bit模型,以QLoRA方式开始训练。 - 训练完成的模型可以导出为NVFP4、FP8、GGUF等多种所需格式。
如果本身就配有GPU,也可以下载适用于macOS、Windows、Linux的Unsloth桌面应用,直接在本地开始训练。如果只用文本数据做监督微调(SFT),只需按照下面的方式准备一个包含text列、且已按Qwen对话模板渲染好的数据集即可。
python from unsloth import FastModel from datasets import load_dataset from trl import SFTTrainer, SFTConfig
max_seq_length = 2048 model, tokenizer = FastModel.from_pretrained( model_name = "unsloth/Qwen3.8-27B-unsloth-bnb-4bit", max_seq_length = max_seq_length, load_in_4bit = True, full_finetuning = False,
举例来说,把企业内部的客服对话记录做成数据集,在对话式笔记本中用QLoRA训练,就能打造出符合特定语气、掌握业务知识的聊天机器人模型。如果是带图片的说明书类数据,也可以开启视觉选项,训练出专门用于文档理解的模型。
各方式所需资源对比
| 训练方式 | 所需显存 | 备注 |
|---|---|---|
| QLoRA | 22GB | 免费Kaggle笔记本也可运行 |
| LoRA | 超过36GB | — |
| 全参数微调(FFT) | 约为QLoRA的4倍 | 适用于需要高精度的场景 |
| RL(GRPO) | 免费或22GB | 强化学习方式 |
安装方法和笔记本链接可以在github.com/unslothai/unsloth仓库中查看。
编辑视角
开放权重模型再多,真正能拿到手上、按自己的数据改造它的人却是少数。业内一直以为,要对270亿参数级别的模型做像样的微调,必须用到A100、H100这类数据中心级GPU。而这次的发布,把这条门槛拉低到了一张游戏显卡,甚至免费云端GPU都能达到的水平,这才是它的意义所在。Qwen3.8-27B发布后立刻登顶Hugging Face热门榜,还出现超越Gemini 3.7 Flash的对比案例,这背后离不开像这样能让个人开发者立刻上手改造的训练工具的配合。
在实际工作中用过这类规模模型的微调工具,得出的结论往往差不多:先用QLoRA这类轻量方式确认方向对不对,再决定要不要转向全参数微调,这才是最省时间和GPU成本的顺序。对于国内的创业公司或企业内部AI团队来说,合理的做法是先拿自家数据做QLoRA实验。免费Kaggle笔记本的30小时,跑完一个小规模数据集的实验绰绰有余,如果效果不错,那时再考虑自购GPU或租用云端资源也不迟。
不过,想一上来就对支持26.2万上下文、还能处理视觉与视频输入的模型做整体重训,现在还为时过早。FFT要多耗费4倍显存,值不值得投入这些资源,应该先在QLoRA阶段验证清楚。预计未来几周内,会有不少针对特定业务场景重新训练出的衍生版本陆续出现在Hugging Face上。在开放权重模型和轻量训练工具相互配合的这波趋势中,下一轮竞争的焦点,大概会落在把这套组合打造成标准开发环境的工具厂商之间。




评论