每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

法语专用小型AI"Luth-2" 超越三倍体量模型

0.8B、2B参数模型在法语基准测试中对阵大型模型并占据上风

이미지: METAL LAB 생성

摘要

  • kurakurai发布了法语专用小型语言模型Luth-2-0.8B和Luth-2-2B
  • 两款模型在Multi-IF、MGSM-Rev2、Math-500等测试中超过了体量三倍大的模型
  • 以Qwen3.5为骨干,结合30亿token规模的SFT、强化学习与多领域在线策略蒸馏
모델명
Luth-2-0.8B, Luth-2-2B
유형
non-reasoning 소형언어모델(SLM)
백본 모델
Qwen3.5
공개처
Hugging Face (GGUF 양자화 버전 포함)
주요 벤치마크
Multi-IF 69.67(2B) vs Gemma-4-E2B-it 65.17, MGSM-Rev2 72.92(0.8B) vs granite-4.0-h-micro 55.60

20亿参数超越60亿级模型

开发团队kurakurai发布了专为法语打造的小型语言模型Luth-2-0.8B和Luth-2-2B。两款模型参数规模分别为8亿和20亿,体量足以在智能手机或笔记本电脑上运行。两款模型均采用不经过额外推理过程、直接输出答案的"非推理型"方式构建。

从公开的基准测试分数来看,体量差距十分明显。Luth-2-2B在衡量指令执行能力的Multi-IF测试中获得69.67分,超过体量约三倍的Gemma-4-E2B-it(65.17分)。在数学推理基准MGSM-Rev2中,Luth-2-0.8B以72.92分的成绩大幅领先granite-4.0-h-micro(55.60分)。在Math-500测试中,Luth-2-2B也以81.52分的成绩小幅领先Gemma-4-E2B-it(81.24分)。

为何在法语上取得这样的结果

小型语言模型(SLM)是指在尽可能保持大型模型性能的同时缩小体量的模型,是在智能手机或个人电脑上无需联网运行端侧AI的核心要素。问题在于,非英语语言的性能往往会大幅下降,而据团队解释,即便是像法语这样训练数据相对丰富的语言也不例外。

Luth-2为缩小这一差距改变了三个方面。首先,团队重新构建了涵盖数学、知识、代码、工具调用、指令遵循、多轮对话、科学等领域的30亿token规模监督学习(SFT)数据。在此基础上,还加入了针对各专家领域的特化强化学习,以及多领域在线策略蒸馏(MOPD)——一种将大模型的最新判断实时移植到小模型中的训练方法。骨干网络也从上一代基础模型换成了Qwen3.5,团队表示该模型对后训练(post-training)的响应效果要好得多。

Qwen系列为骨架、推出针对各国语言或特定领域定制的衍生模型的趋势,在最近几周尤为突出。Qwen团队在8月初发布支持30种语言及22种中国方言的轻量语音识别模型Qwen3-ASR-0.6B,也属于这一脉络。

Qwen发布轻量语音识别模型Qwen3-ASR-0.6B

Qwen发布轻量语音识别模型Qwen3-ASR-0.6B

这意味着什么

Luth-2不仅公开了模型权重,还一并公开了训练所用的SFT、RL数据集以及训练代码。此外还设有专门比较法语性能的排行榜,为开发者直接复现或将同一方法论迁移到其他语言留出了空间。尤其是8亿参数模型在数学基准测试中超越体量近五倍的模型这一结果,被视为一个信号:通过精细的语言专项调优,即便不扩大体量也能缩小差距。