METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

AI 术语词典ㅎ报道中常见的技术词

混合专家架构

Mixture of Experts Architecture

一种AI设计方式,不使用整个模型,而是只挑选适合当前任务的部分专家组件来进行计算。

简单来说

用医院来比喻,混合专家架构就很容易理解了。综合医院里有几十位专科医生,但患者来了以后,并不是所有医生都同时给他看病。挂号处会先看症状,只叫来真正需要的几位专科医生。AI模型也是一样,内部设置了许多个小型"专家"组件,遇到问题时,只挑选其中一部分参与计算。

这样做的原因是,既想把模型做大,又想节省计算成本。即使模型的整体规模(总参数)大到数万亿,实际生成一次答案时真正动用的部分(激活参数)也只是其中一小部分。这样一来,既能保留大模型的知识和能力,又能把生成答案的速度和成本降到接近小模型的水平。

不过,这种结构规模大,并不代表性能或成本一定更有优势。实际效果很大程度上取决于挑选专家的方式有多精准,以及各个专家训练得有多好。

在报道中是这样出现的

文章将阿里巴巴的Qwen3.8 Max描述为"总参数达2.4T(2.4万亿)规模的MoE(Mixture of Experts,混合专家)结构"。这里容易产生的误解是,总参数数字大,并不代表模型就更聪明或更便宜。实际上,同一篇文章指出,Qwen3.8 Max在基准测试得分和单任务成本上都落后于开源模型Kimi K3。这个例子说明,模型体量(总参数)和实际性能、效率是两个不同的问题。

亲手试一试

以后看到新的LLM相关消息时,可以留意两个数字:总参数和激活参数。如果这两个数字分别标注出来,就说明这个模型采用了混合专家架构。两者差距越大,就可以理解为这个模型体量虽大,但实际计算成本被设计得更低。

相关词条

出现过这个词的报道

浏览全部词条