Mixture of Transformers Architecture
一种将多个分别处理图像、语言、动作等不同类型数据的Transformer组合在同一模型中协同运作的设计方式。
简单来说
Mixture of Transformers Architecture是一种在同一个AI模型里设置多个专门处理部件,让不同类型的数据由不同部件分工处理的设计方式。可以把它比作一所综合医院:内科、外科、影像科的医生各自在同一栋楼里诊治自己专长的领域,同时又围绕同一位患者协同会诊。这种结构也是如此,它把负责理解图像的部分、理解语言的部分、预测下一步动作的部分分开设置,并在需要时让它们互相交换信息。
为什么要这样划分呢?机械臂的动作、自动驾驶汽车所看到的道路状况、摄像头拍到的画面信息,性质差异很大,如果只用一种方式处理,很容易导致某一方面处理得不够到位。把各自擅长不同领域的部件分别训练好,再整合进一个模型中,就能让一个模型同时完成理解场景、预想接下来会发生的事情,以及决定机器人下一步动作这几项任务。
名字相近的结构还有专家混合(Mixture of Experts),但两者侧重点不同:专家混合是在同一类任务内只调用部分专家。而Mixture of Transformers的特点在于,它从一开始就把处理完全不同类型数据的多个专家整合进同一个模型系列之中。
在报道中是这样出现的
文章中提到:"Cosmos 3是基于Mixture of Transformers架构打造的开放物理AI基础全模态模型,将视觉推理、世界生成与动作预测整合进同一个模型系列。"这里,这种结构指的是让单一模型同时处理理解、想象与动作预测的设计原理,区别于简单地把多个不同模型拼接在一起。
