拓扑感知并行化
topology-aware parallelization
在拆分大规模AI模型训练任务时,考虑芯片之间实际连接方式的一种方法
简单来说
拓扑感知并行化是指在训练超大型AI模型时,把任务分配给成百上千个芯片处理,并且在分配之前先了解这些芯片之间连接得有多近或多远的一种策略。
可以想象一个大工厂在组装零件。用传送带直接相连的工作台之间频繁传递零件也没问题,但如果工作台位于建筑物两端,却还要频繁往返传递零件,就会浪费大量时间。AI芯片也是同样的道理。用线路紧密相连的芯片之间即使频繁交换信息,速度也很快;但相距很远的芯片之间如果频繁交换信息,速度就会大幅下降。拓扑感知并行化就是提前掌握这种连接结构(拓扑),把需要频繁沟通的任务分配给彼此靠近的芯片,把沟通较少的任务分配给距离较远的芯片。
这种任务分配策略对参数量极其庞大的模型影响尤其显著,尤其是由多个较小的专家模型组合运作的结构(相关概念请参见混合专家词条)。芯片数量越多,如果没有妥善考虑连接结构,通信延迟就会像滚雪球一样越滚越大。
在报道中是这样出现的
文章中常见的说法是:"正在研究最多1,024个Trainium芯片上、参数规模最高达一万亿的混合专家模型的拓扑感知并行化策略。"这并非指某个具体产品名称,而是指设计大规模并行训练的一种研究方法论。需要注意的是,这并非亚马逊自己开发的策略,而是获得亚马逊计算资源支持的大学研究团队(UIUC)正在研究的课题。
