https://mp.weixin.qq.com/s/rLuYErGrLowk2VMUM8mXcQ

半导体Fellow廖博士的分享,全文干货,从大模型业务训练推理的业务需求出发,从芯片设计到组网交付业务调优端到端的实践交付能力。

关键内容总结如下:

序号

内容

备注

1、

四大关键指标:算力、内存带宽、内存容量、互联带宽在推理和训练场景的需求差异:

训练:算容宽  

推理P:算宽容

推理D:宽容算

算存网规格

2、

层次化内聚化的通信需求,决定了超节点适当的规模。

Native UB SSD。

通信需求

3、

基于成本控制和业务需求设计合适的SU(Scale Up)域

组网设计

4、

大模型推理对低延迟要求越来越高。EP(Expert Parallelism)中Dispatch-Combine(分发-合并)的通信是关键

网络需求

5、

离散高频次的小数据传输Load/Store适用与MoE模型;

连续的大块数据传送Ur DMA(Unified Bus Remote DMA)

网络需求

6、

延迟和抖动的优化,反常识的单路径设计

网络需求

7、

计算存储(HBM、DDR、SSD、SSU)协同优化,应对KV Ccache挑战,400G UB端口的SSD,带宽远高于通过网卡访问

存储需求

8、

NPU跨SU/SO直接访问SSD

存储需求

9、

CPU扩充,SU和SO的选择

通算扩展

10、

万卡超节点系统网络实践

组网设计

11、

芯片到软件的深度协同

集成优化

图片

1、

四大关键指标:算力、内存带宽、内存容量、互联带宽在推理和训练场景的需求差异:

训练:算容宽  

推理P:算宽容

推理D:宽容算

图片

2、

层次化内聚化的通信需求,决定了超节点适当的规模。

Native UB SSD。

3、基于成本控制和业务需求设计合适的SU(Scale Up)域

图片

4、大模型推理对低延迟要求越来越高。EP(Expert Parallelism)中Dispatch-Combine(分发-合并)的通信是关键

图片

5、

离散高频次的小数据传输Load/Store适用与MoE模型;

连续的大块数据传送Ur DMA(Unified Bus Remote DMA)

图片

6、延迟和抖动的优化,反常识的设计

图片

7、计算存储(HBM、DDR、SSD、SSU)协同优化,应对KV Ccache挑战,400G UB端口的SSD,带宽远高于通过网卡访问,远高于基于NvME SSD

8、NPU跨SU/SO直接访问SSD

图片

9、CPU扩充,SU和SO的选择

图片

10、万卡超节点系统网络实践

图片

11、芯片到软件的深度协同

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐