鲲鹏昇腾AI智算系统最佳实践分享干货-2026年KADC大会
https://mp.weixin.qq.com/s/rLuYErGrLowk2VMUM8mXcQ
半导体Fellow廖博士的分享,全文干货,从大模型业务训练推理的业务需求出发,从芯片设计到组网交付业务调优端到端的实践交付能力。
关键内容总结如下:
|
序号 |
内容 |
备注 |
|
1、 |
四大关键指标:算力、内存带宽、内存容量、互联带宽在推理和训练场景的需求差异: 训练:算容宽 推理P:算宽容 推理D:宽容算 |
算存网规格 |
|
2、 |
层次化内聚化的通信需求,决定了超节点适当的规模。 Native UB SSD。 |
通信需求 |
|
3、 |
基于成本控制和业务需求设计合适的SU(Scale Up)域 |
组网设计 |
|
4、 |
大模型推理对低延迟要求越来越高。EP(Expert Parallelism)中Dispatch-Combine(分发-合并)的通信是关键 |
网络需求 |
|
5、 |
离散高频次的小数据传输Load/Store适用与MoE模型; 连续的大块数据传送Ur DMA(Unified Bus Remote DMA) |
网络需求 |
|
6、 |
延迟和抖动的优化,反常识的单路径设计 |
网络需求 |
|
7、 |
计算存储(HBM、DDR、SSD、SSU)协同优化,应对KV Ccache挑战,400G UB端口的SSD,带宽远高于通过网卡访问 |
存储需求 |
|
8、 |
NPU跨SU/SO直接访问SSD |
存储需求 |
|
9、 |
CPU扩充,SU和SO的选择 |
通算扩展 |
|
10、 |
万卡超节点系统网络实践 |
组网设计 |
|
11、 |
芯片到软件的深度协同 |
集成优化 |

1、
四大关键指标:算力、内存带宽、内存容量、互联带宽在推理和训练场景的需求差异:
训练:算容宽
推理P:算宽容
推理D:宽容算

2、
层次化内聚化的通信需求,决定了超节点适当的规模。
Native UB SSD。
3、基于成本控制和业务需求设计合适的SU(Scale Up)域

4、大模型推理对低延迟要求越来越高。EP(Expert Parallelism)中Dispatch-Combine(分发-合并)的通信是关键

5、
离散高频次的小数据传输Load/Store适用与MoE模型;
连续的大块数据传送Ur DMA(Unified Bus Remote DMA)

6、延迟和抖动的优化,反常识的设计

7、计算存储(HBM、DDR、SSD、SSU)协同优化,应对KV Ccache挑战,400G UB端口的SSD,带宽远高于通过网卡访问,远高于基于NvME SSD
8、NPU跨SU/SO直接访问SSD

9、CPU扩充,SU和SO的选择

10、万卡超节点系统网络实践

11、芯片到软件的深度协同
更多推荐




所有评论(0)