鲲鹏昇腾AI智算系统最佳实践分享干货-2026年KADC大会
https://mp.weixin.qq.com/s/rLuYErGrLowk2VMUM8mXcQ
半导体Fellow廖博士的分享,全文干货,从大模型业务训练推理的业务需求出发,从芯片设计到组网交付业务调优端到端的实践交付能力。
关键内容总结如下:
| 序号 | 内容 | 备注 |
| 1、 | 四大关键指标:算力、内存带宽、内存容量、互联带宽在推理和训练场景的需求差异: 训练:算容宽 推理P:算宽容 推理D:宽容算 | 算存网规格 |
| 2、 | 层次化内聚化的通信需求,决定了超节点适当的规模。 Native UB SSD。 | 通信需求 |
| 3、 | 基于成本控制和业务需求设计合适的SU(Scale Up)域 | 组网设计 |
| 4、 | 大模型推理对低延迟要求越来越高。EP(Expert Parallelism)中Dispatch-Combine(分发-合并)的通信是关键 | 网络需求 |
| 5、 | 离散高频次的小数据传输Load/Store适用与MoE模型; 连续的大块数据传送Ur DMA(Unified Bus Remote DMA) | 网络需求 |
| 6、 | 延迟和抖动的优化,反常识的单路径设计 | 网络需求 |
| 7、 | 计算存储(HBM、DDR、SSD、SSU)协同优化,应对KV Ccache挑战,400G UB端口的SSD,带宽远高于通过网卡访问 | 存储需求 |
| 8、 | NPU跨SU/SO直接访问SSD | 存储需求 |
| 9、 | CPU扩充,SU和SO的选择 | 通算扩展 |
| 10、 | 万卡超节点系统网络实践 | 组网设计 |
| 11、 | 芯片到软件的深度协同 | 集成优化 |

1、
四大关键指标:算力、内存带宽、内存容量、互联带宽在推理和训练场景的需求差异:
训练:算容宽
推理P:算宽容
推理D:宽容算

2、
层次化内聚化的通信需求,决定了超节点适当的规模。
Native UB SSD。
3、基于成本控制和业务需求设计合适的SU(Scale Up)域

4、大模型推理对低延迟要求越来越高。EP(Expert Parallelism)中Dispatch-Combine(分发-合并)的通信是关键

5、
离散高频次的小数据传输Load/Store适用与MoE模型;
连续的大块数据传送Ur DMA(Unified Bus Remote DMA)

6、延迟和抖动的优化,反常识的设计

7、计算存储(HBM、DDR、SSD、SSU)协同优化,应对KV Ccache挑战,400G UB端口的SSD,带宽远高于通过网卡访问,远高于基于NvME SSD
8、NPU跨SU/SO直接访问SSD

9、CPU扩充,SU和SO的选择

10、万卡超节点系统网络实践

11、芯片到软件的深度协同
更多推荐


所有评论(0)