登录社区云,与社区用户共同成长
邀请您加入社区
本文详解如何利用 HIPify 工具将大模型代码从 CUDA 迁移至 AMD ROCm 平台。通过 PyTorch 自定义算子实战,分享内存管理与内核优化经验,并介绍 TileLang 及 Triton 分支在 MI300X 上的应用,助力开发者高效完成 GPU 算力迁移。
本文精选 GitHub 上高活跃度的 ROCm 项目,涵盖 HIPify 代码迁移、SGLang 与 TileLang 推理加速及 LLaMA-Factory 微调实践。助开发者避开僵尸仓库,掌握 AMD GPU 生态核心工具,高效构建大模型应用。