从理论到实践:Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2模型在Linux系统下的环境配置完全指南
·
从理论到实践:Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2模型在Linux系统下的环境配置完全指南
Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2是基于AMD MI350/MI355硬件优化的大语言模型,采用MXFP4量化技术实现高效推理。本文将详细介绍在Linux系统下从环境准备到模型部署的完整流程,帮助新手用户快速搭建可用的AI推理环境。
📋 系统环境要求
硬件兼容性
- 推荐GPU:AMD MI350/MI355(需支持ROCm 7.2.0及以上)
- 显存要求:最低64GB(推荐128GB以获得最佳性能)
- CPU:至少8核心,支持AVX2指令集
- 内存:建议64GB以上
软件依赖
| 组件 | 版本要求 |
|---|---|
| 操作系统 | Linux (Ubuntu 22.04 LTS或RHEL 9.2) |
| ROCm | 7.2.0 |
| PyTorch | 2.9.1 |
| Transformers | 5.3.0 |
| SGLang | 最新稳定版 |
| AMD-Quark | 0.12 |
🔧 基础环境搭建
1. ROCm驱动安装
# 添加ROCm仓库
echo 'deb [arch=amd64] https://repo.radeon.com/rocm/apt/7.2.0 focal main' | sudo tee /etc/apt/sources.list.d/rocm.list
sudo apt update && sudo apt install rocm-hip-sdk
# 验证安装
/opt/rocm/bin/rocminfo
2. Python环境配置
# 创建虚拟环境
python3 -m venv qwen_env
source qwen_env/bin/activate
# 安装依赖
pip install torch==2.9.1 transformers==5.3.0 sglang
📥 模型获取与准备
克隆项目仓库
git clone https://gitcode.com/hf_mirrors/amd/Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2
cd Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2
模型文件结构
项目包含以下核心文件:
- 模型权重文件:
model-00001-of-00005.safetensors至model-00005-of-00005.safetensors - 配置文件:
config.json、generation_config.json - 分词器文件:
tokenizer.json、vocab.json、merges.txt
🚀 启动SGLang推理服务
1. 设置环境变量
export SGLANG_USE_AITER=1
export SGLANG_USE_AITER_UNIFIED_ATTN=1
export AITER_FLYDSL_FORCE=1
export SGLANG_MAMBA_SSM_DTYPE=bfloat16
export SGLANG_USE_AITER_FP8_PER_TOKEN=1
2. 启动服务
python3 -m sglang.launch_server \
--model-path . \
--trust-remote-code \
--host 0.0.0.0 \
--port 30000 \
--tensor-parallel-size 2 \
--attention-backend aiter \
--mem-fraction-static 0.8 \
--model-loader-extra-config '{"enable_multithread_load": true}' \
--watchdog-timeout 1200 \
--disable-radix-cache \
--reasoning-parser qwen3 \
--page-size 16 \
--enable-aiter-allreduce-fusion
✅ 验证服务可用性
使用curl测试API:
curl -X POST http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "amd/Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2",
"messages": [{"role": "user", "content": "Hello, world!"}]
}'
🔍 性能优化建议
- 量化配置:模型已使用AMD-Quark进行MXFP4量化,量化脚本可参考量化步骤
- 并行设置:根据GPU数量调整
--tensor-parallel-size参数 - 内存管理:通过
--mem-fraction-static控制显存分配比例(建议0.7-0.8) - 推理加速:启用
--enable-aiter-allreduce-fusion优化分布式推理性能
📚 相关资源
- 模型架构:基于Qwen3_5MoeForConditionalGeneration架构,支持文本/图像/视频输入
- 官方文档:
- 配置文件:
- 模型配置:config.json
- 生成配置:generation_config.json
📝 许可证信息
本项目基于Apache-2.0许可证开源,详细条款参见LICENSE文件。修改部分© 2026 Advanced Micro Devices, Inc.保留所有权利。
更多推荐

所有评论(0)