从理论到实践:Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2模型在Linux系统下的环境配置完全指南

【免费下载链接】Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2 【免费下载链接】Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2

Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2是基于AMD MI350/MI355硬件优化的大语言模型,采用MXFP4量化技术实现高效推理。本文将详细介绍在Linux系统下从环境准备到模型部署的完整流程,帮助新手用户快速搭建可用的AI推理环境。

📋 系统环境要求

硬件兼容性

  • 推荐GPU:AMD MI350/MI355(需支持ROCm 7.2.0及以上)
  • 显存要求:最低64GB(推荐128GB以获得最佳性能)
  • CPU:至少8核心,支持AVX2指令集
  • 内存:建议64GB以上

软件依赖

组件 版本要求
操作系统 Linux (Ubuntu 22.04 LTS或RHEL 9.2)
ROCm 7.2.0
PyTorch 2.9.1
Transformers 5.3.0
SGLang 最新稳定版
AMD-Quark 0.12

🔧 基础环境搭建

1. ROCm驱动安装

# 添加ROCm仓库
echo 'deb [arch=amd64] https://repo.radeon.com/rocm/apt/7.2.0 focal main' | sudo tee /etc/apt/sources.list.d/rocm.list
sudo apt update && sudo apt install rocm-hip-sdk

# 验证安装
/opt/rocm/bin/rocminfo

2. Python环境配置

# 创建虚拟环境
python3 -m venv qwen_env
source qwen_env/bin/activate

# 安装依赖
pip install torch==2.9.1 transformers==5.3.0 sglang

📥 模型获取与准备

克隆项目仓库

git clone https://gitcode.com/hf_mirrors/amd/Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2
cd Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2

模型文件结构

项目包含以下核心文件:

  • 模型权重文件:model-00001-of-00005.safetensorsmodel-00005-of-00005.safetensors
  • 配置文件:config.jsongeneration_config.json
  • 分词器文件:tokenizer.jsonvocab.jsonmerges.txt

🚀 启动SGLang推理服务

1. 设置环境变量

export SGLANG_USE_AITER=1
export SGLANG_USE_AITER_UNIFIED_ATTN=1
export AITER_FLYDSL_FORCE=1
export SGLANG_MAMBA_SSM_DTYPE=bfloat16
export SGLANG_USE_AITER_FP8_PER_TOKEN=1

2. 启动服务

python3 -m sglang.launch_server \
    --model-path . \
    --trust-remote-code \
    --host 0.0.0.0 \
    --port 30000 \
    --tensor-parallel-size 2 \
    --attention-backend aiter \
    --mem-fraction-static 0.8 \
    --model-loader-extra-config '{"enable_multithread_load": true}' \
    --watchdog-timeout 1200 \
    --disable-radix-cache \
    --reasoning-parser qwen3 \
    --page-size 16 \
    --enable-aiter-allreduce-fusion

✅ 验证服务可用性

使用curl测试API:

curl -X POST http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "amd/Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2",
    "messages": [{"role": "user", "content": "Hello, world!"}]
  }'

🔍 性能优化建议

  1. 量化配置:模型已使用AMD-Quark进行MXFP4量化,量化脚本可参考量化步骤
  2. 并行设置:根据GPU数量调整--tensor-parallel-size参数
  3. 内存管理:通过--mem-fraction-static控制显存分配比例(建议0.7-0.8)
  4. 推理加速:启用--enable-aiter-allreduce-fusion优化分布式推理性能

📚 相关资源

📝 许可证信息

本项目基于Apache-2.0许可证开源,详细条款参见LICENSE文件。修改部分© 2026 Advanced Micro Devices, Inc.保留所有权利。

【免费下载链接】Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2 【免费下载链接】Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-397B-A17B-MXFP4-AttnFP8-V2

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐