一、普通服务器升级ai服务器

1、服务器插槽装载8张INVIDA RTX 4090的显卡(单显卡48GB)

2、在INVIDA官网下载安装NVIDIA驱动NVIDIA-Linux-x86_64-550.120.run

//服务器上禁用开源驱动 nouveau

echo "blacklist nouveau" >> /etc/modprobe.d/blacklist-nouveau.conf

echo "options nouveau modeset=0" >> /etc/modprobe.d/blacklist-nouveau.conf

update-initramfs -u

//重启服务器

reboot

//安装invida的驱动

./NVIDIA-Linux-x86_64-550.120.run --no-opengl-files --no-drm

//安装完成后再重启服务器,然后验证

nvidia-smi

出现8张显卡详情则说明安装成功

3、在INVIDA官网下载安装cuda_12.1.0_530.30.02_linux.run

//安装

./cuda_12.1.0_530.30.02_linux.run

//安装时一定取消勾选 Driver,只装 Toolkit

//配置环境

echo "export PATH=/usr/local/cuda-12.1/bin:$PATH" >> ~/.bashrc

echo "export LD_LIBRARY_PATH=/usr/local/cuda-12.1/lib64:$LD_LIBRARY_PATH" >> ~/.bashrc

source ~/.bashrc

//验证

ncvv -V

4、下载安装其他环境

//先安装python

 tar -zxvf Python-3.10.14.tgz cd Python-3.10.14

./configure --prefix=/usr/local/python310

make && make install

ln -s /usr/local/python310/bin/python3 /usr/bin/python

ln -s /usr/local/python310/bin/pip3 /usr/bin/pip

//安装下载好的离线包

pip install --no-index --find-links=. torch-2.4.0+cu121-cp310-cp310-linux_x86_64.whl

pip install --no-index --find-links=. torchvision-0.19.0+cu121-cp310-cp310-linux_x86_64.whl pip install --no-index --find-links=. torchaudio-2.4.0+cu121-cp310-cp310-linux_x86_64.whl pip install --no-index --find-links=. vllm-0.7.2+cu121-cp310-cp310-linux_x86_64.whl

pip install --no-index --find-links=. auto_gptq-0.7.1+cu121-cp310-cp310-linux_x86_64.whl pip install --no-index --find-links=. optimum-1.26.0-py3-none-any.whl

pip install --no-index --find-links=. transformers-4.48.0-py3-none-any.whl

pip install --no-index --find-links=. tokenizers-0.19.1-cp310-cp310-manylinux_2_17_x86_64.whl

pip install --no-index --find-links=. sentencepiece-0.2.0-cp310-cp310-manylinux_2_17_x86_64.whl

pip install --no-index --find-links=. protobuf-4.25.3-cp310-cp310-manylinux2014_x86_64.whl

5、运行模型

cd /data cat << 'EOF' > start_235b.sh

CUDA_VISIBLE_DEVICES=0,1,2,3 \

python -m vllm.entrypoints.openai.api_server \

--model /data/models/tclf90_Qwen3-235B-A22B-Thinking-2507-GPTQ-Int4-Int8Mix \

--served-model-name qwen3-235b \

--tensor-parallel-size 4 \

--max-model-len 8192 \

--gpu-memory-utilization 0.95 \

--trust-remote-code \

--host 0.0.0.0 \

--port 8050

EOF chmod +x start_235b.sh nohup ./start_235b.sh > run.log 2>&1 &

6、直接测试

curl http://127.0.0.1:8085/v1/chat/completions \

-H "Content-Type: application/json" \

-d '{ "model": "qwen3-235b", "messages": [ {"role": "user", "content": "你好,我是一名AI工程师,正在测试Qwen3-235B模型"} ], "temperature": 0.7, "max_tokens": 1024 }'

7、在前端界面上实现智能对话

//下载开源的openwebui离线包

open-webui-linux-amd64

//然后调用大模型的接口,启动

nohup \

PORT=3001 \

OPENAI_API_BASE_URL=http://127.0.0.1:8050/v1 \

OPENAI_API_KEY=sk-123456 \

DEFAULT_MODELS=qwen3-235b \

./open-webui-linux-amd64 > webui.log 2>&1 &

//然后直接访问 http://服务器IP:3000

*知识点注释

1、显卡与cpu

显卡天生并行计算,适合大模型

cpu串行计算

2、一台普通服务器如何变成ai服务器

只需要加8张NVIDIA  RTX 4090(每张显卡48GB)的显卡

就立马变成一台顶级的ai服务器

但是注意该服务器一定得解决一下问题:一般服务器只有2个左右插槽,以及散热问题,以及大功率电源要适配

3、vLLM 是目前世界上跑本地大模型(特别是 70B/110B/235B 超大模型)速度最快、最稳定、最适合对接 WebUI 的框架,没有之一。

4、现在的架构:

8×4090 + vLLM + Qwen3-235B + Open WebUI是目前国内最顶级的离线大模型部署方案

关键调优点解释(必须看)

  1. tensor-parallel-size 8

    • 从 4 改成 8,8 张卡全部并行,推理速度提升 60%~100%
    • 235B 超大模型必须满卡跑
  2. max-model-len 16384

    • 从 8192 提升到 16384,支持更长上下文,不爆显存
  3. gpu-memory-utilization 0.92

    • 从 0.95 下调,防止显存溢出、保证稳定性
  4. max-num-batched-tokens 65536

    • vLLM 核心批处理优化,并发提升 5~10 倍
  5. max-num-seqs 256

    • 最大同时对话会话数,生产级标配
  6. --enable-prefix-caching

    • 开启前缀缓存,相同提问速度提升 30%+
  7. --swap-space 16

    • 预留 CPU 交换空间,防止极端场景崩溃

vLLM 对比其他框架的 5 大优势(你的 8×4090 场景直接受益)

1. 显存利用率最高(235B 模型不爆显存的关键)
  • 动态按需分配 + 分页小块管理 + 前缀 KV 共享 + 连续批处理
2. 吞吐量(tokens / 秒)碾压,并发提升 10–30 倍

在 8×4090 跑 Qwen3-235B-GPTQ:

  • vLLM25–35 tokens / 秒,支持 50–100 并发用户
3. 原生支持 GPTQ/AWQ 量化(你的模型直接用)
  • vLLM无缝支持 GPTQ-INT4/INT8、AWQ、FP8,无需额外转换,直接加载你的 235B-GPTQ 模型
4. 开箱即用的 OpenAI 兼容 API(前端直接对接)
  • vLLM:一行命令启动 OpenAI 格式 API(/v1/chat/completions),直接对接 ChatGPT-Next-Web/OpenWebUI
5. 分布式张量并行(8 卡 4090 全利用)
  • vLLM:原生支持 tensor-parallel-size 8,235B 权重均匀拆分到 8 卡,单卡显存压力最小
  • Transformers:分布式支持弱
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐