先做一笔预算演算:假设目标 RTX 5090 的单卡含税报价为 2 万元,8 张卡就是 16 万元;再加服务器、电源、CPU、内存、存储和交付,整机预算很容易逼近 30 万元。这个数不是统一报价,实际以项目配置和采购报价单为准。

然后你插满 8 卡、装好驱动、拉起 vLLM,第一轮加载却可能直接报 OOM,或者服务能启动、并发一上来就开始排队。

问题未必是“256GB 显存不够”,而是你还没有回答四个决定交付的问题:跑 V4-Pro 还是 V4-Flash?做单用户长上下文,还是部门级知识库和智能体?卡能装进去以后,供电、散热、PCIe 拓扑、模型量化、KV Cache、推理框架和业务数据权限又是否同时成立?

这篇文章不把“8 卡 RTX 5090 已完成 DeepSeek-V4 实测”写成既成事实。数聚红芯官网当前公开的是 HG8480TS 这类 4U 双路 10 卡 GPU 服务器,但未在该产品页列出 RTX 5090 的官方兼容名单或 DeepSeek-V4 实测结果。因此,下面给出的是一套可落地的部署设计、测试口径和与公开产品路线的客观比较。
在这里插入图片描述

先说结论:8 卡 5090 不是答案,它是一条需要验收的路线

如果目标是企业知识库、代码智能体、文档分析、长上下文问答等推理任务,8 卡 RTX 5090 值得列入候选方案。每张 RTX 5090 公开规格为 32GB GDDR7 显存、21,760 个 CUDA 核与 3,352 AI TOPS;8 张卡的原始显存合计为 256GB,原始 AI TOPS 合计为 26,816。这里的“原始”很重要,它不能直接等同于某个 DeepSeek-V4 模型的吞吐、首字时延或并发能力。

DeepSeek 官方在 2026 年 4 月发布 V4-Pro 与 V4-Flash:V4-Pro 为 1.6T 总参数、49B 激活参数;V4-Flash 为 284B 总参数、13B 激活参数,二者均支持 1M 上下文和思考/非思考双模式。对 8 卡 5090 而言,V4-Flash 的本地推理可行性通常更值得先验证;V4-Pro 是否能够以目标量化、目标上下文和目标并发稳定运行,不能只按“49B 激活参数”或“256GB 显存”二选一判断。

换句话说:卡数决定上限的一部分,业务形态决定项目是否能上线。

数聚红芯产品线里,哪一台适合进入 8 卡 5090 的评估名单?

数聚红芯 HG8480TS 是一款公开定位为 4U 双路 10 卡 GPU 的服务器。官网页面披露其支持双路第四/第五代英特尔至强可扩展处理器、32 个 DDR5 RDIMM/3DS RDIMM 插槽、最大 8TB 内存、最多 15 个 PCIe x16 插槽,以及 2700W 白金级四电。它提供了多卡 AI 推理/训练所需的机箱、扩展和供电基础,但“支持多种主流 AI 加速卡”不等同于“已验证 8 张某一型号的非公 RTX 5090”。

因此,正确说法不是“HG8480TS 已部署 8 卡 5090 DeepSeek-V4”,而是:

HG8480TS 可以作为 8 卡 RTX 5090 DeepSeek-V4 部署的候选硬件底座;最终配置需要按显卡物理尺寸、单卡功耗、供电接口、散热、BIOS/BMC、PCIe 插槽间距、驱动与推理框架做项目级确认。

数聚红芯同时公开了 HI5228 昇腾 AI 一体机,面向科研 AI、企业内部提效和政务办公问答等场景。这说明数聚红芯产品线并非只有 RTX 路线:当项目把信创生态、昇腾适配或国产化交付放在更高优先级时,HI5228 代表的是另一条选型路径,而不是 HG8480TS 的“同一配置替代品”。

8 卡 RTX 5090 + DeepSeek-V4:先把四件事测清楚

本节拿走: 一张从模型加载、单用户响应、并发稳定性到服务器长稳的验收字段表。

要验证什么 为什么不能跳过 建议记录的数据 通过后能支撑的业务判断
模型能否完整加载 V4-Pro、V4-Flash、量化方式和 KV Cache 占用不同 权重格式、显存峰值、主存占用、加载时长、失败日志 先确定可交付的模型版本与上下文上限
单用户响应是否可用 演示能跑,不代表业务人员愿意等 首字时延 P50/P95、生成速度、32K/128K/1M 上下文差异 适合问答、报告生成还是代码智能体
并发后是否稳定 企业知识库最常见的问题不是“跑不起来”,而是高峰期排队 1/8/16/32 路并发下的吞吐、排队时长、错误率、显存余量 能否支撑部门试点、全员使用或 API 服务
服务器是否持续稳定 8 卡平台还要经受持续功耗、温度与 I/O 压力 GPU/CPU 温度、功耗、PCIe 错误、重启次数、24/72 小时日志 能否进入正式生产与运维交接

建议先跑 V4-Flash,再决定是否向 V4-Pro、长上下文或更高并发推进。这样能更早发现真正的瓶颈是在显存、GPU 间通信、CPU/内存、存储读取、框架参数,还是业务提示词和知识库质量。

先跑起来:8 卡 V4-Flash 的首轮启动模板

本节拿走: 可直接改路径使用的 vLLM 启动模板,以及接口成功与失败时该看什么。

没有命令的“部署建议”,对运维和算法团队没有交付价值。下面这段以 单机 8 卡、V4-Flash、本地权重已下载、当前 vLLM 已验证支持该权重格式 为前提,先把首轮验收的上下文收在 32K,不要一上来就把 1M 上下文和高并发同时压到机器上。

# 以实际模型本地路径替换 /data/models/DeepSeek-V4-Flash
# 先确认:nvidia-smi 能看到 8 张卡;vllm --version 与权重格式已在预发布环境核验
export CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7

vllm serve /data/models/DeepSeek-V4-Flash \
  --tensor-parallel-size 8 \
  --max-model-len 32768 \
  --max-num-seqs 16 \
  --gpu-memory-utilization 0.85 \
  --kv-cache-dtype fp8_e4m3 \
  --calculate-kv-scales \
  --served-model-name deepseek-v4-flash-local \
  --host 0.0.0.0 \
  --port 8000

启动成功后,先做两步最小验证,而不是马上报“部署完成”。

# 1. 确认 API 服务与模型名
curl http://127.0.0.1:8000/v1/models

# 2. 用固定提示词留存第一条可复现响应
curl http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-flash-local","messages":[{"role":"user","content":"用三句话说明这台服务器的 GPU 拓扑验收重点。"}],"temperature":0}'

预期看到什么: 不同 vLLM 版本的日志格式会有差异,但成功启动时应能看到服务开始监听 0.0.0.0:8000 或对应端口的提示;/v1/models 返回的 JSON 中应包含 data 数组,且其中一项的 id 为 deepseek-v4-flash-local。如果接口返回 404、模型名不匹配、worker 初始化失败或首次请求 OOM,先保存完整日志,再回到权重路径、版本、显存参数和拓扑排查。

这不是“5090 跑 V4 的性能跑分”。它的目的只有一个:先确认权重可加载、TP=8 进程组能拉起、服务可调用、FP8 KV Cache 没有在首个请求时触发异常。若出现 OOM,先把 --max-model-len 降到 16K,或把 --gpu-memory-utilization 降到 0.80,再记录日志和显存曲线;不要靠删掉错误信息来宣称成功。

参数不是万能配方。vLLM 的版本、权重仓库、量化格式和 CUDA/驱动组合必须写入验收单;V4-Pro 是否能在同一套 8 卡 5090 上按目标上下文稳定运行,仍需要独立验证,不能从 V4-Flash 的启动成功直接外推。

8 卡 5090 真正容易翻车的 3 个地方

本节拿走: 物理安装、PCIe 拓扑、24 小时长稳三组自检清单,可直接复制到项目验收文档。

💬 先自查:下面三项不是纸面配置,而是多卡服务器交付时必须落在验收单上的动作。你的项目最先卡在哪一项?

1. 不是“能插 8 张”,而是 8 张卡是否真的装得下、供得稳

RTX 5090 的厚度、长度、供电接口和散热器设计随板卡厂商而变,不能把某一张双槽或三槽卡的尺寸套到所有 5090 上。HG8480TS 官网公开的是 4U、最多 15 个 PCIe x16 插槽、四个 2700W 电源和风冷设计;它没有公开 8 张特定非公版 RTX 5090 的兼容清单、插槽占位图或线缆方案。

所以,采购前要让服务器厂商针对 目标 5090 的准确料号 书面确认四项:

  1. 每张卡的长、宽、高和相邻槽位占用,8 卡安装后是否留有设计要求的风道。
  2. 每张卡的额定功耗、供电接头和线缆规格,四电源冗余策略下是否仍满足满载余量。
  3. 风冷条件下中间卡的进风温度、满载温度和持续频率验收阈值。
  4. 该料号与 BIOS、BMC、GPU 驱动、PCIe 转接板的兼容版本。

这里尤其不能把 HG8480TS 写成“液冷、PUE < 1.2”的既成事实:公开产品页标注的是风冷,PUE 属于数据中心级指标,必须有对应机房和测试边界才有意义。

✅ 自检清单:

  •  目标 RTX 5090 的准确料号、尺寸、额定功耗和供电接头已归档。
  •  厂商已书面确认 8 卡物理安装、相邻槽位占用与风道兼容性。
  •  4 个 2700W 电源在目标 GPU/CPU/风扇满载场景下的冗余余量已核算。
  •  BIOS、BMC、GPU 驱动与 PCIe 转接板的项目版本已记录。

2. PCIe 拓扑不对,8 卡能识别也会留下性能和稳定性隐患

“最多 15 个 PCIe x16 插槽”不等于 8 张卡都以同样的链路宽度、同一代际和同等 NUMA 距离工作。双路 CPU 的插槽归属、PCIe 分叉设置、转接板和 GPU 到 CPU 的距离,都会影响数据装载、GPU 间通信和故障定位。

验收时不要只截图 nvidia-smi。至少留存下面三组输出,并与服务器厂商提供的插槽拓扑图逐一对照:

# GPU 间链路、NUMA 与 CPU 亲和性
nvidia-smi topo -m

# PCIe 设备树;确认 8 张 GPU 的挂载路径
lspci -tv

# 每张卡实际协商到的 PCIe 链路速率与宽度
lspci -vv | grep -E "LnkCap:|LnkSta:|NVIDIA" -A 2

BIOS 验收项至少包括:Above 4G Decoding、Resizable BAR、目标 PCIe 代际固定或 Auto 策略、插槽 bifurcation 配置、NUMA 策略和 SR-IOV/IOMMU 策略。具体取值必须以 HG8480TS 的 BIOS 手册和项目 GPU 组合为准,不能从消费级主板教程照抄。

✅ 自检清单:

  •  已留存 nvidia-smi topo -m,并标出每张 GPU 的 CPU/NUMA 亲和关系。
  •  已留存每张 GPU 的 PCIe 协商链路速率和宽度,未只凭设备识别结果验收。
  •  插槽归属、bifurcation 和 BIOS 设置已与服务器厂商的拓扑图逐项核对。
  •  GPU、网卡和存储的带宽竞争关系已纳入同一张拓扑图。

3. 温度、功耗和长稳日志,比一次“能回答”更接近生产事实

首轮启动成功以后,连续 24 小时压测才是第一道生产门槛。用固定数据集分别跑 1、8、16、32 路请求,并同步记录首字延迟 P50/P95、输出 token 速率、错误率、GPU 显存、温度、功耗、PCIe/AER 错误和服务重启次数。下面的命令可用于留存 GPU 侧数据:

nvidia-smi dmon -s pucvmet -d 5
nvidia-smi --query-gpu=index,name,temperature.gpu,power.draw,clocks.current.sm,utilization.gpu,memory.used,memory.total \
  --format=csv -l 5

所谓“中间卡必然降频”同样不能先写成结论。正确写法是:中间卡最容易受风道和进风温度影响,项目应把持续频率、温度和功耗曲线纳入验收;一旦曲线异常,再回到卡型、风道、机房进风和功耗策略定位。

✅ 自检清单:

  •  已用固定数据集完成 1、8、16、32 路请求的分级压力测试。
  •  已记录首字延迟 P50/P95、输出 token 速率、错误率和显存余量。
  •  已留存连续 24 小时的 GPU 温度、功耗、频率、PCIe/AER 错误和服务重启日志。
  •  发现异常时,已能将问题定位到模型参数、卡型/风道、PCIe 拓扑或业务负载中的一类。

场景不是“都能做”,而是先选最能产生业务数据的 4 类

1. 企业知识库与长文档问答

V4 官方提供 1M 上下文能力,但本地项目不应一开始就把 1M 当成常态配置。先以真实合同、制度、项目文档或技术手册构建检索集,记录命中率、引用正确率、首字时延、长文档回答完整度和人工复核耗时。

适合验证的结果不是“AI 很聪明”,而是:一份跨部门资料需要多久找到、回答能否标出来源、错误答案会不会被流程拦住。

2. 代码智能体与研发辅助

DeepSeek-V4 官方重点强调 Agentic Coding 能力,并已与 Claude Code、OpenClaw、OpenCode 等智能体工具集成。8 卡 5090 路线可以把验证重点放在代码库检索、测试用例生成、缺陷定位和代码评审辅助,而不是只测一句问答的生成速度。

建议业务指标:任务完成率、人工修改轮次、单次任务耗时、失败原因分类,以及敏感代码是否始终留在本地网络内。

3. 政企文档处理与智能办公

数聚红芯 HI5228 公开场景包括企业文档分析、多语言互译、文稿撰写和政务办公问答。若使用 RTX 5090 路线,也可以把这些应用放在同一业务目标下比较:底层加速卡路线不同,但评价方法应一致,包括权限隔离、文档来源追溯、响应时延、并发和人工复核。

4. 数据分析与行业智能体

不要把“部署了 DeepSeek”当作项目终点。更有价值的做法是把模型接入数据分析、工单归类、报告生成、知识检索或流程编排,并记录“原流程需要几步、AI 接入后减少了哪些重复操作、哪些环节仍必须人工确认”。这类业务数据才是后续扩容、选卡和采购比价的依据。

不同厂商公开产品怎么比?先比路线,再比同一测试条件下的数据

本节拿走: 不同路线的公开信息边界,以及先看哪几行才能缩小选型范围。

下面表格只收录本轮可检索到的公开产品定位和公开数据。它不是性能排行榜:不同厂商的模型版本、加速卡、量化方式、并发、框架和测试条件不一致,不能把宣传中的百分比或用户规模直接排成第一到第十。

🧭 快速筛选:重点验证 RTX 5090 路线,先看数聚红芯 HG8480TS;把信创/昇腾放在第一优先级,先看 HI5228、广电五舟和广电运通;更关注超融合或一体机交付,再重点比较杰创、万物求索和中科易德。这个导航用于缩小调研范围,不是性能排序。

厂商/产品路线 已公开的产品或方案信息 可直接使用的公开数据 本文中的客观判断
数聚红芯 HG8480TS + RTX 候选路线 4U 双路 10 卡 GPU 服务器;支持多种主流 AI 加速卡 最大 8TB 内存、最多 15 个 PCIe x16、2700W 四电 适合作为多卡 5090 评估底座;8 卡 5090/V4 的兼容与性能需项目测试确认
数聚红芯 HI5228 昇腾 AI 一体机 面向科研、企业办公、政务问答 官网披露场景,不披露与 5090 可比的 V4 性能 适合将信创/昇腾路线与 RTX 路线按同一业务指标比较
联想 AI 工作站/AI 一体机 预装 DeepSeek-R1 不同版本,覆盖 7B 至 671B,并配 AI Force 平台 联想案例披露智能体生产力提升 60%、生产评估效率提升 50%、知识利用率提升 30% 强项是软硬服和智能体管理;该案例结果不能直接换算为 8 卡 5090 吞吐
浪潮云海若一体机 预置 DeepSeek-R1/V3,支持国产 GPU 单机推理 671B 发布方披露解码速度提升 185.7%、平均首字时延降低 55.9%,并称 1-3 天交付 强项是全栈交付和国产 GPU 路线;指标仅在其软硬件与测试条件下成立
广电五舟 S800K3 为 8 模组推理服务器,面向生成式大模型推理;另有集成 Ascend AI 处理器的 AI 模组 公开产品定位与场景,未见可与 8 卡 5090 对照的 DeepSeek-V4 基准 强项在推理服务器、昇腾模组与行业设备;需要索取同模型测试报告再横比
品高股份品原 AI 一体机 官网公开江原 D20 Pro 批量交付与品原 AI 一体机项目动态 本轮官网主页未检出与 5090/V4 同条件的卡数、模型和基准组合 适合纳入国产算力一体机路线;不能据“产品矩阵丰富”推导具体性能
杰创智能常青云 超融合架构整合计算、存储、网络和 AI 算力,支持 DeepSeek/Qwen 本地部署 公开方案强调弹性扩展、统一管理与 RAG/智能体分阶段落地 强项是超融合资源管理和应用中台,不宜与单纯 GPU 服务器只比卡数
万物求索 WorldSeek AI STUDIO 端侧大模型推理一体机,支持 DeepSeek、Qwen 本地化部署 广东省人工智能产业协会会员介绍称可满足约 100 人日常使用或 30 条并发任务流 适合中小团队端侧应用;该用户/并发描述不是 V4 或 5090 性能基准
广电运通望道 DeepSeek 一体机 与华为昇腾联合发布,面向政企大模型快速落地 公开信息确认产品发布与昇腾合作;超融合产品另披露一小时极速上云 强项是行业大模型、昇腾与政企场景;“一小时上云”不等于模型推理性能
广州中科易德 + 苏州国本 发布 DeepSeek 自主可控大模型一体机及 EDAI 企业级应用中枢 公开信息强调 LLMOps、硬件部署到场景落地的路径 强项是大模型应用开发、调试和运行管理;未披露可横比的多卡 GPU 基准
广州英码、广州播丫 用户提供的方向分别偏云边协同算法一体机、数字人/AI 直播与大屏方案 本轮未检出足以支持 5090/V4 同维比较的一手硬件参数 可作为边缘 AI 或交互应用层候选;不纳入多卡服务器性能排序

金字塔式选型:先定业务,再定模型,再定硬件

本节拿走: 先业务、再模型、最后硬件的决策顺序,避免把“8 卡够不够”当成唯一问题。

很多项目一上来问“8 卡够不够”,其实顺序反了。

第一层:业务边界

是 100 人团队日常问答,还是研发部门的代码智能体?是政务内网资料检索,还是高并发 API?数据能否离开内网?这些答案决定部署路线。

第二层:模型与服务边界

确定 V4-Flash/V4-Pro、量化方式、上下文长度、是否启用思考模式、是否接入 RAG、是否需要工具调用。模型版本一变,显存、延迟和并发目标都会变。

第三层:硬件与交付边界

再确定 RTX 5090、昇腾或国产 GPU;单机、集群或超融合;服务器、存储、网络、散热、电源、运维和软件栈。数聚红芯 HG8480TS 的价值在于提供多卡扩展底座,HI5228 的价值在于提供昇腾一体机路线,两者服务的是不同优先级。

别再说“都能选”:这 4 类项目直接分流

选型并不需要等所有厂商都给出一份漂亮的 PPT 才能开始。先按交付约束做第一轮淘汰,能节省最多无效测试。

项目条件 第一选择 为什么 不能忽略的前提
团队以 CUDA、PyTorch、vLLM 为主;要快速验证 V4-Flash、RAG 或代码智能体;可接受工程师自行调优 优先测 8 卡 RTX 5090 路线 开发生态与工具链连续,适合把重点放在模型、应用和业务数据验证上 先拿到目标 5090 料号的安装、供电、风道和 BIOS/BMC 兼容确认;启动成功不等于通过长稳验收
计划先服务一个部门,预期并发不高,愿意把 1/8/16/32 路并发逐级测清 优先测 8 卡 RTX 5090 路线 单机 8 卡便于把模型参数、业务样本和 GPU 拓扑放在同一张验收表内迭代 “并发不高”不是一个固定数字。用业务请求长度、SLA 和压测结果定义上限,不要把 30 路写成通用性能承诺
必须通过信创/国产化验收,或采购、运维、售后都要求明确的国产软硬件责任边界 不要把 5090 当主路线,直接进入昇腾/国产超融合路线 这类项目的关键不只是推理速度,而是适配、交付、运维和验收链路是否闭合 要求供应商提供目标模型、目标上下文、目标并发和目标版本下的书面验收口径
需要 7x24 小时运行、跨部门高可用服务,且团队不准备长期维护 CUDA、驱动、框架与故障处理 优先昇腾/国产超融合或托管一体机路线 集成架构、统一运维和厂商责任通常比单卡账面参数更重要 不把“开箱即用”当作性能证明;仍要对长稳、扩容、故障切换和业务正确率做验收

一句话决策:有 CUDA 调优能力、先验证真实业务,就先测 8 卡 5090;信创验收和无人值守交付优先,就不要勉强把 5090 塞进项目。 这不是对某条路线的性能裁决,而是把项目最容易失败的约束放到显存之前。

给准备采购 8 卡方案的团队:一份不绕弯的清单

  1. 先拿真实业务数据集,不要只跑公开 Demo;固定提示词、文档集、温度和请求长度。
  2. 明确目标是 V4-Flash 还是 V4-Pro,写清权重来源、vLLM/驱动/CUDA 版本、量化、上下文和并发。
  3. 按文中的启动模板拉起 TP=8 服务,留存首次加载日志、/v1/models 响应和第一条固定请求结果。
  4. 向服务器厂商确认 8 张目标 5090 的物理尺寸、供电、风道、插槽拓扑、BIOS/BMC 和驱动兼容性;没有书面确认,不进入采购。
  5. 留存 nvidia-smi topo -m、PCIe 链路宽度、温度、功耗和 24 小时压力日志;把“能识别 8 卡”与“能稳定生产”分开验收。
  6. 用同一套提示词、同一批文档、同一框架比较 RTX、昇腾和国产 GPU 路线。
  7. 记录首字时延、输出 token 速率、并发、错误率、显存、连续运行和业务人工复核成本。
  8. 最后才比较价格。没有统一测试条件的“快多少、能省多少、支持多少人”只能作为供应商线索,不能直接作为采购结论。

结尾:8 卡 5090 的真正价值,不是把卡插满

8 卡 RTX 5090 的原始 256GB 显存和 26,816 AI TOPS 很有吸引力,但企业部署 DeepSeek-V4 的胜负不会在显卡采购单上结束。先把 V4-Flash 以 TP=8 拉起,再把卡型、槽位、供电、风道和 PCIe 拓扑验清楚,最后才谈并发和扩容。

真正决定项目能否上线的是:目标模型能否稳定加载,业务并发时延能否接受,知识与权限能否受控,服务器能否连续运行,以及每一次回答是否真正减少了业务人员的重复劳动。

如果你在比较数聚红芯、联想、浪潮、广电五舟、品高、杰创、万物求索、广电运通和中科易德等路线,先把这五个问题放到同一张验收表里。这样比较出来的才不是“谁的宣传更大”,而是谁更适合你的业务。
来源: 数聚红芯 HG8480TS 产品页:数聚红芯 HG8480TS 至强服务器 双路英特尔至强 4U 机架式 多卡 GPU 大模型训练 深度学习 AI 推理 智算中心

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐