rtx5060ti 16GB+rtx 5080 16GB 跑35B的模型 就实现一路并发110token/s ,四路并发每路并发70token/s
rtx5060ti 16GB+rtx 5080 16GB 跑35B的模型 就实现一路并发110token/s ,四路并发每路并发70token/s
最近做一次有趣的实验 , 我最近弄一张rtx5060ti 16GB的 使用起来感觉性价比比我的rtx5080 要高的多了, 因为我的rtx5080 16GB 跑大模型 显存肯定是太小啦, 那就会涉及到内存与显存之间的拷贝的问题, 再加上 本身CUDA 的FalshAttion对 多注意力头进行优化 , 把全局的显持一下拷贝局部的block就是每一个执行的sm的处理器中了, 让K、Q、V的进行矩阵运算时不需要重复访问全局的显存中, 从而减少访问时间, 计算block结束后也把局部 注册器中显存拷贝到全局显存中
一、 硬件、路径配置
系统: Ubuntu24.4
CPU:i9-14900kf
GPU: rtx5060ti 16GB + rtx5080 16GB
内存: 48GB x 2 = 96GB
推理框架:
二、 模型在单个GPU运行token的速度
Qwen3.6-35B-A3B模型
1、在rtx 5060ti 运行 跑的token是120token/s
2、在rtx 5080 运行 跑出 token是 200token/s
3、在两张显卡加载不同模型层运行
运行llama的命令行参数
./llama-server \
-m /mnt/d/LLM/llm/llm/rtx5080/Qwen3.6-35B-A3B-UD-IQ2_M.gguf \
--host 0.0.0.0 \
--port 20002 \
-c 300000 \
-ngl 99 \
-np 4 \
-ts 3,1 \
-cb \
-fa on \
--metrics \
-t 16 \
-tb 16 \
-b 4096 \
-ub 1024 \
--device CUDA0,CUDA1 \
--reasoning-budget 0 \
--chat-template-kwargs '{"enable_thinking": false}'
上面的我配置 4路并发, 在rtx5080 和rtx5060ti加载模型层的比例是3:1 , 因为rtx5080 算力是rtx5060ti的两呗
- 单路token 是110token/s
- 四路并发大概在70token/s
但是 我发现多路并发 , GPU算力和PCIE的带宽没有使用完全, 说明token不是没有达到硬件的上限,
这是GPU使用情况 数据

这个输出四路并发输出的token数量, 是不是感觉优化可能特别的大啊 !!!
我当时就有想法啦!!!
我突然有了新的想法 是不是rtx5060ti 16GB 多卡 可以加载同一个模型中不同层 继续计算 比如 两个卡32GB 算力大约是rtx5090的一半, 如果 4卡64GB 的算力和rtx5090 差不多了, 显存反正变大了, 是不是这样的呢。 6张rtx5060ti 就是96GB 就需要2.4w就可以买到啦 !!! 是不是同步有趣啊, 地下我就要研究怎么把GPU的算了榨干了 ~~~
更多推荐




所有评论(0)