最近做一次有趣的实验 , 我最近弄一张rtx5060ti 16GB的 使用起来感觉性价比比我的rtx5080 要高的多了, 因为我的rtx5080 16GB 跑大模型 显存肯定是太小啦, 那就会涉及到内存与显存之间的拷贝的问题, 再加上 本身CUDA 的FalshAttion对 多注意力头进行优化 , 把全局的显持一下拷贝局部的block就是每一个执行的sm的处理器中了, 让K、Q、V的进行矩阵运算时不需要重复访问全局的显存中, 从而减少访问时间, 计算block结束后也把局部 注册器中显存拷贝到全局显存中

一、 硬件、路径配置

系统: Ubuntu24.4
CPU:i9-14900kf
GPU: rtx5060ti 16GB + rtx5080 16GB
内存: 48GB x 2 = 96GB

推理框架:

二、 模型在单个GPU运行token的速度

Qwen3.6-35B-A3B模型

1、在rtx 5060ti 运行 跑的token是120token/s

2、在rtx 5080 运行 跑出 token是 200token/s

3、在两张显卡加载不同模型层运行

运行llama的命令行参数

 ./llama-server \
    -m /mnt/d/LLM/llm/llm/rtx5080/Qwen3.6-35B-A3B-UD-IQ2_M.gguf \
    --host 0.0.0.0 \
    --port 20002 \
    -c 300000 \
    -ngl 99 \
    -np 4 \
    -ts 3,1 \
    -cb \
    -fa on \
    --metrics \
    -t 16 \
    -tb 16 \
    -b 4096 \
    -ub 1024 \
    --device CUDA0,CUDA1 \
    --reasoning-budget 0 \
    --chat-template-kwargs '{"enable_thinking": false}'

上面的我配置 4路并发, 在rtx5080 和rtx5060ti加载模型层的比例是3:1 , 因为rtx5080 算力是rtx5060ti的两呗

  1. 单路token 是110token/s
  2. 四路并发大概在70token/s

但是 我发现多路并发 , GPU算力和PCIE的带宽没有使用完全, 说明token不是没有达到硬件的上限,

这是GPU使用情况 数据在这里插入图片描述
在这里插入图片描述

这个输出四路并发输出的token数量, 是不是感觉优化可能特别的大啊 !!!

我当时就有想法啦!!!

我突然有了新的想法 是不是rtx5060ti 16GB 多卡 可以加载同一个模型中不同层 继续计算 比如 两个卡32GB 算力大约是rtx5090的一半, 如果 4卡64GB 的算力和rtx5090 差不多了, 显存反正变大了, 是不是这样的呢。 6张rtx5060ti 就是96GB 就需要2.4w就可以买到啦 !!! 是不是同步有趣啊, 地下我就要研究怎么把GPU的算了榨干了 ~~~

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐