“既然显卡都买回家了,那在本地跑大模型,不就等于不要钱吗?”

相信很多深度学习爱好者和开发者(包括我自己)都曾有过这种“显卡买了就是白嫖”的幻觉。直到最近,海外技术博主 Arsen Apostolov 亲自动手做了一次受控测试,彻底打破了这个迷思。

他在一台搭载了单张 RTX 3090 (24GB 显存) 的个人服务器上,通过 Ollama 本地部署了多款主流开源大模型。利用高精度的功耗监控,他精确计算出了本地每生成 100 万个 Token(1M Tokens)究竟需要烧掉多少电费。

测试结果令人大跌眼镜:在测试的 8 款模型中,有 5 款的每百万 Token 运行电费确实比云端 API 还要便宜;但另外 3 款却贵得离谱——而且,最贵的几个,跟它们的参数量大小几乎没有直接关系!

严谨的受控测试方法

为了保证测试数据足够客观,博主严格控制了以下变量:

统一的硬件平台:单卡 RTX 3090 (24GB VRAM)。

统一的权重格式:全部采用 Ollama 官方源的 Q4_K_M 量化 GGUF 权重。

统一的测试负载:设计了一个循环任务,每次生成 256 个 Token,连续循环 5 个固定的 Prompt。每个模型持续运行约 240 秒(4 分钟),让 GPU 达到稳定的高负载发热状态,以此排除冷启动的误差。

实时监控利器:HomeLab Monitor

为了抓取最真实的 GPU 功耗(而非 TDP 理论热设计功耗),他使用了一款开源的容器化监控工具 HomeLab Monitor。它通过 nvidia-smi 每 10 秒采集一次 GPU 的实际运行功率,并在测试结束时自动积分算出总耗电量(kWh),再根据阶梯电价折算。

电费计算公式非常直观:

每百万输出 Token 电费 (元) = 运行区间总电费 ÷ (输出 Token 数 ÷ 1,000,000)

为了排除“冷启动”的干扰,每次测试前都进行了一次 Warm-up(热身)调用,且模型测试之间预留了 15 秒的冷却时间。

8 款模型实测数据大曝光

在测完最初的 Gemma 系列后,博主又加入了 GLM-4.5-Air、DeepSeek-R1-Distill、Seed-OSS、Devstral 以及 Qwen3-Coder 等热门模型。

我们将各模型的生成电费,与目前云端 API(以 Gemini 2.5 Flash / GPT-4o-mini 为参考,平均约 €0.55 / 百万 Token)进行对比,得出了以下惊人的数据:

最反直觉的发现:为什么 DeepSeek 反而成了“电老虎”?

从参数量来看,106B 的 GLM-4.5-Air 庞大笨重,每百万 Token 电费为 €1.040,比云端 API 贵一倍,这很符合“大模型费电”的常识。

但为什么只有 32.8B 参数的 DeepSeek-R1-Distill 居然以 €1.526/1M Tokens 的高价,成为了全场“最烧钱”的模型?

要知道,它的平均运行功耗只有 141W,比 Gemma 3: 27B(283W)省电得多!

秘密就隐藏在“有效吞吐速度(Effective Wall-Clock Throughput)”里。

作为一款推理型大模型,DeepSeek 在回答时会进行深度的思维链(Thinking)推理。当我们在跑普通的单次生成测试时,它的纯文本生成速度看起来很漂亮。但在真实场景(如 Agent 多轮对话或代码调试)中,它会花大量时间在后台“冥想”、调用工具、自我纠错,期间并没有任何实际的 Token 输出。

在这段“干思考、不吐字”的时间里,显卡可没有闲着,它依然维持着高负载的运行状态。在实测中,DeepSeek 的有效吞吐速度仅有 3.7 Token/s。

这意味着,为了生成同样数量的 Token,它让显卡保持高功耗运行的时间,是其他模型的数倍!电费是按“功率 × 时间”来算的,在显卡里“卡”得太久,电费自然就飙升了。

核心技术结论:

决定本地大模型运行成本的,既不是纯粹的“参数量”,也不是“瞬时功率”,而是“有效吞吐速度”。一旦显卡被唤醒,即使它在后台“沉默思考”,你的电表也在飞速旋转。

本地部署的“隐性账本”与理性避坑

看完测试,我们是不是应该全面放弃本地部署呢?倒也不必,但在算账时,我们需要跳出单纯的“GPU 运行电费”,看看那些容易被忽略的隐形成本:

硬件折旧才是“吞金兽”:一张高配显卡动辄数千甚至上万元。如果你的模型每天只跑几十次,大部分时间显卡都在闲置吃灰,平摊下来的硬件折旧费会远远超过省下来的那点电费。

高可用部署的痛点:在家里拉一台 24 小时在线的物理服务器,你得忍受风扇的狂飙、室内的燥热,还要面对随时可能断电、以及宽带动态 IP 难以维持的窘境。

更加合理的“动静分离”架构

对于需要 24 小时稳定不间断运行的业务(比如你的个人技术博客、自动化数据脚本、API 中转代理或是数据库后台),把它们死死绑定在家里那台吵闹的电脑上,显然非常不划算。

把这些需要全天候响应、对带宽和稳定性要求极高的基础设施,部署在服务器云端才是更优解。

我选择的是云端+本地的组合,大显存、高算力的AI推理任务留在本地(或者按需调用API),而将高可用的 AI Agent 后端、Web 托管、数据库以及任务流中转全部部署在 HostEase 在云端服务器上。

总结建议

模型挑选: 在满足业务质量的前提下,优先选择生成速度最快、有效吞吐最高的模型。 Qwen3-Coder (30.5B) 的性价比在实测中非常惊艳,而 Gemma 3: 27B 这种生成速度极快的传统无思维链模型,则是跑本地批处理的省钱利器。

不要迷信“显卡到手就免费”: 算账要算综合账。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐