本地部署大模型:最低配置指南
如果你还在纠结「要不要把大模型部署到本地」,或是对着满屏的技术术语犯怵,担心自己「零基础搞不定」,那这篇文章就是为你量身打造的。
如今大模型应用越来越广,但要么依赖云端 API 担心数据泄露、要么按 Token 付费越用越贵、要么断网就歇菜 —— 这些痛点,其实只要把模型部署在自己的电脑上,就能一次性解决。不用怕复杂,我们不讲晦涩的理论,只把「从 0 到 1 跑通本地大模型」的步骤拆细,哪怕你刚接触命令行,跟着做也能搞定。
不管你是想低成本用 AI 处理私密数据,还是单纯想折腾下自家电脑的算力,看完这篇,你就能清楚知道:自己的电脑能跑什么模型、该选哪种部署方式,以及遇到问题该怎么解决。
1 为什么要本地部署大模型
1.1 本地部署 vs 云端部署:一张表看懂优劣
在开始动手之前,我们先搞清楚一个问题:为什么要把大模型部署到自己的电脑上,而不是直接用 ChatGPT、DeepSeek 这些云端服务?
|
对比维度 |
本地部署 |
云端部署 |
|
数据隐私 |
数据完全不出本机,适合涉密场景 |
数据发送到云端服务器,存在泄露风险 |
|
使用成本 |
一次部署,无限调用,无 Token 费用 |
按量付费,高频使用成本高 |
|
网络依赖 |
完全离线可用,断网也能跑 |
必须联网,网络波动影响体验 |
|
响应延迟 |
无网络延迟,本地推理通常在 20-100ms |
受网络影响,100-1000ms 不等 |
|
模型选择 |
可选择任意开源模型并自由切换 |
只能使用平台提供的模型 |
|
性能上限 |
受限于你的硬件(显卡/内存) |
云端算力几乎无限 |
|
部署门槛 |
需要一定的动手能力(本文帮你解决) |
注册账号即可使用 |
|
定制能力 |
可自由微调、修改模型参数、构建 RAG |
定制能力有限,受平台约束 |
这些情况,强烈建议本地部署
① 隐私敏感场景:企业内部文档、医疗记录、法律文书等不能外传的数据
② 离线环境:军工、野外勘探、飞机上等无网络环境
③ 开发调试:需要频繁调参、测试不同模型,API 调用太慢且费钱
④ 成本控制:日均调用量超过 10 万 Token 时,本地部署 3 个月即可回本
⑤ 学习研究:想深入理解大模型工作原理,而非只会调用 API
这些情况,用云端就够了
• 偶尔用用,每天对话不到 100 次
• 电脑配置太低(4GB 内存以下),升级不如用云端
• 想要 GPT-5、Claude 4 这类闭源的最新模型
• 不想折腾,追求即开即用
1.2 显存占用是怎么算的?
新手最懵的点:到底需要多大显存才能跑模型?一句话说透:跑大模型,显存(VRAM)才是核心,CPU 核心数、内存频率真没那么重要。
核心计算公式
所需显存 ≈ 模型参数量 × (量化精度 / 8) × 1.2
简单解释:
- 模型参数量:比如 7B 就是 70 亿参数
- 量化精度:FP16 = 16 位(2字节),INT8 = 8 位(1字节),INT4 = 4 位(0.5字节)
- 1.2:预留 20% 给 KV Cache(键值缓存)和系统开销
不同精度下的显存占用速查表
|
模型参数量 |
FP16 权重 |
INT8 量化 |
INT4 量化 |
推理总显存 (INT4) |
|
1B-3B |
2-6 GB |
1-3 GB |
0.5-1.5 GB |
2-4 GB |
|
7B-8B |
14-16 GB |
7-8 GB |
3.5-4 GB |
4-6 GB |
|
13B-14B |
26-28 GB |
13-14 GB |
6.5-7 GB |
8-10 GB |
|
32B-34B |
64-68 GB |
32-34 GB |
16-17 GB |
19-24 GB |
|
70B-72B |
140-144 GB |
70-72 GB |
35-36 GB |
40-48 GB |
注意:上表是使用 INT4 量化后的推理总显存。如果用 FP16 原版精度,显存需求大约是上表的 3-4 倍。
量化是什么?(小白理解版)
把模型想象成一本高清画册:
• FP16 = 原版高清画册,每张图占 2MB(最清晰,最占空间)
• INT8 = 压缩版,每张图占 1MB(肉眼几乎看不出区别)
• INT4 = 高度压缩版,每张图占 0.5MB(略有损失,但大多数场景够用)
对于新手来说,INT4 量化(Q4_K_M)是最推荐的选择——显存占用只有 FP16 的 1/4,但回答质量下降很小(通常 < 5%)。
1.3 如何根据你的显卡选择合适的模型
第一步:查看你的显卡和显存
Windows:打开任务管理器 → 性能 → GPU
Linux:终端输入 nvidia-smi
macOS:左上角苹果菜单 → 关于本机 → 查看"内存"(Apple Silicon 统一内存即显存)
|
你的显卡 |
显存 |
推荐模型(INT4 量化) |
预期体验 |
|
无独显 / 核显 |
8-16GB 系统内存 |
Qwen3.6-4B, Phi-4-mini, Gemma 4-4B |
基础对话、摘要、翻译 |
|
GTX 1060 / RTX 3050 |
4-6 GB |
Qwen3.6-4B, Gemma 4-4B, Phi-4-mini |
日常聊天、文案润色 |
|
RTX 3060 12GB / RTX 4060 |
8-12 GB |
Qwen3.6-9B, Mistral-7B, Llama3.1-8B |
日常助手、代码提示、翻译 |
|
RTX 4060 Ti 16GB / RTX 4070 |
12-16 GB |
Qwen3.6-27B (Q4), DeepSeek-Coder-V3, GLM-9B |
代码生成、长文写作、推理 |
|
RTX 4070 Ti Super / RTX 4080 |
16 GB |
Qwen3.6-35B-A3B (Q4), DeepSeek-R1-32B |
复杂推理、专业代码审查 |
|
RTX 4090 / RTX 5080 |
24 GB |
Qwen3.6-35B-A3B (Q5), DeepSeek-V4-Flash, Llama3.1-70B(Q4) |
顶级本地体验,接近 GPT-4 水平 |
|
RTX 5090 / A5000 |
24-32 GB |
Qwen3.6-122B-A10B (Q4), 70B 量化稳定运行 |
消费级天花板 |
|
Apple M1/M2/M3 (16GB+) |
统一内存 |
Qwen3.6-9B\~27B, Llama3.1-8B |
利用 Metal 加速,效果不错 |
|
Apple M3 Ultra (64GB+) |
统一内存 |
DeepSeek-V4-Flash, Qwen3.6-122B-A10B |
Mac 最强本地 AI 体验 |
第二步:对照下表选模型
|
模型 |
出品方 |
参数规模 |
推荐理由 |
中文支持 |
开源协议 |
|
Qwen3.6 |
阿里巴巴 |
0.8B~397B (MoE) |
2026年4月最新版,27B 稠密模型编码极强,35B-A3B MoE 速度快到离谱 |
极佳 |
Apache 2.0 |
|
Qwen3.5 |
阿里巴巴 |
0.8B~397B (MoE) |
2026年2月发布,全系列原生多模态(文本+图像+视频),DeltaNet 混合架构 |
极佳 |
Apache 2.0 |
|
Qwen3 |
阿里巴巴 |
0.5B~235B (MoE) |
生态最完善,硬件兼容性最好,4B 版本可在树莓派运行 |
极佳 |
Apache 2.0 |
|
DeepSeek V4-Flash |
深度求索 |
284B/13B 激活 (MoE) |
2026年4月发布,MIT 协议,1M 超长上下文,性价比之王 |
极佳 |
MIT |
|
DeepSeek V4-Pro |
深度求索 |
1.6T/49B 激活 (MoE) |
前沿推理能力,SWE-Bench 达 80.6%,接近闭源前沿水平 |
极佳 |
MIT |
|
DeepSeek V3/R1 |
深度求索 |
671B/37B 激活 (MoE) |
推理能力全球顶尖,中文极强,R1 推理链展现完整思考过程 |
极佳 |
MIT |
|
GLM-5.1 |
智谱 AI |
744B/40B 激活 (MoE) |
2026年4月发布,MIT 协议,200K 上下文,类 Claude Opus 定位 |
极佳 |
MIT |
|
GLM-Z1 |
智谱 AI |
9B~32B |
中文理解力强,指令遵循度高,推理速度快 |
极佳 |
Apache 2.0 |
|
Llama 4 (Scout/Maverick) |
Meta |
17B~109B (MoE) |
英文生态最丰富,社区资源最多,最高 512K 超长上下文 |
良好 |
Llama 4 Community |
|
Llama 3.1 |
Meta |
8B~405B |
社区标准,几乎所有工具/框架最先支持 |
良好 |
Llama 3 Community |
|
Mistral Small 3.1 |
Mistral AI |
24B |
轻量高效,Apache 2.0 协议,企业友好 |
良好 |
Apache 2.0 |
|
Mistral (7B) |
Mistral AI |
7B |
轻量级代表,多语言支持好,速度快 |
良好 |
Apache 2.0 |
|
Gemma 4 |
|
2B~31B (含 MoE) |
2026年4月发布,Apache 2.0,知识蒸馏极致,同参数级越级打怪 |
中等 |
Apache 2.0 |
|
Gemma 3 |
|
2B~27B |
轻量级模型中的佼佼者,单卡友好 |
中等 |
Gemma Terms |
|
Phi-4 |
Microsoft |
5B~14B |
MIT 协议,小参数大能力,边缘设备首选 |
良好 |
MIT |
|
Kimi K2.6 |
月之暗面 |
MoE (未公开) |
超长上下文编码,多智能体编排,代码生成能力强 |
极佳 |
自定义 |
2026年推荐模型速览
2 从零开始部署大模型
2.1 基础篇:Ollama 一键部署(新手首选)
Ollama 是什么?
简单说,Ollama 就是一个"大模型界的 Docker"——它把复杂的模型下载、环境配置、依赖管理全部打包好,让你用一条命令就能跑起大模型。底层基于 llama.cpp,支持 Windows / macOS / Linux 全平台。
2.1.1 安装 Ollama

Windows 安装
① 访问 ollama.com/download 下载 OllamaSetup.exe
② 双击安装,一路下一步即可
③ 安装完成后,打开 PowerShell 或 命令提示符,输入:ollama --version

看到版本号(如 ollama version 0.6.x)说明安装成功。
macOS 安装
# 方式一:Homebrew(推荐)
brew install ollama
# 方式二:官网下载 .dmg 安装包
# 访问 https://ollama.com/download 下载后双击安装
Linux 安装
# 一行命令安装
curl -fsSL https://ollama.com/install.sh | sh
# 验证安装
ollama --version
2.1.2 下载并运行你的第一个模型
# 下载并运行 Qwen3 0.6B 模型
ollama run qwen3:0.6b-q4_K_M
# 或者使用 Llama 3.1 8B(英文场景)
ollama run llama3.1:8b
# 使用 DeepSeek-R1 7B(推理能力强)
ollama run deepseek-r1:7b

第一次运行会自动下载模型(约 4-5GB),下载完成后直接进入对话界面,你就可以和模型聊天了!

2.1.3 Ollama 常用命令
# 查看已安装的模型列表
ollama list
# 查看模型详细信息(大小、量化精度、参数等)
ollama show qwen3:0.6b
# 仅下载模型(不启动对话)
ollama pull qwen3:0.6b
# 删除模型
ollama rm qwen3:0.6b
# 使用指定量化版本(推荐 Q4_K_M,最平衡的选择)
ollama run qwen3:0.6b-q4_K_M
# 查看当前运行状态
ollama ps
# 停止运行中的模型
ollama stop qwen3:0.6b
2.1.4 通过 API 调用 Ollama(Python 示例)
Ollama 的 API 与 OpenAI 格式兼容,改个 base_url 就能用:
from openai import OpenAI
# 连接到本地 Ollama 服务(默认端口 11434)
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # 本地服务随便填,不会校验
)
# 发起对话
response = client.chat.completions.create(
model="qwen3:7b",
messages=[
{"role": "system", "content": "你是一个乐于助人的AI助手。"},
{"role": "user", "content": "请用一句话解释什么是机器学习。"}
],
temperature=0.7,
max_tokens=500
)
print(response.choices[0].message.content)

2.1.5 自定义模型配置(Modelfile)
如果需要调整模型参数(如上下文长度、温度等),可以创建 Modelfile:
# 文件名:Modelfile
FROM qwen3:7b
# 设置上下文长度(默认只有 2048,建议调大)
PARAMETER num_ctx 8192
# 设置温度(0-1,越低越确定,越高越有创意)
PARAMETER temperature 0.7
# 设置系统提示词
SYSTEM """你是一个专业的Python编程助手,回答问题时请使用中文,并给出代码示例。"""
# 构建自定义模型
ollama create my-qwen -f Modelfile
# 运行自定义模型
ollama run my-qwen
2.2 进阶篇:vLLM 高性能部署
vLLM 是什么?
vLLM 是伯克利大学开源的生产级推理引擎,专为高并发、高吞吐场景设计。它使用 PagedAttention 技术,显存利用率比传统方案提升 95%,多用户并发时吞吐量是 Ollama 的 5-20 倍。
前置要求:vLLM 需要 NVIDIA GPU(计算能力 7.0+,即 GTX 10 系列以上)、Linux 系统、Python 3.9-3.12、CUDA 11.8+。Windows 用户建议使用 WSL2 或 Docker。
2.2.1 安装 vLLM
# 1. 安装wsl。安装完后重启电脑
wsl --install
# 2. 启动wsl,按照上一个教程安装好anaconda后,创建新的 Python 虚拟环境
wsl
conda create -n vllm python=3.11 -y
conda activate vllm
# 3. 安装 vLLM(自动安装 PyTorch + CUDA 依赖)
pip install vllm
# 4. 验证安装
python -c "import vllm; print(vllm.__version__)"
![]()
2.2.2 下载模型,启动 OpenAI 兼容 API 服务器
git clone https://www.modelscope.cn/cyankiwi/Qwen3.5-9B-AWQ-4bit.git
使用git命令下载模型
# 启动 vLLM API 服务(单 GPU)
CUDA_VISIBLE_DEVICES=1 VLLM_USE_FLASHINFER_SAMPLER=0 \
python -m vllm.entrypoints.openai.api_server \
--model /mnt/e/models/Qwen3.5-9B-AWQ-4bit \
--host 0.0.0.0 \
--port 8000 \
--max-model-len 4096 \
--gpu-memory-utilization 0.7 \
--dtype auto
--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--tensor-parallel-size 1

参数说明:
CUDA_VISIBLE_DEVICES=1:使用第二块显卡,博主这里用两张显卡
VLLM_USE_FLASHINFER_SAMPLER=0:禁用FlashInfer 采样器,由于博主采用不稳定所以采用torch原生的采样器
|
参数 |
含义 |
建议值 |
|
--model |
模型名称(HuggingFace 路径或本地路径) |
按需选择 |
|
--host |
监听地址 |
0.0.0.0(允许外部访问) |
|
--port |
监听端口 |
8000 |
|
--max-model-len |
最大上下文长度 |
4096-8192(越长越吃显存) |
|
--gpu-memory-utilization |
GPU 显存使用比例 |
0.85-0.90(不要设 0.95,容易 OOM) |
|
--dtype |
数据类型 |
auto(自动选择最优) |
|
--tensor-parallel-size |
多卡并行数 |
有多少张 GPU 就设多少 |
|
--enable-auto-tool-choice |
是否启用工具 |
与tool-call-parser配合使用 |
2.2.3 调用 vLLM API(Python 示例)
from openai import OpenAI
# vLLM 的 API 也是 OpenAI 兼容的
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="not-needed" # 本地服务不需要
)
response = client.chat.completions.create(
model="/mnt/e/models/Qwen3.5-9B-AWQ-4bit",
messages=[
{"role": "user", "content": "你好,请介绍一下你自己。"}
],
max_tokens=200
)
print(response.choices[0].message.content)

也可以用 curl 测试:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "/mnt/e/models/Qwen3.5-9B-AWQ-4bit",
"messages": [{"role": "user", "content": "你好"}],
"max_tokens": 100
}'
2.2.4 多 GPU 并行(Tensor Parallelism)
如果你有多张 GPU,vLLM 可以自动拆分模型到多张卡上:
# 使用 2 张 GPU 并行推理
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen3-70B-Instruct-AWQ \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.90
2.3 Ollama vs vLLM:深度对比分析
一张表看懂全部差异
|
对比维度 |
Ollama |
vLLM |
|
核心定位 |
桌面端本地 AI 工具 |
生产级推理服务器 |
|
安装难度 |
一行命令,5 分钟搞定 |
需配置 Python 环境、CUDA,约 15-30 分钟 |
|
上手门槛 |
极低,会用命令行就能玩 |
中等,需要了解 Python 和 Linux 基础 |
|
操作系统 |
Windows / macOS / Linux 全支持 |
仅 Linux(Windows 需 WSL2/Docker) |
|
硬件要求 |
无 GPU 也能跑(CPU 模式),支持 Apple Silicon |
需要 NVIDIA GPU(计算能力 7.0+),16GB 显存起步 |
|
单用户速度 |
优秀(7B 模型约 80-120 tok/s) |
良好(7B 模型约 90-140 tok/s) |
|
多用户并发 |
弱(4-8 并发即排队,16 并发崩溃) |
强(256+ 并发稳定,吞吐量是 Ollama 的 5-20 倍) |
|
显存效率 |
良好(静态分配) |
优秀(PagedAttention,利用率提升 95%) |
|
多 GPU 支持 |
有限 |
原生支持张量并行 + 流水线并行 |
|
量化格式 |
GGUF(Q4_K_M 等) |
AWQ, GPTQ, FP8, INT8, GGUF |
|
API 兼容性 |
自有 API + OpenAI 兼容 |
完整 OpenAI 兼容 |
|
模型管理 |
自动下载、版本管理,超方便 |
手动管理(需自己下载 HuggingFace 模型) |
|
上下文管理 |
动态上下文缩放(自动适配显存) |
需手动指定 --max-model-len |
|
社区生态 |
丰富的 GUI 工具(Open WebUI、LM Studio 等) |
偏开发者工具,需自行搭建前端 |
性能实测数据(RTX 4090 24GB,Qwen2.5-7B)
|
测试场景 |
Ollama |
vLLM |
胜出 |
|
单用户,2K 上下文 |
78 tok/s |
145 tok/s |
vLLM(快 86%) |
|
4 并发请求 |
排队执行,总耗时 4x |
并行处理,总耗时 1.2x |
vLLM(快 3.3 倍) |
|
16 并发请求 |
崩溃 |
610 tok/s 总吞吐 |
vLLM(碾压) |
|
显存占用(7B Q4) |
7.2 GB |
8.8 GB(含 KV Cache) |
Ollama(略省) |
|
显存占用(70B Q4) |
21.5 GB |
10.7 GB |
vLLM(省 50%) |
决策建议:什么时候用哪个?
选 Ollama 的情况:
• 你是新手,想快速体验本地大模型
• 只有一台电脑,用于个人日常使用
• 需要 Windows / macOS 支持
• 经常切换不同模型做实验
• 不需要高并发(同时只有你一个人用)
选 vLLM 的情况:
• 需要为团队或公司提供 API 服务(多用户同时访问)
• 有多张 GPU 需要充分利用
• 要求极致的吞吐量和低延迟
• 已有 Linux 服务器,愿意投入配置时间
• 对显存效率有极致追求(同等硬件跑更大模型)
一句话总结:个人玩用 Ollama,生产部署用 vLLM。
3 总结与常见问题
3.1 总结:我该选哪个?
|
你的需求 |
推荐方案 |
|
就想试试,能聊就行 |
Ollama + qwen3:7b |
|
开发者日常写代码用 |
Ollama + deepseek-coder-v2:16b |
|
给团队搭 API 服务 |
vLLM + Qwen3-32B-AWQ |
|
多张显卡想跑大模型 |
vLLM + tensor-parallel |
|
MacBook(无 NVIDIA 卡) |
Ollama(Metal 加速) |
|
8GB 内存老笔记本 |
Ollama + qwen3:4b |
核心要点回顾
1. 显存决定一切:你能跑什么模型,取决于显存大小,而非 CPU 性能
2. INT4 量化是新手最佳选择:4-6GB 显存就能跑 7B 模型,质量损失不到 5%
3. Ollama = 简单,vLLM = 强大:从 Ollama 入门,有需要再上 vLLM
4. 中文用户首选 Qwen3 和 DeepSeek:中文能力最强,社区生态最完善
5. 本地部署不是零成本:需要一次性硬件投入,但长期高频使用比云端 API 便宜得多
3.2 常见问题与解决方案
Q1:运行时提示 "model requires more system memory"(显存不足)
原因:模型太大,显存放不下。
解决:
1. 换更小的量化版本:ollama run qwen3:7b-instruct-q4_K_M(不要用默认版本)
2. 换更小的模型:7B 不行就换 4B,4B 不行就换 1.5B
3. 限制上下文长度:ollama run qwen3:7b --num-ctx 2048
4. 关闭其他占用显存的程序(浏览器、游戏等)
Q2:Ollama 没有调用 GPU,一直在用 CPU 跑(速度极慢)
原因:GPU 未被正确识别,通常是因为 NVIDIA 驱动问题。
解决:
# 1. 先确认系统能识别 GPU
nvidia-smi
# 2. 如果 nvidia-smi 报错,说明驱动有问题,重新安装 NVIDIA 驱动
# 访问 https://www.nvidia.com/drivers 下载最新驱动
# 3. Linux 下可以尝试强制加载驱动
sudo nvidia-modprobe -u
sudo rmmod nvidia_uvm && sudo modprobe nvidia_uvm
# 4. Windows 下检查 Ollama 日志
# 按 Win+R,输入:%LOCALAPPDATA%\Ollama\server.log
Q3:模型回答质量很差,胡言乱语
可能原因:
1. 用了错误的量化精度:默认的 Q4_K_M 质量不错,如果用了更低的 Q2_K 可能质量下降明显
2. Prompt 模板不对:确保使用 Instruct 版本(如 qwen3:7b-instruct-q4_K_M),而非 Base 版本
3. 上下文长度太短:默认只有 2048,长对话会被截断。修改 Modelfile 调大 num_ctx
# 使用 Instruct 版本(有指令微调)
ollama run qwen3:7b-instruct-q4_K_M
# 而非 Base 版本(没有指令微调,不适合对话)
# ollama run qwen3:7b # ❌ 不推荐
Q4:vLLM 安装失败,提示 CUDA 版本不兼容
解决:
# 1. 确认 CUDA 版本
nvcc --version
nvidia-smi # 查看右上角 CUDA Version
# 2. 创建干净的 conda 环境重新安装
conda create -n vllm python=3.11 -y
conda activate vllm
# 3. 安装指定 CUDA 版本的 vLLM
pip install vllm # 默认 CUDA 12.1
# 如果是 CUDA 11.8
pip install vllm --extra-index-url https://download.pytorch.org/whl/cu118
Q5:vLLM 启动后显存占用过高,报 OOM
解决:
1. 降低 --gpu-memory-utilization:从 0.90 降到 0.85 甚至 0.80
2. 缩短 --max-model-len:从 8192 降到 4096
3. 使用量化版本:--quantization awq
4. 减少 --max-num-seqs:默认 256,可降到 32
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen3-7B-Instruct-AWQ \
--quantization awq \
--gpu-memory-utilization 0.80 \
--max-model-len 4096 \
--max-num-seqs 32
Q6:Ollama 服务无法启动,提示端口被占用
解决:
# Windows:查看端口占用
netstat -ano | findstr :11434
# Linux/macOS:查看端口占用
lsof -i :11434
# 杀死占用进程后重新启动
# 或者直接重启 Ollama 服务
# Linux
sudo systemctl restart ollama
# macOS
pkill ollama && ollama serve
Q7:API 调用报 "Connection Refused"
原因:Ollama 服务没有在后台运行。
解决:
# 手动启动 Ollama 服务
ollama serve
# 或者在另一个终端窗口运行模型时,Ollama 会自动启动服务
Q8:Windows 下 PowerShell 无法识别 `ollama` 命令
解决:
1. 关闭所有终端窗口,重新打开(PATH 不会自动刷新)
2. 如果还不行,手动添加环境变量:%LOCALAPPDATA%\Programs\Ollama
3. 或者直接使用完整路径:%LOCALAPPDATA%\Programs\Ollama\ollama.exe
Q9:模型回复到一半就停了
原因:
1. max_tokens 设置太小
2. 上下文长度不足,被截断
解决:
# API 调用时设置更大的 max_tokens
response = client.chat.completions.create(
model="qwen3:7b",
messages=[...],
max_tokens=4096 # 增大这个值
)
# 或在 Modelfile 中设置
# PARAMETER num_predict 4096
3.3 推荐学习路径
第一步:安装 Ollama,跑通第一个模型(本文 2.1 节)
↓
第二步:熟悉 Ollama 常用命令和 API 调用
↓
第三步:尝试不同模型,找到最适合你场景的那个
↓
第四步:学习 Modelfile,自定义模型参数
↓
第五步:搭建 Open WebUI 图形界面,获得类 ChatGPT 体验
↓
第六步(可选):学习 vLLM,搭建生产级 API 服务
↓
第七步(可选):学习 RAG(检索增强生成),构建私有知识库
推荐配套工具
|
工具 |
用途 |
链接 |
|
Open WebUI |
为 Ollama/vLLM 提供 ChatGPT 风格的 Web 界面 |
[github.com/open-webui/open-webui](https://github.com/open-webui/open-webui) |
|
LM Studio |
图形化本地模型管理工具(适合不喜欢命令行的用户) |
[lmstudio.ai](https://lmstudio.ai) |
|
Continue |
VS Code / JetBrains IDE 插件,用本地模型做代码补全 |
[continue.dev](https://continue.dev) |
|
LiteLLM |
统一 API 网关,管理多个模型服务 |
[github.com/BerriAI/litellm](https://github.com/BerriAI/litellm) |
|
LangChain |
构建 LLM 应用的主流框架,支持 Ollama 和 vLLM |
[langchain.com](https://langchain.com) |
其实本地部署大模型,远没有想象中复杂 —— 不用啃厚厚的技术文档,不用精通编程,从安装 Ollama 开始,下载一个轻量模型,十几分钟就能体验到本地 AI 的流畅感。
我们不用追求一步到位:先跑通基础版本,感受本地部署的优势;再根据自己的需求,慢慢尝试自定义配置、切换模型,甚至进阶到 vLLM 的高性能部署。
无论是想保护数据隐私,还是想降低使用成本,亦或是单纯想探索 AI 的底层逻辑,本地部署都是值得一试的方向。你的电脑算力,不该只用来刷视频、打游戏 —— 把大模型装进去,让它成为你的专属助手,才是真正发挥了它的价值。
现在就动手试试吧,从第一条ollama run命令开始,开启你的本地大模型之旅。
更多推荐





所有评论(0)