本地 Ollama 安装大模型完整教程
·
本地 Ollama 安装大模型完整教程
什么是 Ollama?
Ollama 是一个轻量级的本地大语言模型运行工具,它让你可以在自己的电脑上轻松部署和运行各种开源大模型,无需依赖云端服务,完全离线运行,保护隐私。
一、Windows 系统安装步骤
1. 下载 Ollama
访问 Ollama 官网:https://ollama.com
点击 “Download” 按钮,选择 Windows 版本下载安装包。
2. 安装 Ollama
双击下载的安装包,按照提示完成安装:
- 接受许可协议
- 选择安装路径(建议使用默认路径)
- 等待安装完成
安装完成后,Ollama 会自动在后台运行。
3. 验证安装
打开 PowerShell 或命令提示符,输入以下命令验证安装:
ollama --version
如果显示版本号,说明安装成功。
二、下载和运行大模型
1. 查看可用模型
访问 Ollama 模型库:https://ollama.com/library
这里列出了所有可用的模型,包括:
- Llama 3 - Meta 最新开源模型
- Qwen2.5 - 阿里巴巴通义千问
- Gemma 2 - Google 开源模型
- DeepSeek-V2 - 深度求索
- ChatGLM3 - 清华智谱
2. 下载模型
使用以下命令下载模型(以 Llama 3 为例):
ollama run llama3
首次运行会自动下载模型文件,下载完成后即可开始对话。
3. 常用模型推荐
小内存推荐(4-8GB RAM):
ollama run llama3:8b # 8B 参数,约 4.7GB
ollama run qwen2.5:7b # 7B 参数,约 4.5GB
ollama run gemma2:9b # 9B 参数,约 5.5GB
中等内存推荐(16GB RAM):
ollama run llama3:70b # 70B 参数,约 40GB
ollama run qwen2.5:72b # 72B 参数,约 41GB
ollama run mixtral:8x7b # MoE 架构,约 26GB
中文优化模型:
ollama run qwen2.5:latest # 通义千问,中文能力强
ollama run chatglm3:6b # 清华智谱,中文优化
ollama run deepseek-v2:latest # 深度求索,性价比高
4. 管理已下载的模型
查看已安装的模型:
ollama list
删除模型:
ollama rm 模型名
更新模型:
ollama pull 模型名
三、Ollama 常用命令
基础命令
# 运行模型
ollama run <模型名>
# 创建自定义模型
ollama create <模型名> -f <Modelfile>
# 复制模型
ollama cp <源模型> <目标模型>
# 删除模型
ollama rm <模型名>
# 列出模型
ollama list
# 拉取模型(不运行)
ollama pull <模型名>
高级用法
后台运行 API 服务:
ollama serve
默认监听 http://localhost:11434
调用 API 生成内容:
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "Hello, how are you?"
}'
四、配置优化
1. 修改模型存储位置
默认模型存储在 C:\Users\用户名\.ollama\models
可以通过设置环境变量修改存储位置:
$env:OLLAMA_MODELS = "D:\Ollama\Models"
永久设置:
- 右键"此电脑" → 属性
- 高级系统设置 → 环境变量
- 新建系统变量:
OLLAMA_MODELS - 值设置为你想要的路径
2. GPU 加速
Ollama 支持 NVIDIA 和 AMD GPU 加速:
NVIDIA GPU:
- 确保安装最新显卡驱动
- Ollama 会自动检测并使用 CUDA
AMD GPU:
- 需要安装 ROCm 驱动
- Windows 支持有限,建议使用 Linux
3. 性能优化建议
- 使用量化模型:选择
q4_0、q5_0等量化版本,减少内存占用 - 关闭其他占用内存的程序:确保有足够 RAM
- 使用 SSD:加快模型加载速度
- 调整上下文长度:减少内存使用
五、常见问题解决
问题 1:下载速度慢
解决方案:
- 使用国内镜像源
- 使用代理或加速器
- 选择较小的模型版本
问题 2:内存不足
解决方案:
- 选择更小的模型(如 7B 而不是 70B)
- 使用量化版本(q4_0、q5_0)
- 关闭其他程序释放内存
- 增加虚拟内存
问题 3:模型运行缓慢
解决方案:
- 使用 GPU 加速
- 减少上下文长度
- 选择更小的模型
- 确保使用 SSD 存储
问题 4:中文效果不好
解决方案:
- 使用中文优化模型(Qwen、ChatGLM、DeepSeek)
- 在提示词中明确要求使用中文
- 调整温度参数(temperature)
六、实战示例
示例 1:日常对话
ollama run llama3
>>> 你好,请介绍一下自己
>>> 帮我写一封邮件
示例 2:代码生成
ollama run qwen2.5:7b
>>> 请用 Python 写一个快速排序算法
>>> 解释一下这段代码的工作原理
示例 3:文档总结
ollama run chatglm3:6b
>>> 请总结以下文章的主要内容:[粘贴文章内容]
示例 4:翻译任务
ollama run deepseek-v2
>>> 将以下内容翻译成英文:[中文内容]
>>> 将以下内容翻译成中文:[English content]
七、进阶使用
1. 创建自定义模型
创建 Modelfile:
FROM llama3
# 设置系统提示词
SYSTEM """
你是一个专业的编程助手,擅长 Python 和 JavaScript。
请用简洁、专业的语言回答问题。
"""
# 设置参数
PARAMETER temperature 0.7
PARAMETER top_p 0.9
创建模型:
ollama create mycoder -f Modelfile
2. 集成到其他应用
使用 Python 调用:
import requests
response = requests.post(
'http://localhost:11434/api/generate',
json={
'model': 'llama3',
'prompt': '你好'
}
)
print(response.json())
使用 Node.js 调用:
const response = await fetch('http://localhost:11434/api/generate', {
method: 'POST',
headers: { 'Content-Type': 'application/json' },
body: JSON.stringify({
model: 'llama3',
prompt: '你好'
})
});
const data = await response.json();
八、总结
Ollama 让本地运行大模型变得异常简单:
✅ 优点:
- 安装简单,一键部署
- 完全离线,保护隐私
- 模型丰富,选择多样
- 免费开源,持续更新
- 支持 GPU 加速
⚠️ 注意事项:
- 大模型需要较多内存和存储
- 中文场景建议选择中文优化模型
- 首次下载模型需要时间
- 建议使用 SSD 提升体验
开始你的本地大模型之旅吧!🚀
参考资源:
- Ollama 官网:https://ollama.com
- 模型库:https://ollama.com/library
- GitHub:https://github.com/ollama/ollama
- 文档:https://github.com/ollama/ollama/tree/main/docs
更多推荐




所有评论(0)