本地 Ollama 安装大模型完整教程

什么是 Ollama?

Ollama 是一个轻量级的本地大语言模型运行工具,它让你可以在自己的电脑上轻松部署和运行各种开源大模型,无需依赖云端服务,完全离线运行,保护隐私。

一、Windows 系统安装步骤

1. 下载 Ollama

访问 Ollama 官网:https://ollama.com

点击 “Download” 按钮,选择 Windows 版本下载安装包。

2. 安装 Ollama

双击下载的安装包,按照提示完成安装:

  • 接受许可协议
  • 选择安装路径(建议使用默认路径)
  • 等待安装完成

安装完成后,Ollama 会自动在后台运行。

3. 验证安装

打开 PowerShell 或命令提示符,输入以下命令验证安装:

ollama --version

如果显示版本号,说明安装成功。

二、下载和运行大模型

1. 查看可用模型

访问 Ollama 模型库:https://ollama.com/library

这里列出了所有可用的模型,包括:

  • Llama 3 - Meta 最新开源模型
  • Qwen2.5 - 阿里巴巴通义千问
  • Gemma 2 - Google 开源模型
  • DeepSeek-V2 - 深度求索
  • ChatGLM3 - 清华智谱

2. 下载模型

使用以下命令下载模型(以 Llama 3 为例):

ollama run llama3

首次运行会自动下载模型文件,下载完成后即可开始对话。

3. 常用模型推荐

小内存推荐(4-8GB RAM):

ollama run llama3:8b          # 8B 参数,约 4.7GB
ollama run qwen2.5:7b         # 7B 参数,约 4.5GB
ollama run gemma2:9b          # 9B 参数,约 5.5GB

中等内存推荐(16GB RAM):

ollama run llama3:70b         # 70B 参数,约 40GB
ollama run qwen2.5:72b        # 72B 参数,约 41GB
ollama run mixtral:8x7b       # MoE 架构,约 26GB

中文优化模型:

ollama run qwen2.5:latest     # 通义千问,中文能力强
ollama run chatglm3:6b        # 清华智谱,中文优化
ollama run deepseek-v2:latest # 深度求索,性价比高

4. 管理已下载的模型

查看已安装的模型:

ollama list

删除模型:

ollama rm 模型名

更新模型:

ollama pull 模型名

三、Ollama 常用命令

基础命令

# 运行模型
ollama run <模型名>

# 创建自定义模型
ollama create <模型名> -f <Modelfile>

# 复制模型
ollama cp <源模型> <目标模型>

# 删除模型
ollama rm <模型名>

# 列出模型
ollama list

# 拉取模型(不运行)
ollama pull <模型名>

高级用法

后台运行 API 服务:

ollama serve

默认监听 http://localhost:11434

调用 API 生成内容:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3",
  "prompt": "Hello, how are you?"
}'

四、配置优化

1. 修改模型存储位置

默认模型存储在 C:\Users\用户名\.ollama\models

可以通过设置环境变量修改存储位置:

$env:OLLAMA_MODELS = "D:\Ollama\Models"

永久设置:

  1. 右键"此电脑" → 属性
  2. 高级系统设置 → 环境变量
  3. 新建系统变量:OLLAMA_MODELS
  4. 值设置为你想要的路径

2. GPU 加速

Ollama 支持 NVIDIA 和 AMD GPU 加速:

NVIDIA GPU:

  • 确保安装最新显卡驱动
  • Ollama 会自动检测并使用 CUDA

AMD GPU:

  • 需要安装 ROCm 驱动
  • Windows 支持有限,建议使用 Linux

3. 性能优化建议

  • 使用量化模型:选择 q4_0q5_0 等量化版本,减少内存占用
  • 关闭其他占用内存的程序:确保有足够 RAM
  • 使用 SSD:加快模型加载速度
  • 调整上下文长度:减少内存使用

五、常见问题解决

问题 1:下载速度慢

解决方案:

  • 使用国内镜像源
  • 使用代理或加速器
  • 选择较小的模型版本

问题 2:内存不足

解决方案:

  • 选择更小的模型(如 7B 而不是 70B)
  • 使用量化版本(q4_0、q5_0)
  • 关闭其他程序释放内存
  • 增加虚拟内存

问题 3:模型运行缓慢

解决方案:

  • 使用 GPU 加速
  • 减少上下文长度
  • 选择更小的模型
  • 确保使用 SSD 存储

问题 4:中文效果不好

解决方案:

  • 使用中文优化模型(Qwen、ChatGLM、DeepSeek)
  • 在提示词中明确要求使用中文
  • 调整温度参数(temperature)

六、实战示例

示例 1:日常对话

ollama run llama3
>>> 你好,请介绍一下自己
>>> 帮我写一封邮件

示例 2:代码生成

ollama run qwen2.5:7b
>>> 请用 Python 写一个快速排序算法
>>> 解释一下这段代码的工作原理

示例 3:文档总结

ollama run chatglm3:6b
>>> 请总结以下文章的主要内容:[粘贴文章内容]

示例 4:翻译任务

ollama run deepseek-v2
>>> 将以下内容翻译成英文:[中文内容]
>>> 将以下内容翻译成中文:[English content]

七、进阶使用

1. 创建自定义模型

创建 Modelfile

FROM llama3

# 设置系统提示词
SYSTEM """
你是一个专业的编程助手,擅长 Python 和 JavaScript。
请用简洁、专业的语言回答问题。
"""

# 设置参数
PARAMETER temperature 0.7
PARAMETER top_p 0.9

创建模型:

ollama create mycoder -f Modelfile

2. 集成到其他应用

使用 Python 调用:

import requests

response = requests.post(
    'http://localhost:11434/api/generate',
    json={
        'model': 'llama3',
        'prompt': '你好'
    }
)

print(response.json())

使用 Node.js 调用:

const response = await fetch('http://localhost:11434/api/generate', {
  method: 'POST',
  headers: { 'Content-Type': 'application/json' },
  body: JSON.stringify({
    model: 'llama3',
    prompt: '你好'
  })
});

const data = await response.json();

八、总结

Ollama 让本地运行大模型变得异常简单:

优点:

  • 安装简单,一键部署
  • 完全离线,保护隐私
  • 模型丰富,选择多样
  • 免费开源,持续更新
  • 支持 GPU 加速

⚠️ 注意事项:

  • 大模型需要较多内存和存储
  • 中文场景建议选择中文优化模型
  • 首次下载模型需要时间
  • 建议使用 SSD 提升体验

开始你的本地大模型之旅吧!🚀


参考资源:

  • Ollama 官网:https://ollama.com
  • 模型库:https://ollama.com/library
  • GitHub:https://github.com/ollama/ollama
  • 文档:https://github.com/ollama/ollama/tree/main/docs
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐