Ollama本地LLM安装与使用指南
·
Ollama 安装与初始化
Ollama 是一个开源的大型语言模型(LLM)工具,支持本地运行多种模型。安装 Ollama 需要根据操作系统执行不同的命令。以下是在不同平台上的安装方法:
Linux/macOS
curl -fsSL https://ollama.com/install.sh | sh
Windows (PowerShell)
irm https://ollama.com/install.ps1 | iex
安装完成后,启动 Ollama 服务:
ollama serve
模型管理
Ollama 支持多种预训练模型,可以通过命令行拉取、运行和管理模型。
拉取模型
ollama pull llama2 # 拉取 Meta 的 Llama2 模型
ollama pull mistral # 拉取 Mistral 7B 模型
查看已下载的模型
ollama list
删除模型
ollama rm llama2
运行模型
运行模型可以通过 ollama run 命令,支持交互式对话和直接生成文本。
交互式对话
ollama run llama2
输入后进入对话模式,直接与模型交互。
单次生成文本
ollama run llama2 "Explain quantum computing in simple terms."
自定义模型
Ollama 支持自定义模型配置,通过 Modelfile 定义模型参数和提示模板。
创建 Modelfile
FROM llama2
PARAMETER temperature 0.7
SYSTEM """
You are a helpful AI assistant that answers in concise sentences.
"""
构建自定义模型
ollama create mymodel -f ./Modelfile
运行自定义模型
ollama run mymodel "What is the capital of France?"
模型量化
Ollama 支持模型量化以减少资源占用。量化模型可以通过指定版本实现。
拉取量化模型
ollama pull llama2:7b-chat-q4_0 # 4-bit 量化版本
API 调用
Ollama 提供本地 HTTP API,可用于程序化调用模型。
通过 cURL 调用 API
curl -X POST http://localhost:11434/api/generate -d '{
"model": "llama2",
"prompt": "Why is the sky blue?"
}'
Python 示例
import requests
response = requests.post(
"http://localhost:11434/api/generate",
json={"model": "llama2", "prompt": "Explain Rust programming language"}
)
print(response.json()["response"])
多模态支持
部分 Ollama 模型支持图像输入,需要指定多模态模型。
拉取多模态模型
ollama pull llava
通过 API 发送图像
curl -X POST http://localhost:11434/api/generate -d '{
"model": "llava",
"prompt": "What is in this image?",
"images": ["/path/to/image.jpg"]
}'
高级配置
Ollama 允许通过环境变量配置性能参数。
GPU 加速(Linux)
export OLLAMA_NO_CUDA=0 # 启用 CUDA
ollama run llama2
内存限制
export OLLAMA_MAX_MEMORY=16GB # 限制内存使用
更多推荐




所有评论(0)