Ollama 安装与初始化

Ollama 是一个开源的大型语言模型(LLM)工具,支持本地运行多种模型。安装 Ollama 需要根据操作系统执行不同的命令。以下是在不同平台上的安装方法:

Linux/macOS

curl -fsSL https://ollama.com/install.sh | sh

Windows (PowerShell)

irm https://ollama.com/install.ps1 | iex

安装完成后,启动 Ollama 服务:

ollama serve

模型管理

Ollama 支持多种预训练模型,可以通过命令行拉取、运行和管理模型。

拉取模型

ollama pull llama2  # 拉取 Meta 的 Llama2 模型
ollama pull mistral # 拉取 Mistral 7B 模型

查看已下载的模型

ollama list

删除模型

ollama rm llama2

运行模型

运行模型可以通过 ollama run 命令,支持交互式对话和直接生成文本。

交互式对话

ollama run llama2

输入后进入对话模式,直接与模型交互。

单次生成文本

ollama run llama2 "Explain quantum computing in simple terms."

自定义模型

Ollama 支持自定义模型配置,通过 Modelfile 定义模型参数和提示模板。

创建 Modelfile

FROM llama2
PARAMETER temperature 0.7
SYSTEM """
You are a helpful AI assistant that answers in concise sentences.
"""

构建自定义模型

ollama create mymodel -f ./Modelfile

运行自定义模型

ollama run mymodel "What is the capital of France?"

模型量化

Ollama 支持模型量化以减少资源占用。量化模型可以通过指定版本实现。

拉取量化模型

ollama pull llama2:7b-chat-q4_0  # 4-bit 量化版本

API 调用

Ollama 提供本地 HTTP API,可用于程序化调用模型。

通过 cURL 调用 API

curl -X POST http://localhost:11434/api/generate -d '{
  "model": "llama2",
  "prompt": "Why is the sky blue?"
}'

Python 示例

import requests

response = requests.post(
    "http://localhost:11434/api/generate",
    json={"model": "llama2", "prompt": "Explain Rust programming language"}
)
print(response.json()["response"])

多模态支持

部分 Ollama 模型支持图像输入,需要指定多模态模型。

拉取多模态模型

ollama pull llava

通过 API 发送图像

curl -X POST http://localhost:11434/api/generate -d '{
  "model": "llava",
  "prompt": "What is in this image?",
  "images": ["/path/to/image.jpg"]
}'

高级配置

Ollama 允许通过环境变量配置性能参数。

GPU 加速(Linux)

export OLLAMA_NO_CUDA=0  # 启用 CUDA
ollama run llama2

内存限制

export OLLAMA_MAX_MEMORY=16GB  # 限制内存使用

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐