Unsloth-本地微调和运行大模型的终极工具

今天聊一个把"大模型推理"和"大模型微调"打通的项目——Unsloth。
简介
Unsloth 是一个大模型训练和推理的一站式平台,GitHub 65.2k Star,由 Daniel Han 和 Michael Han 兄弟创建。核心能力两个:训练快、省显存。
微调 500+ 模型,速度最高提升 2 倍,显存最多省 70%,精度不掉。这个数据来自自定义的 Triton 内核和数学优化,跟 PyTorch、Hugging Face 官方都有合作。
Unsloth 现在分两个产品形态:
- Unsloth Studio:Web UI,支持 Windows、Linux、macOS,本地一键启动,能跑模型也能训模型
- Unsloth Core:纯代码方式,pip 安装,适合脚本化和 Notebook 场景
先放一张 Studio 的界面:

unsloth studio ui homepage
功能亮点
推理侧:
- 搜索、下载、运行模型,支持 GGUF、LoRA adapter、safetensors 多种格式
- 模型导出为 GGUF、16-bit safetensors,方便部署到 llama.cpp、vLLM、Ollama
- Tool Calling 带自愈能力,调用失败能自动修复重试
- 代码执行沙箱,LLM 可以在沙箱里跑代码验证结果
- API 推理端点,兼容 OpenAI 格式,能直接对接 Claude Code、Codex
- 支持图片、音频、PDF、DOCX 多模态输入
- 可接入外部 API 提供商(OpenAI、Anthropic)或本地服务器(vLLM、Ollama、llama.cpp)
训练侧:
- 支持全量微调、LoRA、RL、预训练,4-bit / 16-bit / FP8 都行
- GRPO 强化学习,显存节省 80%
- Data Recipes:从 PDF、CSV、DOCX 自动生成训练数据集,可视化节点编排
- 训练过程实时可观测,loss 曲线、GPU 占用一目了然
- 多 GPU 训练已支持,大升级在路上
模型竞技场(Model Arena):两个模型并排跑,同一个问题同时回答,方便对比微调前后的效果。
性能数据
这是官方给出的微调性能对比,数据来自 README:
| 模型 | 训练加速 | 显存节省 |
|---|---|---|
| Gemma 4 (E2B) | 1.5x | 50% |
| Qwen3.5 (4B) | 1.5x | 60% |
| gpt-oss (20B) | 2x | 70% |
| gpt-oss (20B) GRPO | 2x | 80% |
| Qwen3 Advanced GRPO | 2x | 70% |
| Llama 3.1 (8B) | 2x | 70% |
| Llama 3.2 | 2x | 70% |
| Mistral Ministral 3 (3B) | 1.5x | 60% |
| Orpheus-TTS (3B) | 1.5x | 50% |
| embeddinggemma (300M) | 2x | 20% |
还有几个比较夸张的数据:
- MoE 模型训练:12x 加速,35% 显存节省
- 500K 上下文:20B 模型在 80GB GPU 上训练 50 万 token 上下文
- 7x 更长上下文的 RL,新的 batching 算法
硬件支持
| 平台 | 支持情况 |
|---|---|
| NVIDIA RTX 30/40/50 | 全面支持,含 Blackwell、DGX Spark |
| macOS | 训练、MLX 推理、GGUF 推理都支持 |
| AMD | 聊天和 Data Recipes 可用,训练走 Core |
| Intel | 通过官方 Intel Guide 支持 |
| CPU | 聊天和 Data Recipes 可用 |
| 多 GPU | 已支持 |
Mac 用户注意了,Unsloth 不只是能推理,训练也支持 macOS。这在同类工具里很少见。
安装
Unsloth Studio(Web UI 版本)
macOS / Linux / WSL,一行命令:
curl -fsSL https://unsloth⋅ai/install.sh | sh
Windows PowerShell:
irm https://unsloth.ai/install.ps1 | iex
启动 Studio:
unsloth studio -p 8888
浏览器打开 http://127.0.0.1:8888 就能用了。如果在服务器上跑,加 -H 0.0.0.0 允许外部访问。
Docker 方式:
docker run -d -e JUPYTER_PASSWORD="mypassword" /
-p 8888:8888 -p 8000:8000 -p 2222:22 /
-v $(pwd)/work:/workspace/work /
--gpus all /
unsloth/unsloth
Unsloth Core(代码版本)
Linux / WSL:
curl -LsSf https://astral.sh/uv/install.sh | sh
uv venv unsloth_env --python 3.13
source unsloth_env/bin/activate
uv pip install unsloth --torch-backend=auto
Windows:
winget install -e --id Python.Python.3.13
winget install --id=astral-sh.uv -e
uv venv unsloth_env --python 3.13
./unsloth_env/Scripts/activate
uv pip install unsloth --torch-backend=auto
用的是 uv 做包管理,比 pip 快不少。
Connections:接入外部模型服务
这是 Unsloth 一个容易被忽略的能力——它不只跑本地模型,还能当"统一前端",把 OpenAI、Anthropic 的 API 和本地的 vLLM、Ollama、llama.cpp 服务全接进来。
支持的云端提供商:
| 提供商 | 能力 |
|---|---|
| OpenAI | 图片、搜索、代码、思考 |
| Anthropic | 图片、搜索、代码、思考 |
| OpenRouter | 一个 Key 访问多家模型 |
支持的本地服务器:
| 服务器 | 默认端点 |
|---|---|
| llama.cpp | http://localhost:8080/v1 |
| vLLM | http://localhost:8000/v1 |
| Ollama | http://localhost:11434/v1 |
设置路径:Settings → Connections → Add Connection,填 API Key 或 Base URL,点 Reload Models,选模型启用就行。
接入后的模型在模型选择下拉框里显示为 “Connected”(云端)或 “External”(本地服务器)。
几个细节值得注意:
- Prompt Caching:OpenAI、Anthropic、llama.cpp 都支持,长前缀重复请求时延迟和成本大幅降低
- 代码执行:OpenAI 用容器沙箱,Anthropic 用 Claude 自带的代码执行能力
- Web 搜索和思考:支持的模型可以开启搜索和思考模式
免费 Notebook
Google Colab 免费跑,不需要本地有 GPU:
| 模型 | 链接 |
|---|---|
| Gemma 4 (E2B) | Colab |
| Qwen3.5 (4B) | Colab |
| gpt-oss (20B) | Colab |
| gpt-oss GRPO | Colab |
| Qwen3 GRPO | Colab |
| Llama 3.1 (8B) | Colab |
| Orpheus-TTS (3B) | Colab |
Studio 本身也有 Colab 版本:Unsloth Studio Colab
和同类工具对比
Unsloth 的定位比较特殊——它把"推理"和"训练"放在同一个产品里。对比一下同类工具:
| 对比维度 | Unsloth | Ollama | vLLM | LLaMA-Factory |
|---|---|---|---|---|
| 推理 | ✅ | ✅ | ✅ | ❌ |
| 微调/训练 | ✅ | ❌ | ❌ | ✅ |
| Web UI | ✅ Studio | ❌ (第三方) | ❌ | ✅ |
| 显存优化 | 自研 Triton 内核 | 量化 | PagedAttention | 量化 + LoRA |
| RL/GRPO | ✅ | ❌ | ❌ | ✅ |
| 多模态训练 | ✅ | ❌ | ❌ | ✅ |
| Mac 训练 | ✅ | ❌ | ❌ | 有限 |
Ollama 胜在简单,一条命令跑模型;vLLM 胜在高并发生产部署;LLaMA-Factory 胜在训练生态成熟。Unsloth 的优势在于"训推一体"和极致的显存优化,特别适合资源有限但想自己训模型的开发者。
总结
Unsloth 从最早的"微调加速库",进化成了一个完整的大模型本地工作站。推理、训练、数据处理、模型导出,一个 Studio 全搞定。
几个突出优点:
- 显存优化激进,消费级显卡也能训中等规模模型
- Mac 训练支持,这个在同类项目里确实少见
- Studio UI 完成度很高,新手友好
- 生态集成做得好,vLLM、Ollama、OpenAI、Anthropic 全能接
不足的地方:
- Studio 还在 Beta,稳定性有待观察
- AMD GPU 的训练支持还没完全到位
- 多 GPU 支持虽然有了,但大版本升级还在路上
- Pro/Enterprise 版本需要联系销售,价格不透明
适合谁用?有一张消费级 N 卡、想自己微调模型、又不想折腾一堆环境的开发者,Unsloth 是目前综合体验最好的选择之一。
这里给大家精心整理了一份全面的AI大模型学习资源,包括:AI大模型全套学习路线图(从入门到实战)、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等,资料免费分享!
👇👇扫码免费领取全部内容👇👇
1. 成长路线图&学习规划
要学习一门新的技术,作为新手一定要先学习成长路线图,方向不对,努力白费。
这里,我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。
2. 大模型经典PDF书籍
书籍和学习文档资料是学习大模型过程中必不可少的,我们精选了一系列深入探讨大模型技术的书籍和学习文档,它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。(书籍含电子版PDF)

3. 大模型视频教程
对于很多自学或者没有基础的同学来说,书籍这些纯文字类的学习教材会觉得比较晦涩难以理解,因此,我们提供了丰富的大模型视频教程,以动态、形象的方式展示技术概念,帮助你更快、更轻松地掌握核心知识。

4. 2026行业报告
行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5. 大模型项目实战
学以致用 ,当你的理论知识积累到一定程度,就需要通过项目实战,在实际操作中检验和巩固你所学到的知识,同时为你找工作和职业发展打下坚实的基础。

6. 大模型面试题
面试不仅是技术的较量,更需要充分的准备。
在你已经掌握了大模型技术之后,就需要开始准备面试,我们将提供精心整理的大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

7. 资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇
更多推荐




所有评论(0)