MiMo-V2-Flash-Base快速上手指南:用SGLang部署你的首个3090亿参数大模型
MiMo-V2-Flash-Base快速上手指南:用SGLang部署你的首个3090亿参数大模型
MiMo-V2-Flash-Base是小米公司开发的混合专家(Mixture-of-Experts, MoE)语言模型,总参数量达3090亿,激活参数量为150亿。该模型专为高速推理和智能体工作流设计,采用创新的混合注意力架构和多token预测(Multi-Token Prediction, MTP)技术,在实现业界领先性能的同时,大幅降低了推理成本。本指南将带你快速上手使用SGLang部署这一强大模型。
🚀 为什么选择MiMo-V2-Flash-Base?
MiMo-V2-Flash-Base在保持高性能的同时,通过创新技术实现了高效推理:
-
混合注意力架构:交错使用滑动窗口注意力(SWA)和全局注意力(GA),比例为5:1,窗口大小仅128 token,KV缓存存储减少近6倍,同时通过可学习的注意力汇聚偏差(attention sink bias)保持长上下文性能。
-
多token预测(MTP):配备轻量级MTP模块(每块0.33B参数),使用密集FFN,推理时输出速度提升3倍,加速RL训练中的rollout过程。
-
高效预训练:使用FP8混合精度和原生32k序列长度在27T token上训练,上下文窗口支持高达256k长度。
-
智能体能力:通过多教师策略蒸馏(MOPD)和大规模智能体RL后训练,在SWE-Bench和复杂推理任务上实现卓越性能。
📋 准备工作
在开始部署前,请确保你的环境满足以下要求:
- 硬件:推荐至少2块NVIDIA GPU(如A100或更高),每块GPU显存不低于40GB
- 软件:
- Python 3.8+
- CUDA 11.7+
- PyTorch 2.0+
- SGLang 0.5.0+
🔧 安装步骤
1. 克隆代码仓库
首先,克隆MiMo-V2-Flash-Base项目仓库:
git clone https://gitcode.com/XiaomiMiMo/MiMo-V2-Flash-Base
cd MiMo-V2-Flash-Base
2. 安装依赖
安装SGLang及其他必要依赖:
pip install sglang
# 安装其他依赖
pip install -r requirements.txt
🚀 使用SGLang快速部署
SGLang是部署MiMo-V2-Flash-Base的推荐方式,能充分发挥模型的高性能推理能力。
启动服务
使用以下命令启动SGLang服务:
python3 -m sglang.launch_server \
--model-path ./ \
--served-model-name mimo-v2-flash \
--pp-size 1 \
--dp-size 2 \
--enable-dp-attention \
--tp-size 8 \
--moe-a2a-backend deepep \
--page-size 1 \
--host 0.0.0.0 \
--port 9001 \
--trust-remote-code \
--mem-fraction-static 0.75 \
--max-running-requests 128 \
--chunked-prefill-size 16384 \
--reasoning-parser qwen3 \
--tool-call-parser mimo \
--context-length 262144 \
--attention-backend fa3 \
--speculative-algorithm EAGLE \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--enable-mtp
参数说明:
--model-path:模型路径,本地部署时设为当前目录./--dp-size:数据并行大小,根据GPU数量调整--tp-size:张量并行大小,建议设为8以充分利用GPU资源--enable-mtp:启用多token预测功能,提升推理速度
发送请求
服务启动后,可通过curl发送请求:
curl -i http://localhost:9001/v1/chat/completions \
-H 'Content-Type:application/json' \
-d '{
"messages" : [{
"role": "user",
"content": "Nice to meet you MiMo"
}],
"model": "mimo-v2-flash",
"max_tokens": 4096,
"temperature": 0.8,
"top_p": 0.95,
"stream": true,
"chat_template_kwargs": {
"enable_thinking": true
}
}'
⚙️ 推荐配置
为获得最佳性能,建议使用以下配置:
系统提示词
强烈推荐使用以下系统提示词(选择英文或中文版本):
英文版本:
You are MiMo, an AI assistant developed by Xiaomi.
Today's date: {date} {week}. Your knowledge cutoff date is December 2024.
中文版本:
你是MiMo(中文名称也是MiMo),是小米公司研发的AI智能助手。
今天的日期:{date} {week},你的知识截止日期是2024年12月。
采样参数
推荐的采样参数设置:
top_p=0.95(所有任务)temperature=0.8(数学、写作、网页开发等创意任务)temperature=0.3(智能体任务,如编程、工具使用等需要高精度的任务)
📊 性能表现
MiMo-V2-Flash-Base在各类基准测试中表现优异,超越了许多参数量更大的模型。以下是部分关键性能指标:
- 通用能力:MMLU 86.7分,BBH 88.5分
- 数学能力:GSM8K 92.3分,MATH 71.0分
- 代码能力:HumanEval+ 70.7分,MBPP+ 71.4分
- 长上下文:在256K上下文长度下保持96.7%的准确率
🛠️ 工具使用注意事项
在多轮工具调用的思考模式中,模型会返回reasoning_content字段和tool_calls字段。要继续对话,用户必须在后续每个请求的messages数组中保留所有历史reasoning_content。
📚 进一步学习
通过以上步骤,你已经成功部署了MiMo-V2-Flash-Base模型。现在可以开始探索这个3090亿参数大模型的强大能力了!无论是复杂推理、代码生成还是智能体任务,MiMo-V2-Flash-Base都能为你提供高效且强大的AI支持。
更多推荐



所有评论(0)