MiMo-V2-Flash-Base快速上手指南:用SGLang部署你的首个3090亿参数大模型

【免费下载链接】MiMo-V2-Flash-Base MiMo-V2-Flash 是一款混合专家(Mixture-of-Experts, MoE)语言模型,总参数量达 3090 亿,激活参数量为 150 亿。该模型专为高速推理和智能体工作流设计,采用创新的混合注意力架构和多 token 预测(Multi-Token Prediction, MTP)技术,在实现业界领先性能的同时,大幅降低了推理成本。 【免费下载链接】MiMo-V2-Flash-Base 项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2-Flash-Base

MiMo-V2-Flash-Base是小米公司开发的混合专家(Mixture-of-Experts, MoE)语言模型,总参数量达3090亿,激活参数量为150亿。该模型专为高速推理和智能体工作流设计,采用创新的混合注意力架构和多token预测(Multi-Token Prediction, MTP)技术,在实现业界领先性能的同时,大幅降低了推理成本。本指南将带你快速上手使用SGLang部署这一强大模型。

🚀 为什么选择MiMo-V2-Flash-Base?

MiMo-V2-Flash-Base在保持高性能的同时,通过创新技术实现了高效推理:

  • 混合注意力架构:交错使用滑动窗口注意力(SWA)和全局注意力(GA),比例为5:1,窗口大小仅128 token,KV缓存存储减少近6倍,同时通过可学习的注意力汇聚偏差(attention sink bias)保持长上下文性能。

  • 多token预测(MTP):配备轻量级MTP模块(每块0.33B参数),使用密集FFN,推理时输出速度提升3倍,加速RL训练中的rollout过程。

  • 高效预训练:使用FP8混合精度和原生32k序列长度在27T token上训练,上下文窗口支持高达256k长度。

  • 智能体能力:通过多教师策略蒸馏(MOPD)和大规模智能体RL后训练,在SWE-Bench和复杂推理任务上实现卓越性能。

📋 准备工作

在开始部署前,请确保你的环境满足以下要求:

  • 硬件:推荐至少2块NVIDIA GPU(如A100或更高),每块GPU显存不低于40GB
  • 软件
    • Python 3.8+
    • CUDA 11.7+
    • PyTorch 2.0+
    • SGLang 0.5.0+

🔧 安装步骤

1. 克隆代码仓库

首先,克隆MiMo-V2-Flash-Base项目仓库:

git clone https://gitcode.com/XiaomiMiMo/MiMo-V2-Flash-Base
cd MiMo-V2-Flash-Base

2. 安装依赖

安装SGLang及其他必要依赖:

pip install sglang
# 安装其他依赖
pip install -r requirements.txt

🚀 使用SGLang快速部署

SGLang是部署MiMo-V2-Flash-Base的推荐方式,能充分发挥模型的高性能推理能力。

启动服务

使用以下命令启动SGLang服务:

python3 -m sglang.launch_server \
        --model-path ./ \
        --served-model-name mimo-v2-flash \
        --pp-size 1 \
        --dp-size 2 \
        --enable-dp-attention \
        --tp-size 8 \
        --moe-a2a-backend deepep \
        --page-size 1 \
        --host 0.0.0.0 \
        --port 9001 \
        --trust-remote-code \
        --mem-fraction-static 0.75 \
        --max-running-requests 128 \
        --chunked-prefill-size 16384 \
        --reasoning-parser qwen3 \
        --tool-call-parser mimo \
        --context-length 262144 \
        --attention-backend fa3 \
        --speculative-algorithm EAGLE \
        --speculative-num-steps 3 \
        --speculative-eagle-topk 1 \
        --speculative-num-draft-tokens 4 \
        --enable-mtp

参数说明:

  • --model-path:模型路径,本地部署时设为当前目录./
  • --dp-size:数据并行大小,根据GPU数量调整
  • --tp-size:张量并行大小,建议设为8以充分利用GPU资源
  • --enable-mtp:启用多token预测功能,提升推理速度

发送请求

服务启动后,可通过curl发送请求:

curl -i http://localhost:9001/v1/chat/completions \
    -H 'Content-Type:application/json' \
    -d  '{
            "messages" : [{
                "role": "user",
                "content": "Nice to meet you MiMo"
            }],
            "model": "mimo-v2-flash",
            "max_tokens": 4096,
            "temperature": 0.8,
            "top_p": 0.95,
            "stream": true,
            "chat_template_kwargs": {
                "enable_thinking": true
            }
        }'

⚙️ 推荐配置

为获得最佳性能,建议使用以下配置:

系统提示词

强烈推荐使用以下系统提示词(选择英文或中文版本):

英文版本:

You are MiMo, an AI assistant developed by Xiaomi.

Today's date: {date} {week}. Your knowledge cutoff date is December 2024.

中文版本:

你是MiMo(中文名称也是MiMo),是小米公司研发的AI智能助手。

今天的日期:{date} {week},你的知识截止日期是2024年12月。

采样参数

推荐的采样参数设置:

  • top_p=0.95(所有任务)
  • temperature=0.8(数学、写作、网页开发等创意任务)
  • temperature=0.3(智能体任务,如编程、工具使用等需要高精度的任务)

📊 性能表现

MiMo-V2-Flash-Base在各类基准测试中表现优异,超越了许多参数量更大的模型。以下是部分关键性能指标:

  • 通用能力:MMLU 86.7分,BBH 88.5分
  • 数学能力:GSM8K 92.3分,MATH 71.0分
  • 代码能力:HumanEval+ 70.7分,MBPP+ 71.4分
  • 长上下文:在256K上下文长度下保持96.7%的准确率

🛠️ 工具使用注意事项

在多轮工具调用的思考模式中,模型会返回reasoning_content字段和tool_calls字段。要继续对话,用户必须在后续每个请求的messages数组中保留所有历史reasoning_content

📚 进一步学习

通过以上步骤,你已经成功部署了MiMo-V2-Flash-Base模型。现在可以开始探索这个3090亿参数大模型的强大能力了!无论是复杂推理、代码生成还是智能体任务,MiMo-V2-Flash-Base都能为你提供高效且强大的AI支持。

【免费下载链接】MiMo-V2-Flash-Base MiMo-V2-Flash 是一款混合专家(Mixture-of-Experts, MoE)语言模型,总参数量达 3090 亿,激活参数量为 150 亿。该模型专为高速推理和智能体工作流设计,采用创新的混合注意力架构和多 token 预测(Multi-Token Prediction, MTP)技术,在实现业界领先性能的同时,大幅降低了推理成本。 【免费下载链接】MiMo-V2-Flash-Base 项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2-Flash-Base

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐